诺贝尔奖得主与专家警告 AI 数年内颠覆经济
Nobel laureates and experts warn AI could upend economy in years
⭐️ 9.0/10

16 位诺贝尔奖得主和 200 多位经济学家及 AI 研究人员签署了由斯坦福数字经济实验室组织的声明《我们必须立即行动》,警告 AI 可能带来比工业革命更剧烈的经济变革,但发生时间要短得多。 这凸显了专家们的广泛共识:AI 可能引发快速经济颠覆,需要紧急的前瞻性政策和制度调整,以避免社会动荡。 目前在 Anthropic 任职的弗吉尼亚大学经济学家 Anton Korinek 指出,蒸汽、电力和计算机各自给了社会几十年的适应时间,而 AI 可能只给几年。该声明由斯坦福人类中心 AI 研究院下属的数字经济实验室组织。

rss · The Rundown AI(@TheRundownAI) · Jul 13, 15:56

背景: 斯坦福数字经济实验室是一个多学科研究小组,研究数字技术尤其是 AI 如何改变工作、组织和经济。Anthropic 是一家专注于构建可靠 AI 系统的 AI 安全与研究公司。工业革命是巨大经济转型的历史基准,但声明强调 AI 驱动的变革可能发生得更快。

参考链接

标签: #AI, #economics, #policy, #research, #society


Hugging Face Transformers 模型可在 vLLM 中原生全速运行
Hugging Face Transformers run natively in vLLM at full speed
⭐️ 9.0/10

Hugging Face Transformers 模型现在可以在 vLLM 中以原生速度运行,通常能匹配甚至超越手动编写的推理实现,无需为训练和生产重复编写模型代码。 这一集成消除了开源 AI 推理的主要瓶颈,使新架构能更快部署并降低维护成本。单一模型实现可同时支持训练、评估和生产推理。 基准测试显示,Transformers 后端在 4B 到 235B 参数规模的模型上(包括张量并行和 MoE 配置)均匹配或超越了原生 vLLM 的吞吐量。

rss · clem 🤗(@ClementDelangue) · Jul 13, 20:18

背景: vLLM 是一款开源推理引擎,利用 PagedAttention 实现高效内存管理。以往,每种新模型架构都需要在 Hugging Face Transformers(用于训练/研究)和 vLLM(用于快速推理)中分别实现,导致重复工作和延迟。此次更新使 vLLM 能直接运行 Transformers 中定义的模型,无需重写。

参考链接

标签: #open-source, #AI inference, #vLLM, #HuggingFace, #Transformers


GPT-Live:OpenAI 全新语音 AI 体验
GPT-Live: A New Voice AI Experience from OpenAI
⭐️ 9.0/10

OpenAI 联合创始人 Greg Brockman 宣布了 GPT-Live,这是一个全新的语音 AI 模型,相比之前版本提供了显著提升的对话体验。 GPT-Live 可能重新定义人机交互,使语音助手更加自然和响应迅速,对辅导、教育和客户服务等领域产生潜在影响。 来自 Kevin Lee 的初步用户报告显示,GPT-Live 在测试高管辅导课程中专注倾听、从不打断,并在毫秒内做出回应。

rss · Greg Brockman(@gdb) · Jul 13, 22:00

背景: GPT-Live 是 ChatGPT 的高级语音模式,基于之前的语音能力,但在延迟和对话流畅性上有所增强。它旨在模拟类似人类的对话,避免了早期系统常见的机器人式停顿。

参考链接

社区讨论: Kevin Lee 将这一体验描述为“好得惊人”,比之前的语音体验“领先了光年”,具备专注倾听和快速响应的特点。

标签: #GPT-Live, #OpenAI, #AI, #language model, #announcement


OpenAI GPT-5.6 Sol、Terra、Luna 现已在 Amazon Bedrock 上线
OpenAI GPT-5.6 Sol, Terra, Luna Now on Amazon Bedrock
⭐️ 9.0/10

OpenAI 的 GPT-5.6 模型家族(包括 Sol、Terra 和 Luna)现已正式在 Amazon Bedrock 上线,这是这些模型首次通过 AWS 的托管服务提供。 此次上线将 OpenAI 最先进的 AI 模型通过 Amazon Bedrock 提供给更广泛的用户,简化了企业的部署和扩展,同时利用了 AWS 的安全性和可靠性。 Sol 是旗舰模型,Terra 适合日常工作的平衡需求,Luna 则提供更便宜、更快的选择。此次发布距离 GPT-5.5 仅两个月,反映了 OpenAI 的快速迭代。

rss · Artificial Intelligence · Jul 13, 21:01

背景: GPT-5.6 在结构上区别于以往的单一模型设计,提供了分层模型系列以满足不同使用场景。Amazon Bedrock 是 AWS 的完全托管服务,通过单一 API 提供来自领先 AI 公司的基础模型。

参考链接

标签: #OpenAI, #GPT-5.6, #Amazon Bedrock, #AI, #AWS


图灵奖得主 Rich Sutton 创办 Oak Lab,构建自主学习 AI 智能体
Rich Sutton Founds Oak Lab for Self-Learning AI Agents
⭐️ 9.0/10

2024 年图灵奖得主、现代强化学习共同创始人 Richard Sutton 在多伦多创立了名为 Oak Lab 的初创公司,旨在构建能够从环境中持续学习的 AI 智能体,并批评当前的深度学习方法“弱且低效”。 此举可能标志着 AI 研究重点的转变,Sutton 的声望和成就将吸引大量关注和资源投入强化学习与自主智能体领域,挑战深度学习的主导地位。 Oak Lab 总部设在多伦多,Sutton 特别批评深度学习方法弱且低效,主张构建通过与环境试错交互来学习的智能体。

rss · The Decoder · Jul 13, 17:15

背景: 强化学习是一种机器学习范式,智能体通过与环境的交互来学习决策,以最大化累计奖励,与使用标注数据的监督学习形成对比。Sutton 因开创性 RL 算法(如 TD-Gammon)以及对时序差分学习理论基础的贡献而广受认可。

参考链接

标签: #AI, #reinforcement learning, #Rich Sutton, #startup, #agents


无需打开 Xcode,用命令行构建苹果应用
Building Apple apps without Xcode using CLI tools
⭐️ 8.0/10

一位开发者详细介绍了如何完全通过命令行使用 xcodebuild 和 fastlane 构建并发布 Mac 和 iOS 应用,完全绕过 Xcode 图形界面。 这种工作流程实现了自动化、CI/CD 集成,并减少了对 Xcode 的依赖,对 DevOps 和基于 LLM 的编码代理至关重要。同时,它也引发了关于授予代理本地访问权限时安全性权衡的讨论。 该方法依赖 xcodebuild 进行编译,fastlane 进行代码签名和 App Store 上传。安全问题在于构建代理必须在沙箱外运行,可能暴露敏感数据如 SSH 密钥。

hackernews · speckx · Jul 13, 18:22 · 社区讨论

背景: xcodebuild 是苹果用于构建 Xcode 项目的命令行工具。fastlane 是一个流行的第三方自动化工具,简化了测试版部署和 App Store 发布。传统上,开发者使用 Xcode 的图形界面来构建和提交应用到 App Store。

参考链接

社区讨论: 评论者反应不一:一些人称赞这种方法使基于 Linux 的 iOS 开发成为可能(使用 xtool),而另一些人则对授予代理本地访问权限表示严重的安全担忧,并提到了 xAI 数据泄露事件。还有用户指出,Mac 的高昂价格将一些开发者排除在 iOS 开发之外。

标签: #iOS, #macOS, #Xcode, #CI/CD, #DevOps


苹果 SpeechAnalyzer API 基准测试:速度更快但准确度略逊于 Whisper
Apple's SpeechAnalyzer API Benchmarked: Faster but Less Accurate than Whisper
⭐️ 8.0/10

苹果于 2024 年 4 月推出的新 SpeechAnalyzer API 与 OpenAI 的 Whisper 及苹果旧版 SFSpeechRecognizer 进行了基准测试。结果显示,SpeechAnalyzer 是测试中最准确的设备端语音引擎,在干净和嘈杂语音上均击败 Whisper Small,速度提升三倍,但准确度略逊于更大的 Whisper 模型。 该基准测试为开发者在选择语音识别 API 时提供了关键性能数据,尤其适用于设备端转录。苹果的入局可能颠覆当前众多围绕 Whisper 构建的付费转录应用市场,因为苹果可能会推出原生的 macOS 录音应用。 基准测试在 MacBook Air M3 上进行,使用 LibriSpeech 数据集,比较词错误率(WER)和转录速度。SpeechAnalyzer 在干净语音上 WER 为 5.4%,嘈杂语音为 11.2%,而 Whisper Small 分别为 5.9%和 12.4%,但 SpeechAnalyzer 运行速度为实时 8.5 倍,而 Whisper Small 为实时 3 倍。

hackernews · get-inscribe · Jul 13, 16:06 · 社区讨论

背景: SpeechAnalyzer 是苹果在 2024 年 4 月推出的新 API,用于设备端语音识别,属于 Speech 框架的一部分。Whisper 是 OpenAI 的开源自动语音识别(ASR)系统,基于 68 万小时多语言数据训练,以其鲁棒性著称。其前身 SFSpeechRecognizer 是苹果的旧版 API,在准确性上落后。

参考链接

社区讨论: 社区评论指出,Whisper 并非最先进的基线模型;Nvidia 的 Nemotron 和 Parakeet、Mistral 的 Voxtral 以及 Cohere Transcribe 等模型更适合作为比较对象。有用户报告称,在数学讲座等特定场景下,SpeechAnalyzer 速度明显更快,仅稍逊一筹,因此适用于实时转录。其他人预测,苹果的原生支持将使许多基于 Whisper 的应用过时。

标签: #Apple, #Speech Recognition, #Whisper, #API, #Benchmark


Telegram 的 t.me 域名被暂停,导致大规模服务中断
Telegram's t.me Domain Suspended, Causing Widespread Outages
⭐️ 8.0/10

Telegram 的关键域名 t.me 被设置为 ServerHold 状态,导致该域名无法解析,所有 t.me 链接在全球范围内失效。 此次暂停中断了 Telegram 的链接分享基础设施,影响了数百万用户,并引发了对该消息平台可能面临法律或监管行动的担忧。 该域名显示为 ServerHold 状态,这是 ICANN 的一种不常见状态码,通常在法律纠纷或域名面临删除时被应用。据报道,Telegram 使用 GoDaddy 作为其域名注册商。

hackernews · Tiberium · Jul 13, 19:52 · 社区讨论

背景: 域名暂停是指注册商将域名置于保留状态,通常是由于政策违规、法律纠纷或未验证联系信息。ICANN 的《统一域名争议解决政策》(UDRP)为解决商标相关争议提供了框架。在此案例中,Telegram 面临俄罗斯、法国和印度的调查,这可能与暂停有关。

参考链接

社区讨论: 社区评论对 Telegram 依赖以缺乏透明度闻名的 GoDaddy 注册商表示惊讶,并推测此次暂停可能与印度调查有关,因其最近发生且具有财政影响力。一位用户提到已将重定向作为预防措施。

标签: #telegram, #domain suspension, #ICANN, #governance, #news


三星健康:退出 AI 训练即删除数据
Samsung Health deletes data if AI training opt-out
⭐️ 8.0/10

三星健康宣布,如果用户选择退出将其健康数据用于 AI 训练,应用程序将删除这些数据,而不是在本地保存。 这一政策迫使用户在允许 AI 训练和丢失个人健康数据之间做出选择,引发了严重的隐私和用户自主权问题。 受影响的数据类别包括睡眠、药物、医疗记录和周期跟踪;拒绝同意的用户必须接受这些敏感数据的完全删除。

hackernews · bundie · Jul 13, 20:01 · 社区讨论

背景: 健康数据高度敏感,通常存储在设备本地。AI 训练需要大量数据集,但用户即使拒绝分享也应保留对自己数据的控制权。三星的做法不同寻常,被视为具有胁迫性。

社区讨论: 评论者表达了愤怒,有人讽刺地欢迎数据删除作为隐私胜利。其他人批评该应用的质量和缺乏数据导出功能,指出购买设备不应要求放弃隐私。

标签: #privacy, #Samsung, #AI training, #health data, #user rights


前 NOAA 员工推出 Climate.us 以保护气候数据
Former NOAA Staff Launch Climate.us to Preserve Climate Data
⭐️ 8.0/10

前美国国家海洋和大气管理局(NOAA)的员工推出了 Climate.us,这是一个非营利网站,用于保存并提供此前政府 Climate.gov 网站上的气候数据和资源。 这一举措确保由纳税人资助的气候数据能够持续公开访问,尤其是在政治不确定或预算削减时期。它支持气候素养,并为社区和研究人员提供知情决策依据。 Climate.us 由非营利组织 Multiplier(享有 501(c)(3)免税资格)运营,专注于永久保存 Climate.gov 的历史内容以供公众访问。该网站依赖捐款维持运营。

hackernews · benwerd · Jul 13, 19:57 · 社区讨论

背景: NOAA 的 Climate.gov 长期以来一直是美国气候数据的主要来源,但由于担心在不同政府更迭下数据可能被删除或限制,前员工创建了一个独立档案。该项目旨在确保气候信息对公众免费开放。

参考链接

社区讨论: 评论者对保存公共数据表示赞赏,有人认为政府发布的数据应自动属于公共领域。也有人对该网站的长期资金表示担忧,并建议使用 IPFS 等去中心化存档作为更稳健的解决方案。

标签: #climate data, #open data, #government transparency, #data preservation, #environmental tech


DOOMQL:完全由 SQLite 驱动的类 Doom 游戏
DOOMQL: Doom-like game powered entirely by SQLite
⭐️ 8.0/10

Peter Gostev 创建了 DOOMQL,一个类 Doom 的第一人称射击游戏,其中 SQLite 充当游戏引擎,通过 SQL 查询处理移动、碰撞、敌人、战斗和渲染。该项目使用 OpenAI 的 GPT-5.6 Sol 模型构建,该模型贡献了代码逻辑。 该项目展示了一个非传统且富有创意的集成:将关系数据库用作实时游戏引擎,挑战了专用游戏引擎的典型用法。它凸显了 SQLite 的递归 CTE 在复杂计算中的能力,并展示了大型语言模型如何辅助创新软件开发。 该游戏是一个 Python 终端脚本,创建一个 SQLite 数据库来存储所有游戏状态,并包含一个完整的射线追踪器,该追踪器由单个巨大的 SQL 查询通过递归 CTE 实现。玩家可以在本地运行游戏,甚至可以使用 Datasette 探索实时数据库,Simon Willison 构建了一个 HTML+JS 应用,该应用从 SQL 查询渲染游戏视图和战术地图。

rss · Simon Willison · Jul 13, 22:34

背景: SQLite 是一个轻量级的嵌入式关系数据库管理系统。递归公共表表达式(CTE)允许 SQL 查询执行迭代计算,从而直接在 SQL 中实现类似射线追踪的复杂算法。GPT-5.6 Sol 是 OpenAI 最新的前沿模型,于 2026 年 7 月发布,具有增强的编码和推理能力。

参考链接

标签: #sqlite, #game development, #python, #creative coding, #ai-assisted


纳德拉:企业面临 AI 时代的‘反向信息悖论’
Satya Nadella: Firms face a 'Reverse Information Paradox' with AI
⭐️ 8.0/10

微软 CEO 萨提亚·纳德拉警告,企业在使用 AI 时需支付双重成本:一次用于模型调用,另一次通过贡献内部专有知识,他称之为‘反向信息悖论’。 这一观点挑战了当前的 AI 商业模式,即企业可能在不知不觉中牺牲难以复制的专业知识,从而削弱自身竞争优势,同时使 AI 提供商受益。 纳德拉引用了肯尼斯·阿罗的经典信息悖论:买家在看到信息之前无法知道其价值,但一旦看到,就已经获得了它。在 AI 语境中,企业支付推理费用后,还需提供独特的内部数据来定制模型,从而产生了未计入的第二笔成本。

rss · 小互(@imxiaohu) · Jul 13, 08:14

背景: 肯尼斯·阿罗的信息悖论描述了出售信息的困难:信息的价值只有在揭示之后才为人所知,但揭示又破坏了卖方的优势。纳德拉的‘反向信息悖论’将其反转:企业付费使用 AI,然后必须贡献自己的知识——这使得它们既是信息的买家又是卖家,且往往没有明确的补偿。

参考链接

标签: #AI, #企业知识, #商业模式, #成本, #纳德拉


谷歌云将 AI 模型集成到 AlloyDB 中实现语义搜索
Google Cloud Integrates AI into AlloyDB for Semantic Search
⭐️ 8.0/10

谷歌云将 Gemini AI 模型直接集成到 AlloyDB 数据库中作为 SQL 函数,实现了速度比传统方法快 2.3 万倍的语义搜索。 这一突破使数据库能够按含义而非精确匹配进行查询,消除了对单独 AI 管线的需求,大大降低了数据分析的复杂性和延迟。 该集成使用 Gemini AI 模型创建可在标准 SQL 查询中调用的 AI 函数,实现语义搜索、结构化查询和 AI 判断在同一数据库层内完成。

rss · 小互(@imxiaohu) · Jul 13, 06:01

背景: 传统数据库仅支持字面匹配,难以根据含义进行查询,例如在差评中查找抱怨‘电池’的内容。语义搜索利用 AI 理解查询意图,提供更相关的结果。AlloyDB 是 Google Cloud 提供的全托管、兼容 PostgreSQL 的数据库服务,具有高性能。此次更新将 AI 驱动的语义搜索直接集成到数据库引擎中。

参考链接

标签: #Google Cloud, #AlloyDB, #AI, #Database, #Semantic Search


单人 4 个月构建全自动 App 生产线
Solo Dev Builds Full Auto App Pipeline in 4 Months
⭐️ 8.0/10

一位开发者独自创建了完整的自动化 App 生产流水线,涵盖从 App Store 数据采集、创意生成到自动上架发布甚至展示拒审理由,将 App 开发周期缩短至一周。 这展示了 AI 时代“超级个体”的崛起,一个人通过自动化和 AI 可以替代整个团队,极大降低 App 生产门槛并加速创新。 该流水线包含数据归因看板,展示 ARPU、LTV 和同期群留存分析,并通过自动录屏生成广告素材。开发者独自复刻了 CapCut 手机版。

rss · Yangyi(@Yangyixxxx) · Jul 13, 09:45

背景: App 开发通常需要产品经理、设计师、开发者、测试和运营等多个角色。App Store 提交流程涉及人工审核,可能导致延迟。结合数据驱动创意生成和持续部署的自动化流水线很少见,尤其由单人完成。

参考链接

标签: #App Development, #Automation, #Super Individual, #AI, #DevOps


GPT-5.6 Sol 在 Agent Arena 中排名第二,可操控性提升
GPT-5.6 Sol Ranks #2 in Agent Arena with Steerability Gains
⭐️ 8.0/10

GPT-5.6 Sol 在 Agent Arena 基准测试中整体排名第二,整体提升 10.9%,其中可操控性提升 17.3%,任务成功确认率提升 10.9%。 这展示了 AI 智能体能力的显著进步,尤其是对实际部署至关重要的可操控性。这表明新模型在遵循用户意图和可靠完成任务方面表现更佳。 该模型在可操控性方面排名第一(+17.3%),在任务成功确认率方面排名第二(+10.9%),在工具幻觉方面排名第二(+1.3%)。然而,在 bash 恢复方面仅排名第 14(+7.5%),表明不同子任务表现不均衡。

rss · Arena.ai(@lmarena_ai) · Jul 13, 16:44

背景: Agent Arena 是一个自主 AI 智能体的竞争性基准测试平台,在工具编排等实际任务中对其进行测试。可操控性指的是根据人类意图控制和引导 AI 行为的能力。工具幻觉则发生在 LLM 错误地调用工具或生成工具调用时。

参考链接

标签: #GPT-5.6, #Agent Arena, #AI Benchmark, #Steerability, #NLP


OpenAI 最新提示词指南覆盖 Chat、Work、Codex
OpenAI's New Prompt Guide Covers Chat, Work, Codex
⭐️ 8.0/10

OpenAI 发布了官方提示词指南,覆盖 Chat、ChatGPT Work 和 Codex 三个场景,提出了四要素框架(目标、上下文、输出、边界),并从控制过程转向描述结果。 该指南为提示工程提供了实用且经过专家验证的建议,帮助用户从 OpenAI 模型中获得更好的结果。它反映了一种成熟的方法论,可以提升各种使用场景的效率。 指南强调边界要少而准、上下文要筛选而非堆料、说明用途而非格式、首个提示不必完美。还包含 Codex 的具体工作流,如通过可复现步骤修 Bug、云端委托重构等。

rss · meng shao(@shao__meng) · Jul 13, 11:27

背景: 提示工程是设计输入以从大语言模型获得期望输出的实践。OpenAI Codex 是专门用于代码生成的模型,可通过 CLI 或 IDE 插件使用。RepoPrompt 是一个上下文工程工具,其创建者现在 OpenAI Codex DX 团队工作。

参考链接

社区讨论: 推文作者指出,在 5.6 Sol 模型下,许多用户仍使用与 5.5 相同的提示方式,忽略了模型更强韧和彻底的特性。这表明新指南对于适应新模型非常及时。

标签: #prompt engineering, #OpenAI, #ChatGPT, #Codex, #LLM


用 SQLite 递归 CTE 实现的光线追踪器
Ray tracer implemented as SQLite recursive CTE
⭐️ 8.0/10

一位开发者使用 SQLite 递归 CTE 实现了光线追踪器,将渲染状态存储在磁盘上,允许其他工具实时查询。此外,另一个名为 DOOMQL 的项目用超过 2000 行 SQL 构建了一个完整的类 Doom 游戏引擎,包括光线投射和游戏逻辑。 这展示了 SQL 数据库在处理光线追踪等计算密集型任务时令人惊讶的能力和灵活性,挑战了数据库使用的传统边界。它为完全在 SQL 中构建交互式实时应用开辟了可能性,可能简化技术栈依赖。 光线追踪器使用递归 CTE 模拟光线路径,每帧状态保存在 SQLite 数据库文件中;一个自定义 HTML+JS 查看器添加了小地图。DOOMQL 引擎在 SQL 中完成每帧的光线投射、像素编码,以及控制、AI 和碰撞处理,Python 仅用于连接 SQLite 与输入输出。

rss · Simon Willison(@simonw) · Jul 13, 22:36

背景: 递归 CTE 是 SQL 的一种特性,允许查询引用自身输出,从而实现层次或图数据的迭代。SQLite 是一个自包含、无服务器的数据库引擎,广泛用于嵌入式和移动应用。光线追踪是一种通过模拟光线路径生成图像的渲染技术;在 SQL 中实现它非常非传统。

参考链接

标签: #SQLite, #ray tracing, #recursive CTE, #creative coding, #database


为自己而非想象的用户而建
Build for Yourself, Not Imaginary Users
⭐️ 8.0/10

Paul Graham 在推文中指出,年轻创业者最大的错误是构建自以为人们需要的产品,而解决方法是为自己打造产品。 这一建议直接针对缺乏产品市场契合度的常见陷阱,提供了一种实用的、以自我为参考的方法,可提高成功几率。 Graham 对比了两种方法:研究他人需求与利用自身的唯我主义来构建自己真正需要的东西——他称此为克服错误的'捷径'。

rss · Paul Graham(@paulg) · Jul 13, 18:04

背景: Paul Graham 是著名企业家、风险投资家,也是创业加速器 Y Combinator 的联合创始人。他的这条推文浓缩了其关于创业战略文章中的核心观点:最好的产品往往来自创始人解决自身痛点的需求。

标签: #entrepreneurship, #startup advice, #product-market fit, #Paul Graham, #founder mistakes


LangChain 安全代理基础设施的四个要求
LangChain's 4 Requirements for Secure Agent Infrastructure
⭐️ 8.0/10

LangChain 发布了一条推文,概述了面向生产环境的可靠安全代理执行基础设施的四个关键要求,包括安全执行不受信任的代码、控制凭据和资源、提供运行可见性以及支持快速迭代和可复现环境。 随着 AI 代理在生产系统中日益普及,明确的安全执行基础设施指南对于防止安全漏洞和确保可靠性至关重要,这使得该内容对 AI 基础设施社区具有及时的意义。 四个要求包括:安全执行不受信任的代码、控制凭据和资源、让团队了解运行内容和访问内容,以及通过可复现环境支持快速迭代。

rss · LangChain(@LangChainAI) · Jul 13, 19:15

背景: AI 代理是能够执行任务的自主软件程序,通常使用外部工具和代码。要在生产环境中运行此类代理,基础设施必须处理不受信任的代码执行,同时不损害安全性或稳定性。LangChain 是构建基于 LLM 的代理的领先框架,其指导反映了安全部署的行业最佳实践。

标签: #AI agents, #infrastructure, #security, #production, #LangChain


Claude 的价值观因模型和语言而异,Anthropic 研究发现
Claude's values shift by model and language, Anthropic study finds
⭐️ 8.0/10

Anthropic 分析了 309,815 次用户与 Claude 的对话,发现 Claude 表达的价值观因模型版本(如 Sonnet 4.6 vs Opus 4.7)和用户使用的语言而异,公司表示这些变化并非有意为之。 这项研究揭示了 AI 对齐中的一个重大挑战:跨模型和语言的意外行为变异可能导致对用户的不一致或偏见对待,损害已部署 AI 系统的信任和安全性。 Sonnet 4.6 倾向于更温暖简洁,Opus 4.7 更坦率谨慎,而 Opus 4.6 直奔主题。不同语言中,印地语和阿拉伯语得到最温暖回应,英语和俄语最严谨,荷兰语 Claude 最容易承认自身错误。

rss · The Rundown AI(@TheRundownAI) · Jul 13, 19:39

背景: Claude 是 Anthropic 开发的一系列大型语言模型,训练目标为安全有益。AI 对齐是确保 AI 系统行为符合人类意图和价值观的研究领域。这项研究表明,即使经过精心训练,模型行为在不同版本和语言之间仍会出现细微差异,可能与预期价值观不一致。

参考链接

标签: #AI alignment, #Claude, #Anthropic, #LLM behavior, #language bias


Lilian Weng 撰文探讨 AI 通过外壳实现递归自我改进
Lilian Weng's Article on AI Recursive Self-Improvement via Harness
⭐️ 8.0/10

Lilian Weng 发表了一篇详尽文章,解释 AI 系统如何通过修改自己的“外壳”(即支撑 AI 代理的外部软件基础设施)来实现递归自我改进。这被认为是目前关于 AGI 自我提升最严谨的公开讨论之一。 这项工作直接探讨了潜在智能爆炸背后的核心机制,对 AI 安全与对齐至关重要。理解 AI 如何在没有人类干预的情况下迭代自我增强,对于预测未来风险并制定防护措施十分关键。 据报道,Weng 的文章需 28 分钟阅读,表明内容非常全面。“外壳”指的是 AI 代理用于执行任务的外部环境和基础设施,代理可以重新设计它以在多个循环中提升性能。

rss · AI Will(@FinanceYF5) · Jul 13, 02:32

背景: 递归自我改进(RSI)是指 AI 系统反复提升自身能力的过程,可能导致超级智能的出现。这一概念是“智能爆炸”讨论的核心,并引发重大安全担忧。Lilian Weng 是 OpenAI 的知名 AI 研究员,经常撰文探讨 AI 对齐与能力。

参考链接

社区讨论: 该推文有 3 条评论,但未提供评论内容。有限的互动表明该话题仍属小众,但高阅读量显示了浓厚兴趣。

标签: #AI safety, #recursive self-improvement, #AI alignment, #machine learning, #research


萨顿和马库斯:深度学习需要根本性反思
Sutton and Marcus: Deep Learning Needs Fundamental Rethinking
⭐️ 8.0/10

强化学习先驱理查德·萨顿公开同意加里·马库斯的观点,认为当前的深度学习方法薄弱且低效,需要根本性的新想法,而不仅仅是渐进式调整。马库斯称这是一个地震性时刻,并提到他 2018 年的论文《深度学习:批判性评估》曾遭到杨立昆的批评。 两位有影响力的人工智能研究者的高调一致表明,人们越来越认识到仅靠深度学习可能不足以实现高级人工智能,这可能会引导研究方向和资金。这可能会加剧关于该领域是否需要范式转变的辩论。 加里·马库斯 2018 年的论文指出了深度学习的十个挑战,包括数据效率、鲁棒性和推理。萨顿的‘苦涩教训’认为,用简单方法扩展计算能力胜过人工设计的知识。

rss · Gary Marcus(@GaryMarcus) · Jul 13, 15:14

背景: ‘苦涩教训’是理查德·萨顿的一篇文章,指出利用计算能力的通用方法(如搜索和学习)最终胜过人工设计的知识。认知科学家加里·马库斯长期以来一直认为深度学习存在根本性局限,需要与符号推理结合。这一交流凸显了人工智能领域中‘规模即一切’和‘我们需要新想法’两个阵营之间的持续张力。

参考链接

标签: #deep learning, #AI criticism, #Gary Marcus, #Richard Sutton, #AI debate


Gemma 4 技术报告揭示 pp-RoPE 和推测解码优化
Gemma 4 technical report reveals pp-RoPE and speculative decoding optimizations
⭐️ 8.0/10

Google 发布了 Gemma 4 技术报告,详细介绍了内存和推理优化,例如采用 5:1 的局部到全局注意力比例与 pp-RoPE 以减少 KV 缓存占用,以及使用带有多个令牌预测草稿模型的推测解码。 这些优化显著提高了大型语言模型推理的效率,使 Gemma 系列模型能够更快、更节省内存地部署。这些技术,尤其是推测解码,对于降低生产级 LLM 的延迟具有广泛的适用性。 报告介绍了 pp-RoPE(一种旋转位置嵌入的变体)以及 5:1 的局部到全局注意力头比例,以缩小 KV 缓存。推测解码与多令牌预测(MTP)草稿模型结合使用,每一步生成多个令牌,同时保持输出质量。

rss · Philipp Schmid(@_philschmid) · Jul 13, 14:25

背景: 像 Gemma 这样的大型语言模型采用自回归解码,一次生成一个令牌,这限制了推理速度,并且需要大量内存来存储 KV 缓存。旋转位置嵌入(RoPE)是一种在注意力机制中编码位置信息的常见方法。推测解码通过使用较小的草稿模型提出多个令牌,再由较大模型并行验证,从而加速推理,在不改变输出分布的情况下有效降低延迟。

参考链接

标签: #Gemma, #LLM, #Technical Report, #Machine Learning, #Inference Optimization


开放权重模型在生成式 AI 流量中占比跃升至 29%
Open-weight models surge to 29% of production AI traffic
⭐️ 8.0/10

根据 Vercel 的数据,开放权重模型在其平台上处理的网关令牌占比已从 2025 年 4 月的 11%上升至 29%。 这一快速采用趋势标志着生产级 AI 向开放权重模型的重大转变,此类模型提供透明性和自定义能力,对专有封闭模型构成挑战。 开放权重模型将其参数公开,支持微调和可复现性。该数据来自 Vercel 的 AI 网关,该网关充当 API 令牌使用量的代理。

rss · Guillermo Rauch(@rauchg) · Jul 13, 17:01

背景: 开放权重模型与开源模型不同,它们仅提供训练好的权重,而非完整代码或训练数据。网关令牌是指通过 Vercel 等 AI 推理网关处理的 API 调用,这些网关将请求路由到不同的模型提供商并衡量令牌消耗量。

参考链接

标签: #open-weight models, #AI infrastructure, #production AI, #machine learning trends


视频生成模型作为通用视觉学习器
Video Generation Models as General-Purpose Vision Learners
⭐️ 8.0/10

一种名为 GenCeption 的新框架提出利用视频生成模型作为视觉生成预训练,使其能够作为通用视觉学习器,应用于密集和稀疏视觉任务。 这种方法可能将多样化的视觉任务统一在单个模型下,类似于下一个标记预测催生了通用语言模型,有望彻底改变计算机视觉研究和应用。 GenCeption 将文本到视频生成模型重新用于密集任务,通过在潜在空间中应用监督,并为稀疏任务添加可学习标记,全部基于扩散变压器(DiT)的统一架构。

rss · AK(@_akhaliq) · Jul 13, 17:56

背景: 在自然语言处理中,下一个标记预测使得大型语言模型无需特定任务架构就能处理多种任务。GenCeption 旨在通过使用视频生成作为预训练目标,利用从生成视频中学到的丰富时空表示,为计算机视觉带来类似的范式转变。

参考链接

标签: #video generation, #vision learning, #AI, #machine learning


Sol Ultra 解决 Erdős 问题,标志 AI 数学突破
Sol Ultra Solves Erdős Problems, Signaling AI Math Breakthrough
⭐️ 8.0/10

OpenAI 联合创始人 Greg Brockman 发推称,Sol Ultra(GPT-5.6 Sol Ultra)已解决多个 Erdős 问题,包括关于 2-本原集渐近性的第 #793 号问题。 这表明先进 AI 模型能够解决 Paul Erdős 提出的高难度数学问题,可能加速数学发现并重塑研究方式。 第 #793 号问题的解决方案包含一个极短且优雅的构造,增强了 Erdős 用于证明较弱结果的原始方法。这是 Sol Ultra 在短时间内解决的第二个 Erdős 问题。

rss · Greg Brockman(@gdb) · Jul 13, 22:43

背景: Erdős 问题是多产数学家 Paul Erdős 提出的 1100 多个数学猜想和开放问题的集合。解决这些问题被视为数学上的重大成就。GPT-5.6 Sol Ultra 是 OpenAI 的下一代 AI 模型,于 2026 年 6 月预览,在编程、科学和问题解决方面有更强能力。

参考链接

标签: #AI, #Mathematics, #Problem Solving, #OpenAI


DoorDash 的 AI 购物助手融合 LLM、智能体、MCP 和记忆层
DoorDash's AI Shopping Assistant Blends LLM, Agents, MCP, and Memory
⭐️ 8.0/10

DoorDash 推出了 'Ask DoorDash',这是一款 AI 驱动的对话式购物助手,结合了 LLM、专用 AI 智能体、基于 MCP 的工具以及持久记忆层,使结账转化率提高了 24%,购物篮大小增加了 17%。 这种混合架构表明,仅依赖 LLM 无法满足实际电商 AI 需求;结合结构化智能体、工具集成和记忆层可以带来可衡量的业务影响。它为在生产环境中构建稳健的 AI 助手树立了新标杆。 该助手使用模型上下文协议(MCP)连接实时数据源和服务,同时借助持久记忆层跨会话存储用户偏好和历史记录。早期结果还显示,基于记忆的会话提高了意图识别准确率。

rss · InfoQ · Jul 13, 14:08

背景: 对话式 AI 助手通常难以保持上下文和访问实时数据。MCP(模型上下文协议)为 AI 模型与外部工具和 API 交互提供了通用接口,支持实时操作和数据检索。持久记忆层使助手能够跨会话记住用户交互,减少冗余上下文并提升响应相关性。

参考链接

标签: #AI, #DoorDash, #LLM, #E-commerce, #Architecture


公共部门 22 秒勒索软件交接
22-Second Ransomware Hand-Off in Public Sector
⭐️ 8.0/10

Mandiant 发布的 2026 年公共部门 M-Trends 报告显示,从初始访问到勒索软件操作员交接的中位时间仅为 22 秒,攻击周期被压缩至机器速度。 这种极端的威胁压缩使得传统的人工速度安全分类变得过时,迫使公共部门机构采用机器速度的防御措施,以避免灾难性入侵。 报告还强调了新兴攻击向量:国家资助行为者的多年持续入侵(长达 5 年)、虚拟化堆栈攻击(如快照挂载)、通过非人类身份触发的 SaaS 多米诺效应,以及语音钓鱼激增至全球感染的 11%。

rss · Cloud Blog · Jul 13, 16:00

背景: M-Trends 是 Mandiant(Google Cloud 旗下)发布的年度网络安全报告,基于超过 50 万小时的事件响应调查。初始访问代理是专门入侵网络并将访问权限出售给勒索软件操作员的网络犯罪分子,促成了所述的交接。“22 秒交接”指的是初始访问代理建立据点后,将控制权移交给勒索软件操作员的中位时间。

参考链接

标签: #cybersecurity, #public sector, #M-Trends, #ransomware, #cloud security


微软副总裁揭秘企业级 AI 代理部署策略
Microsoft VP Reveals Strategies for Enterprise AI Agent Deployment
⭐️ 8.0/10

微软副总裁 Marco Casalaina 在 ByteByteGo 的采访中分享了关于企业级 AI 代理扩展部署的挑战和策略。 随着企业越来越多地采用 AI 代理,微软的实践经验为可靠、高效地扩展这些系统提供了实用指导。 讨论涵盖编排、对齐和系统集成挑战,强调生产就绪性而非单纯的 AI 能力。

rss · ByteByteGo Newsletter · Jul 13, 15:02

背景: AI 代理是自主执行用户任务的系统,但在企业级部署时需要解决编排、安全和集成复杂性。微软 Core AI 部门致力于统一 AI 计划,推动企业转型。

参考链接

标签: #AI agents, #enterprise, #Microsoft, #scalability, #engineering


JetBrains 为 VS Code 和 Cursor 推出 .NET 调试器
Debugger for .NET in VS Code and Cursor Released by JetBrains
⭐️ 8.0/10

JetBrains 发布了 ReSharper 扩展在 VS Code 和 Cursor 中的第一个调试器版本,满足了 .NET 开发者社区的头号需求。 这填补了使用 VS Code 或 Cursor 的 .NET 开发者的关键空白,基于成熟 Rider 调试引擎提供高质量调试体验,有望显著提升生产效率并促进 JetBrains 工具在非 IDE 环境中的采用。 该调试器基于与 JetBrains Rider 相同的核心引擎,确保可靠性和功能对等。2026.2 版本为首个版本,预计后续会有进一步优化。

rss · The JetBrains Blog · Jul 13, 10:39

背景: Cursor 是一款 AI 驱动的代码编辑器,而 VS Code 是微软推出的流行免费代码编辑器。JetBrains ReSharper 是针对 .NET 开发者的生产力扩展。此前,ReSharper 在 VS Code/Cursor 的扩展中不支持调试,这是一个主要的功能缺失。

参考链接

标签: #.NET, #debugging, #ReSharper, #VS Code, #JetBrains


Android Remote Control MCP v1.9.0 增加跨平台支持
Android Remote Control MCP v1.9.0 Adds Cross-Platform Support
⭐️ 8.0/10

Android Remote Control MCP 服务器 v1.9.0 现已正式支持 ChatGPT 及 Claude,实现 OAuth 2.1 安全认证,并通过实时无障碍快照改进了浏览器和 WebView 的处理。 此次更新将基于 Android 的 AI 代理自动化从仅支持 Claude 扩展到 ChatGPT 用户,使其成为希望将手机任务委托给 AI 的通用工具,同时增加了企业级认证和更可靠的网页交互。 跨平台支持已通过 ChatGPT 开发者模式自定义连接器测试和验证;OAuth 2.1 实现安全一键电话批准,无需复制令牌。压缩层将复杂页面的令牌消耗从约 100k 降至约 40k,浏览器视图现在正确刷新,不再显示冻结。

rss · r/ClaudeAI · Jul 13, 17:15

背景: 模型上下文协议(MCP)是 Anthropic 于 2024 年 11 月推出的开放标准,规范了 AI 系统(如大型语言模型)如何连接外部工具和数据源。OAuth 2.1 是授权框架的更新版本,相比 OAuth 2.0 简化并加强了安全性。Ngrok 和 Cloudflare 提供安全隧道,将本地服务暴露到互联网,便于远程访问。

参考链接

标签: #Android, #MCP, #AI agents, #Remote control, #ChatGPT


纳德拉指责 OpenAI 和 Anthropic 禁止蒸馏却用他人数据训练
Nadella Accuses OpenAI, Anthropic of Hypocrisy Over Distillation Bans
⭐️ 8.0/10

微软 CEO 萨提亚·纳德拉批评 OpenAI 和 Anthropic 等 AI 实验室存在“逆向信息悖论”:它们基于合理使用原则利用公共数据训练模型,却禁止他人对自己的模型进行蒸馏,同时还在从客户交互中学习。 这凸显了 AI 领域日益严重的伦理与商业困境:企业从开放数据中获益,却限制他人访问自己的模型,可能抑制竞争与创新。纳德拉的言论可能影响行业规范及围绕数据使用和模型蒸馏的监管讨论。 纳德拉特别批评了禁止蒸馏(将知识从大模型转移到小模型的技术)的做法,同时却在利用用户提示、修正和代理交互中的“排泄”数据进行训练。他提议企业应控制自己的学习基础设施,而微软正销售此类产品。

rss · The Decoder · Jul 13, 14:28

背景: 模型蒸馏(或知识蒸馏)是一种机器学习技术,将大模型的知识转移到更小、更高效的模型中,通常用于降低计算成本。包括 OpenAI 和 Anthropic 在内的许多 AI 公司通过服务条款限制对其模型的蒸馏。与此同时,它们利用大量公共网络数据进行训练,并常主张合理使用。纳德拉的“逆向信息悖论”正是指这种不对称:企业自由获取数据,却只提供受限制的模型访问。

参考链接

社区讨论: 纳德拉在 X 上的帖子引发了 AI 领袖们的反应。部分高管认同他对企业可能失去专有知识的担忧,而另一些人则认为现有的数据使用政策等保护措施已经解决了这一问题。关于 AI 对知识产权和数据控制影响的讨论仍在继续。

标签: #AI, #Ethics, #OpenAI, #Microsoft, #Data


谷歌 SensorFM:可穿戴健康数据的基础模型
Google’s SensorFM: Foundation model for wearable health data
⭐️ 8.0/10

谷歌研究院推出了 SensorFM,这是一个基于 500 万 Fitbit 和 Pixel Watch 用户超过一万亿分钟传感器数据训练的基础模型。它在 35 项健康和行为任务中 34 项达到了最先进水平。 SensorFM 可能成为可穿戴设备的通用健康智能层,为谷歌未来的 AI 健康教练提供动力。它展示了大规模无标签传感器数据在理解人类健康方面的价值。 该模型在来自 500 万参与者的无标签多模态传感器数据上进行了预训练。谷歌尚未宣布任何集成计划,该论文于 2025 年 5 月首次在 arXiv 上发布,并于 2025 年 7 月 9 日通过谷歌研究院博客正式公布。

rss · The Decoder · Jul 13, 09:16

背景: 基础模型是在广泛数据上训练的大型 AI 模型,可适应多种任务。SensorFM 专门针对可穿戴健康数据设计,如心率、睡眠模式和加速度计读数。之前的健康基础模型侧重于特定模态,如医学图像或咳嗽声;SensorFM 旨在泛化来自可穿戴设备的各种传感器输入。

参考链接

标签: #foundation model, #health AI, #wearable data, #Google Research, #machine learning


ACRouter 动态路由 AI 模型,成本降低 2.6 倍
ACRouter dynamically routes AI models, cuts costs 2.6x
⭐️ 8.0/10

研究人员发布了 ACRouter,这是一个开源框架,它通过上下文-行动-反馈(C-A-F)循环,将提示动态路由到最佳的 AI 模型来处理编码任务。测试中,ACRouter 相比于仅使用 Opus 等高级模型的方案,成本降低了 2.6 倍。 该方法通过实现无需手动规则或重新训练即可根据实际反馈进行自优化的模型路由,解决了企业 AI 部署中的关键瓶颈。它能在保持或提升性能的同时大幅降低运营成本,使 AI 更易于应用于可扩展的场景。 ACRouter 使用 C-A-F 循环追踪历史任务的成功与失败来指导路由决策,相比基于启发式的方法实现了 15.3% 的相对改进。它作为基于 Qwen3.5-0.8B 的开源 LoRA 适配器实现,并在 CodeRouterBench 基准上进行了评估。

rss · VentureBeat · Jul 13, 16:06

背景: 现有的模型路由方法是静态的——它们依赖手工规则或从未查看执行结果的训练分类器,导致在分布外场景和模型更替时失败。ACRouter 通过在部署期间从真实执行反馈中学习,将路由视为一个智能体任务而非分类问题,从而弥补了这一信息缺口。

参考链接

标签: #AI, #model routing, #open-source, #cost optimization, #Agent-as-a-Router


苹果起诉 OpenAI 窃取商业秘密
Apple Sues OpenAI Over Trade-Secret Theft
⭐️ 8.0/10

苹果对 OpenAI 提起诉讼,指控 OpenAI 通过前苹果员工窃取了与 AI 硬件相关的商业秘密,特别是苹果神经引擎架构。 这场诉讼标志着两家 AI 巨头之间竞争的显著升级,可能影响未来的合作、人才流动以及 AI 硬件开发的竞争格局。 争议焦点在于 OpenAI 与 Jony Ive 合作的秘密 AI 设备项目,该项目可能利用了苹果专有神经引擎的知识。苹果神经引擎是一种用于设备端机器学习的定制处理器,应用于 iPhone 和 iPad。

rss · Kingy AI · Jul 13, 13:03

背景: 苹果在定制 AI 芯片上投入了大量资源,包括神经引擎,用于加速设备上的机器学习任务。OpenAI 最近收购了 Jony Ive 的初创公司并开发自己的 AI 硬件,这引发了关于前苹果员工(现与 OpenAI 合作)可能挪用知识产权的担忧。

参考链接

标签: #Apple, #OpenAI, #lawsuit, #trade secrets, #AI hardware



📊 运行统计 · 总耗时 8m 00s · AI 分析 2m 48s · Tokens 0.67 MCY (输入 0.47 / 输出 0.20 MCY)