OpenAI 介绍数学家使用 GPT-5.6 解决无解数学问题
OpenAI introduces mathematician using GPT-5.6 to solve unsolvable problems ⭐️ 10.0/10
OpenAI 宣布数学家 Bartosz(@nasqret)正在使用 GPT-5.6 解决以往无法解决的数学问题,并在公司发布的视频中进行了展示。 这标志着 AI 推理能力的重大飞跃,表明大语言模型现在能够协助人类进行超越能力的开创性数学研究,可能加速依赖复杂证明的领域的发现。 GPT-5.6 有三个版本:Luna、Terra 和 Sol,其中 Sol 能力最强。视频显示 Bartosz 与模型协作,但未透露使用的具体版本。
rss · OpenAI(@OpenAI) · Jul 9, 20:04
背景: GPT-5.6 是 OpenAI 于 2026 年 7 月发布的大型语言模型,此前在 6 月进行了预览。AI 定理证明一直是一个活跃的研究领域,例如 Meta 的神经定理证明器解决了国际数学奥赛问题,但 GPT-5.6 声称能解决无解问题。
参考链接
标签: #AI, #Mathematics, #GPT-5.6, #Breakthrough, #OpenAI
OpenAI 发布 ChatGPT Work 智能体,结合 Codex 与 GPT-5.6
OpenAI Announces ChatGPT Work Agent with Codex and GPT-5.6 ⭐️ 10.0/10
OpenAI 推出了 ChatGPT Work,这是 ChatGPT 中基于 Codex 和 GPT-5.6 的新型 AI 智能体,能够跨应用和文件自主执行操作,并在长时间内完成复杂项目。 这代表着 AI 生产力工具的重大飞跃,能够自主执行任务并从头到尾完成项目而无需持续人工监督,可能改变各行业的工作流程。 ChatGPT Work 可在移动端、网页端和桌面端使用,用户可在一个设备上开始任务并在另一设备上继续。它基于 OpenAI 的软件工程智能体 Codex 和 GPT-5.6,后者包含三个版本:Luna、Terra 和 Sol。
rss · OpenAI(@OpenAI) · Jul 9, 17:41
背景: ChatGPT Work 将对话式 AI 助手 ChatGPT 与专为软件工程任务设计的智能体 Codex 结合。GPT-5.6 是 OpenAI 最新的大语言模型系列,其中 Sol 是能力最强的版本。这种集成使智能体能够推理、规划并在应用程序间执行多步操作,类似于自主助手。
标签: #OpenAI, #ChatGPT, #Codex, #AI agent, #GPT-5.6
OpenAI 推出 GPT-5.6 系列模型:Sol、Terra、Luna
OpenAI launches GPT-5.6 family: Sol, Terra, Luna ⭐️ 10.0/10
OpenAI 已开始逐步推出 GPT-5.6 系列模型,包括 Sol(旗舰)、Terra(平衡型)和 Luna(最快/最便宜),覆盖 ChatGPT、Codex 和 API。该系列模型在编程、知识工作、网络安全和科学领域实现了领先性能,同时提高了效率并降低了成本。 此次发布标志着 AI 能力的重大进步,提供了平衡智能和成本的分层选项。它为语言模型树立了新标杆,可能加速在需要高性能 AI 进行编程、研究和安全任务的行业中的采用。 Sol 是最强大的模型,在 ARC-AGI-3 等基准测试中取得了领先结果。Terra 以较低成本提供强劲性能,而 Luna 则针对速度和效率进行了优化。该系列于 2026 年 6 月 26 日开始有限预览,并于 2026 年 7 月 9 日全面上市。
rss · OpenAI(@OpenAI) · Jul 9, 17:30
背景: GPT-5.6 是 OpenAI 最新的大型语言模型系列,接替 GPT-5.5。它分为三个层级以满足不同用途:Sol 用于复杂推理和代理任务,Terra 用于日常办公,Luna 用于成本敏感型应用。这些模型融入了改进的意图理解和安全措施。此次发布延续了 OpenAI 迭代更新模型的传统,每个版本都推动了 AI 能力的前沿。
参考链接
社区讨论: 社区反应不一:一些开发者称赞 Sol 在 ARC-AGI-3 等基准测试中的表现,而另一些人指出,在实际编码测试中,Terra 的性能与 GPT-5.5 相似,略逊于 Sonnet 5。还有讨论称 Fable 5 被排除在某些评估之外,有评论者称之为“默认赢家”。关于 Codex 与 Claude Code 的比较也很常见,用户们正在寻求哪个工具更好的共识。
标签: #OpenAI, #GPT-5.6, #AI models, #ChatGPT, #Codex
欧盟议会通过程序性手段批准聊天控制 1.0
EU Parliament Passes Chat Control 1.0 via Procedural Trick ⭐️ 9.0/10
2026 年 7 月 9 日,欧盟议会批准了《聊天控制 1.0》,允许美国科技公司在没有授权或怀疑的情况下扫描私人消息,此前否决该法律的动议未能获得所需的 361 票绝对多数,尽管投票的大多数欧洲议会议员反对(314 票反对,276 票赞成)。 这一决定使得对 Instagram、Discord 和 Gmail 等平台上的私人通信进行大规模监控成为可能,削弱了数百万用户的加密和隐私。它为欧盟监控法律开创了先例,并迫使消息服务实施客户端扫描,这一做法可能扩展到其他内容。 该法律通过程序性操作通过:投票安排在暑假前的最后一天,根据紧急程序,需要全体欧洲议会议员的绝对多数(而非出席者的简单多数)才能阻止。扫描授权有效期至 2028 年,适用于直接消息和电子邮件,而公开帖子和云存储不受影响。
hackernews · rapnie · Jul 9, 11:03 · 社区讨论
背景: 《聊天控制》是欧盟旨在检测私人通信中儿童性虐待材料的法规。第一个版本(1.0)依赖客户端扫描,即在用户设备上加密前或解密后扫描消息,引发了严重的隐私和安全担忧。批评者认为,这为加密引入了后门,侵犯基本权利,并可能导致更广泛的监控。
参考链接
社区讨论: 评论对议会策略表示愤怒,指出投票安排在暑假前以确保低出席率,且尽管多数议员反对,法律仍获得通过。评论者认为这是迈向极权主义的一步,并批评欧盟的合法性,一些人指出了罗伯塔·梅索拉在紧急程序下强行投票的作用。
标签: #privacy, #surveillance, #EU, #encryption, #policy
OpenAI 发布 GPT-Live:全双工语音加实时 UI
OpenAI Unveils GPT-Live: Full-Duplex Voice with Real-Time UI ⭐️ 9.0/10
OpenAI 发布了 GPT-Live,一款全双工语音模型,支持边听边说、实时生成 UI 界面,并能将复杂推理任务后台交给 GPT-5.5 处理。 GPT-Live 可能通过实现自然对话交互和动态视觉反馈,彻底改变 AI 助手的使用体验,对 Siri 等传统语音助手构成威胁,也标志着 AI 交互范式的新方向。 该模型在人工评测和 GPQA、τ³-Voice Telecom 等基准测试上均优于 Advanced Voice Mode,并支持可调推理强度(Instant / Medium / High)以及针对语音场景增强的安全防护。
rss · 小互(@imxiaohu) · Jul 9, 02:29
背景: 全双工语音架构允许 AI 同时处理输入和生成输出,实现自然的打断和重叠对话。GPT-5.5 是 OpenAI 最新的推理模型,专为更深入的认知任务设计。实时 UI 生成意味着 AI 可以动态创建交互式视觉元素,从而扮演个人助手的角色。
参考链接
标签: #语音模型, #OpenAI, #全双工, #AI助理, #GPT-5
OpenAI 将 Codex 与 ChatGPT 整合为统一的桌面应用,并引入 GPT-5.6
OpenAI unifies Codex and ChatGPT into one desktop app with GPT-5.6 ⭐️ 9.0/10
OpenAI 宣布推出一款新桌面应用,将 Codex 和 ChatGPT 整合在一起,并推出 ChatGPT Work——一个由 GPT-5.6 驱动的新代理,可以跨应用和文件执行操作,同时还有新的 Chrome 扩展和改版的应用内浏览器。 这一整合标志着将 AI 辅助编程与通用 AI 助手统一到单一平台的重要一步,有望简化开发者和高级用户的工作流程。GPT-5.6 在编程、科学和网络安全方面的先进能力可能会重新定义生产力工具。 新的 ChatGPT Work 代理可以持续处理项目数小时,将目标转化为完成的工作。桌面应用还包含由 GPT-5.6 驱动的更快的 Computer Use 功能。GPT-5.6 提供三种模型变体:Sol(旗舰版)、Terra(低成本版)和 Luna(最快且最具成本效益版)。
rss · OpenAI Developers(@OpenAIDevs) · Jul 9, 17:48
背景: Codex 是 OpenAI 的 AI 编程代理,能将自然语言转化为代码,并处理如拉取请求、重构和迁移等任务。ChatGPT 是通用对话式 AI。将两者整合到一款应用中,旨在为编程和通用生产力任务提供无缝体验。GPT-5.6 是 OpenAI 最新的模型系列,于 2026 年 6 月 26 日预览,在编程、科学和网络安全方面能力增强,并配有强大的安全堆栈。
参考链接
标签: #OpenAI, #Codex, #ChatGPT, #GPT-5.6, #Desktop App
Meta 发布 Muse Spark 1.1,具备强大智能体能力
Meta Releases Muse Spark 1.1 with Strong Agentic Abilities ⭐️ 9.0/10
Meta 首席执行官马克·扎克伯格宣布发布 Muse Spark 1.1,这是一款具备强大智能体和编码能力的新模型,通过全新的 Meta Model API 以极低价格提供。 该模型以低价提供强大的智能体性能,可能颠覆 AI 市场,为开发者和企业提供高性价比的替代方案,尤其在工具使用和长程任务方面。 Muse Spark 1.1 在 6 项智能体基准中领先 4 项,包括 MCP Atlas(88.1)和 JobBench(54.7,从 17.0 跃升),但在编码和多模态任务上落后于 GPT-5.5 和 Opus 4.8。
rss · meng shao(@shao__meng) · Jul 10, 00:45
背景: 大语言模型越来越多地用于智能体任务,如工具调用和多步推理。MCP Atlas 和 JobBench 等基准评估模型使用真实工具和完成专业任务的能力。子智能体允许模型将子任务委派给并行进程,提高效率。
参考链接
社区讨论: 社区评论强调该模型极低的价格(每百万 token $1.25/$4.5)及其在 AI 竞赛中扮演搅局者的潜力。但一位评论者指出 Terminal-Bench 评估可能因资源限制被取消资格。其他人分享实际使用体验并讨论竞争格局。
标签: #AI, #Meta, #LLM, #Agentic, #Coding
OpenAI CEO 宣布最新最强模型及博文
OpenAI CEO announces new best model and blog post ⭐️ 9.0/10
OpenAI CEO Sam Altman 在 X 上宣布,公司发布了迄今最好的模型,并附有介绍该模型的博文,链接指向 openai.com/index/gpt-5-6/。 此次发布可能标志着 AI 能力的重大突破,预计将超越 GPT-4,并在语言模型性能上树立新标杆,影响众多行业。 推文明确称其为'我们有史以来最好的模型',博文也是'有史以来最好的博文之一';链接暗示模型可能命名为 GPT-5 或 GPT-6,但官方名称尚未确认。
rss · Sam Altman(@sama) · Jul 9, 17:10
背景: OpenAI 是一家领先的人工智能研究机构,以其 GPT 系列大型语言模型而闻名。GPT-4 于 2023 年 3 月发布,是一个重要里程碑。新模型将代表 AI 语言理解和生成的下一代。
标签: #OpenAI, #GPT-5, #AI, #Language Model, #Announcement
开源模型将图像转为可交互 3D 世界
Open-source model turns images into interactive 3D worlds ⭐️ 9.0/10
一款开源模型现在可以将任何静态图像转换为无限的、完全可交互的 3D 世界,支持 720p 60fps 运行,具备多人游戏功能,并允许射击、施法等动态操作。其 13 亿参数版本可在消费级 GPU 上运行,并已在 Hugging Face 上发布。 这代表了 AI 生成交互环境的一次重大飞跃,使得无需专业硬件或游戏引擎,就能从单张图像创建沉浸式 3D 世界变得民主化。它可能通过实现实时、多人探索并降低计算成本,彻底改变游戏原型设计、虚拟旅游和创意叙事。 该模型支持无限生成 720p 60fps 的场景,并包含射击、施法和召唤新元素等交互能力。13 亿参数版本针对消费级 GPU 进行了优化,模型权重和框架(agent harness)均完全开源。
rss · Paul Couvert(@itsPaulAi) · Jul 9, 13:42
背景: AI 世界模型从静态输入生成动态环境,但早期模型(如 Oasis、Genie)仅限于基本导航,无法进行游戏交互。术语“harness”指的是将 AI 模型与用户输入及工具连接的软件框架,支持超出简单移动的操作。该新模型集成了这样的框架,支持射击、施法等复杂交互,标志着从被动观看到主动游玩的转变。
参考链接
标签: #open source, #AI, #interactive world, #image to 3D, #Hugging Face
GPT-5.6 现已加入 Microsoft 365 Copilot
GPT-5.6 Now Available in Microsoft 365 Copilot ⭐️ 9.0/10
微软 CEO 萨提亚·纳德拉宣布,OpenAI 的 GPT-5.6 模型现已集成到 Microsoft 365 Copilot 中,在 Copilot Chat、Cowork、M365 应用、GitHub 和 Foundry 中带来了更强的推理能力、多步智能体功能以及更高质量的输出。 此次更新显著提升了数百万 Microsoft 365 用户的 AI 生产力,支持多步分析和内容创作等更复杂的任务。同时,它巩固了微软与 OpenAI 的深入合作,为 AI 辅助工作设定了新标杆。 GPT-5.6 引入了'Work IQ'功能,并立即在 Copilot Chat、Cowork、Microsoft 365 应用、GitHub 和 Foundry 中可用。该模型在不牺牲效率的情况下提升了推理能力和输出质量。
rss · Satya Nadella(@satyanadella) · Jul 9, 20:35
背景: Microsoft 365 Copilot 是一款集成在微软生产力套件中的生成式 AI 助手,基于 OpenAI 的 GPT 模型构建。它于 2023 年推出,取代了 Cortana,并已成为工作中核心的 AI 工具,提供聊天、内容创作和协作等功能。GPT-5.6 是 OpenAI 语言模型的最新版本,具备高级推理和多步任务处理能力。
参考链接
标签: #AI, #Microsoft, #GPT-5.6, #Copilot, #Productivity
AlloyDB 代理模型用本地推理替代 LLM 调用
AlloyDB Proxy Models Replace LLM Calls with Local Inference ⭐️ 9.0/10
谷歌已发布 AlloyDB AI 函数正式版,采用代理模型架构,从 LLM 输出中训练轻量级本地模型,使查询无需外部调用即可在数据库速度下运行。智能批处理相比标准 LLM 调用实现了最高 2400 倍的吞吐量提升。 这一突破通过消除对外部 LLM 服务的依赖,显著降低了 AI 驱动数据库查询的延迟和成本。它为在数据库内直接集成 AI 推理设立了新标准,可能加速 AI 功能在数据密集型应用中的采用。 代理模型在预览阶段达到每秒 10 万行,但基准数字仅适用于内部测试中的 AI.IF 函数。训练过程使用 LLM 输出创建完全在 AlloyDB 内部运行的轻量级模型。
rss · InfoQ · Jul 9, 08:00
背景: 传统上,AI 驱动的数据库查询需要将数据发送到外部 LLM API,这会引入网络延迟和成本。代理模型通过在数据库本地训练一个小型高效模型来模仿 LLM 在特定任务上的行为,从而解决这一问题。这种方法受到 LLM 服务中代理模型架构的启发,使得 AlloyDB 无需外部调用即可执行 AI 推理。AlloyDB Auth Proxy 是一个用于安全连接的工具,与 AI 代理模型不同。
参考链接
标签: #database, #AI, #machine learning, #proxy models, #AlloyDB
验证扩展成为大模型进步的新维度
Verification scaling emerges as new axis for LLM advances ⭐️ 9.0/10
斯坦福 AI 实验室推出了 LLM-as-a-Verifier 框架,通过扩展验证过程在 Terminal-Bench V2、SWE-Bench Verified、RoboRewardBench 和 MedAgentBench 上取得了最先进的结果。该方法还利用细粒度反馈作为任务进展的代理,提高了强化学习的样本效率。 这项工作表明,扩展验证过程(而非仅扩大模型规模或数据)能显著提升性能,为 AI 研究开辟了新的扩展维度。细粒度反馈机制可实现更高效的强化学习和测试时扩展,可能降低计算成本并提升智能体的可靠性。 该框架使用更细粒度的评分尺度(例如 1-20 代替 1-5),对评分 token 的完整 log-probability 分布取期望,并扩展重复评估和标准分解。这些技术实现了更细致、更有效的验证信号。
rss · Stanford AI Lab(@StanfordAILab) · Jul 9, 23:45
背景: 大语言模型(LLM)常被用作评判者或验证者来评估其他模型的输出。传统验证使用粗粒度评分(如 1-5)和有限标准。LLM-as-a-Verifier 通过增加细节和重复评估来扩展验证过程,类似于推理时计算(如“思维链”)扩展模型推理的方式。这项工作表明,验证本身可以独立于模型规模进行扩展以提升性能。
参考链接
- GitHub - llm-as-a-verifier/llm-as-a-verifier · GitHub
- Cameron R. Wolfe, Ph.D. в X: «Strongly recommend the LLM-as-a-Verifier writeup. Biggest takeaway for me is that increasing scoring granularity makes the verifier more effective. This indicates that LLM judges / verifiers are developing new (and better) capabilities. This did not work well 1-2 years ago. https://t.co/4W7h3CREvn» / X
标签: #LLM, #Verification, #Scaling, #AI Research, #Reinforcement Learning
TypeScript 7.0 发布:Go 重写带来最高 12 倍速度提升
TypeScript 7.0 Released with Go Rewrite, Up to 12x Faster Builds ⭐️ 9.0/10
微软正式发布 TypeScript 7.0,这是用 Go 语言重写的原生版本,完整构建速度提升 8 到 12 倍,并支持共享内存多线程。用户可通过 npm 直接安装,主流编辑器也可通过 LSP 支持新语言服务器。 这一重大性能改进大幅缩短了大型 TypeScript 代码库的编译时间,惠及数百万开发者并影响整个 JavaScript 生态系统。Go 重写也为 Web 开发中的编译器基础设施指明了新方向。 新版本引入了 --checkers 和 --builders 参数以自定义并行度。但 Vue、Svelte 等嵌入式语言工具链因 API 尚未就绪,目前仍需使用旧版本。
telegram · zaihuapd · Jul 9, 04:01
背景: TypeScript 是 JavaScript 的类型化超集,可编译为纯 JavaScript。此前,TypeScript 编译器是用 TypeScript 自身编写的,导致了性能瓶颈。将其重写为 Go 语言(一种以速度和并发性著称的系统编程语言),可以通过原生代码和多线程实现更快的编译。
参考链接
标签: #TypeScript, #Microsoft, #performance, #Go rewrite, #release
蚂蚁集团开源 LingBot-Video,首个 MoE 具身视频基模
Ant Group Open-Sources LingBot-Video, First MoE Embodied Video Model ⭐️ 9.0/10
蚂蚁集团旗下灵波(LingBot)开源了全球首个基于 MoE 架构的具身视频生成基础模型 LingBot-Video,总参数量 300 亿,推理时仅激活约 30 亿参数,效率是同等规模稠密模型的 3 倍。 这是具身 AI 领域的重大突破,将视频生成与机器人技术结合:该模型可用于机器人动作预测、仿真数据生成和世界模型研究,并以 Apache 2.0 许可证开源,将加速该领域的研究与开发。 LingBot-Video 采用 DiT+MoE 架构,基于涵盖灵巧操作、机器人移动和第一视角交互等场景的 7 万小时具身数据引擎训练,并引入多维强化学习奖励系统,重点关注物理合理性和任务完成度。
telegram · zaihuapd · Jul 9, 04:30
背景: MoE(混合专家)是一种 AI 模型架构,使用多个专门的子模型(专家)和门控机制,每次输入只激活部分参数,从而在较低计算成本下实现更大的模型容量。具身 AI 将 AI 集成到与物理世界交互的实体系统中,例如机器人。DiT(扩散变换器)用 Transformer 替换了扩散模型中传统的 U-Net 骨干网络,提升了可扩展性和生成质量。
参考链接
标签: #embodied AI, #MoE, #video generation, #open source, #robotics
大疆 EV50 飞越珠峰 8861 米创纪录
DJI EV50 Sets UAV Altitude Record at 8,861m on Everest ⭐️ 9.0/10
大疆尚未发布的 EV50 垂直起降运载无人机在“巅峰使命”珠峰科考中飞越 8861 米,创下同类飞行升限世界纪录,并获取了 8000 米以上海拔的真实大气剖面数据。 这一成就展示了垂直起降无人机的极端海拔能力,有望推动高海拔物流、科研以及低空货物运输等应用。也彰显了大疆在无人机行业的技术领先地位。 EV50 是一款复合翼垂直起降无人机,可原地垂直起降并切换为固定翼巡航。在为期 12 天的任务中,累计完成 32 架次起降,连续爬升 3730 米,返程时仍剩 30%电量。大疆称其研发目标还包括百公里级货物运输等低空物流场景。
telegram · zaihuapd · Jul 9, 06:00
背景: 复合翼无人机融合了固定翼飞机(长航时、高速)和多旋翼(垂直起降、悬停)的优点。传统多旋翼因电池限制航程和海拔有限,而固定翼无人机需要跑道。EV50 这样的垂直起降无人机提供了灵活方案,非常适合在喜马拉雅等复杂地形执行任务。大疆在珠峰测试无人机已有历史,可追溯到 2009 年。
参考链接
标签: #大疆, #无人机, #高海拔飞行, #物流, #珠峰科考
OpenAI 开始 GPT-5.6 发布会直播
OpenAI Begins GPT-5.6 Livestream Launch Event ⭐️ 9.0/10
OpenAI 已开始 GPT-5.6 的发布会直播,这是一个下一代大语言模型系列,包括名为 Sol、Terra 和 Luna 的变体。 该活动标志着人工智能发展的重要里程碑,GPT-5.6 承诺在编程、科学和网络安全方面具有更强的能力,可能推动各行业的自动化和研究进展。 直播在 openai.com/live 上进行,活动开始时有一个 10 分钟倒计时。GPT-5.6 作为一个具备先进安全栈的模型系列进行预览,基于 2026 年 4 月发布的上一代 GPT-5.5。
telegram · zaihuapd · Jul 9, 17:02
背景: OpenAI 的 GPT 系列是大型语言模型(LLM),能够生成类似人类的文本并执行复杂任务。GPT-5.5(代号“Spud”)引入了显著的基准测试分数,并用于网络安全项目。GPT-5.6 旨在进一步推动人工智能能力和安全性的边界。
参考链接
标签: #OpenAI, #GPT-5.6, #AI, #LLM, #live
腾讯 Hy3 小型 LLM 可与 DeepSeek 媲美
Tencent's Hy3 Small LLM Rivals DeepSeek ⭐️ 8.0/10
腾讯发布了 Hy3,一个 295B 参数的混合专家(MoE)模型,具有 21B 激活参数,迅速登顶 OpenRouter 排行榜,引发社区讨论并与 DeepSeek 模型进行比较。 Hy3 表明,一个相对较小的模型可以实现与 DeepSeek V4 Pro 等更大模型相媲美的能力,可能使高性能 LLM 更易于本地部署和成本效益推理。 Hy3 总参数为 295B,但由于其 MoE 架构,每个 token 仅激活 21B 参数;预览版于 2026 年 4 月发布,增强了上下文学习和指令遵循能力。在 OpenRouter 上提供免费层级,有效期至 2026 年 7 月 21 日。
hackernews · andai · Jul 9, 15:27 · 社区讨论
背景: 混合专家(MoE)模型每个 token 仅激活部分参数,从而在保持大模型容量的同时实现效率提升。OpenRouter 是一个统一 API 市场,聚合了来自不同提供商的 LLM。DeepSeek 的 V4 Flash 和 V4 Pro 是具有相似参数规模的流行竞品模型。
参考链接
社区讨论: 社区成员注意到 Hy3 最初登顶 OpenRouter 排行榜,但后来有所下降,有人质疑其相对于竞品的优势。其他人则称赞其小巧体积下的惊人能力,认为它可能成为流行的本地模型,而与 DeepSeek Flash V4 的比较也引起了兴趣。
标签: #AI/ML, #Large Language Model, #Tencent, #OpenRouter, #LLM comparison
用 Rust 重写 PostgreSQL 并通过全部回归测试
PostgreSQL Rewritten in Rust Passes All Regression Tests ⭐️ 8.0/10
一个名为 pgrust 的项目,主要借助 LLM 用 Rust 重写了 PostgreSQL,现已 100%通过 PostgreSQL 回归测试,作者在 GitHub 上宣布了这一进展。 该项目展示了利用 LLM 重写已有数十年历史的复杂数据库系统的潜力,有望在保持兼容性的同时实现更现代化、高性能且更安全的实现。 该重写版本主要由 LLM 生成,在不到一个月内产生了超过 7000 次提交,但仍处于实验阶段,并采用 AGPL 许可证而非原始的 PostgreSQL 许可证。
hackernews · SweetSoftPillow · Jul 9, 06:18 · 社区讨论
背景: PostgreSQL 是一款成熟的开源关系型数据库,以可靠性和可扩展性著称。用强调安全性和性能的系统语言 Rust 重写它,可以解决内存安全问题并提升并发性能。使用 LLM 生成大部分代码是一种新颖的方法,但引发了关于代码审查、许可和维护性的问题。
社区讨论: 社区对此项目印象深刻但持谨慎态度。作者解释该项目是实验性的,并且正在开发新版本。用户建议通过镜像查询来测试正确性,并对 AGPL 许可证变更以及审查 LLM 生成代码的难度表示担忧。一些人质疑重写的价值,并指出潜在的兼容性问题。
标签: #Rust, #PostgreSQL, #LLM, #Database, #Open Source
美军后勤在下次战争中的脆弱性
US Army logistics fragility in future war ⭐️ 8.0/10
一篇文章指出,美军后勤体系过于脆弱,过度依赖空中和海上运输线及复杂供应链,将在重大冲突中崩溃。 这一分析挑战了陆军现代化优先顺序,凸显出可能决定未来战争结局的关键脆弱性,影响战略规划与预算分配。 文章引用了“齿尾比”概念、费边战略等历史实例,并与二战时期的产量对比,说明当前工业产能的萎缩。
hackernews · baud147258 · Jul 9, 13:24 · 社区讨论
背景: 军事后勤涉及部队的调动、补给与维护。“齿尾比”比较作战部队(齿)与支援部队(尾)的比例。现代后勤高度依赖安全的运输线路和准时制交付,易受无人机或精确打击的破坏。
社区讨论: 评论基本同意文章论点,并与乌克兰战争和历史上的费边战略进行类比。部分人讨论了轨道投放等替代运输方式,也有人感叹相比二战时期大规模生产能力的下降。
标签: #military logistics, #strategy, #defense, #supply chain
GLM 5.2 在记账测试中精度接近人类
GLM 5.2 Matches Human Accuracy in Bookkeeping Benchmark ⭐️ 8.0/10
Z.AI 的新语言模型 GLM 5.2 在记账基准测试中达到了接近人类的精度,能够根据银行流水和发票正确编码交易。但测试排除了查找发票和处理模糊情况等任务。 这表明 LLM 能够以高精度自动化核心记账任务,可能降低企业成本。然而,责任问题和范围限制仍是采用的重要障碍。 该模型拥有 100 万 token 的上下文窗口,专为长周期任务设计。测试仅关注交易编码,而非人类记账员的全方位职责。
hackernews · adamkurkiewicz · Jul 9, 18:29 · 社区讨论
背景: GLM 5.2 是 Z.AI 面向长周期任务推出的旗舰模型,是 GLM 5.1 的后续版本。测试作者 Toot Books 旨在实现记账自动化,但指出该模型无法处理未注释的发票或需要判断的情况。
社区讨论: 评论者指出,测试排除了查找发票和处理边缘情况等关键人类任务,并提出了 LLM 出错时责任归属的担忧。由于模型背后初创公司缺乏透明度,一些人表达了不信任。
标签: #AI, #LLM, #benchmarking, #bookkeeping, #automation
OpenAI 发布 GPT-5.6 系列,合并 ChatGPT 与 Codex,推出 ChatGPT Work 智能体
OpenAI launches GPT-5.6 family, merges ChatGPT and Codex, introduces ChatGPT Work agent ⭐️ 8.0/10
OpenAI 已正式发布 GPT-5.6 系列模型(Sol、Terra、Luna),将 ChatGPT 和 Codex 合并为一个桌面应用,并推出了名为 ChatGPT Work 的智能体新功能,可跨多个应用执行复杂任务。更新还包括“Sites”功能(将可视化内容分享为网页)、增强的浏览器能力以及为 Codex 新增的开发者功能。 这一统一平台战略使 OpenAI 直接与 Google Workspace 和 Microsoft 365 等成熟生产力套件竞争,旨在 IPO 前锁定企业客户。GPT-5.6 的分层定价和自主智能体能力标志着从简单聊天机器人向全面 AI 驱动的工作助手的转变。 GPT-5.6 Sol 引入了“Ultra 模式”,内部生成并行子智能体以处理复杂任务,仅限 Pro 和企业用户使用。ChatGPT 与 Codex 合并后,用户可在“Chat”、“Work”和“Codex”模式间切换,共享上下文和历史记录;Codex 现支持直接编辑文件、审查 PR 和 Ultra 模式进行高级编码。ChatGPT Work 智能体可连接 Google Drive、Slack、邮箱等工具,执行定时任务,并可在网页和移动端运行。
rss · 宝玉(@dotey) · Jul 9, 18:39
背景: GPT-5.6 是 OpenAI 最新一代的大型语言模型,分为三个层级:Sol(旗舰级,成本高)、Terra(中端,价格仅为上一代旗舰模型的一半)和 Luna(轻量级,成本低)。Sol 的“Ultra 模式”利用多个子智能体并行处理复杂任务,是向更自主的 AI 系统迈进的一步。OpenAI 的应用战略将其工具整合到一个平台,以便在生产力软件市场上更好地与 Google 和 Microsoft 竞争。该公司已提交 IPO 申请,企业客户贡献了 40% 的收入。
参考链接
标签: #OpenAI, #GPT-5.6, #AI, #Product Update, #LLM
Native SDK 与 Flutter、RN 的深度框架对比
Native SDK vs Flutter vs RN: Deep Framework Comparison ⭐️ 8.0/10
一项详细分析显示,Native SDK 采用类似 Flutter 的自定义渲染引擎,而非 React Native 那样映射到原生控件,但在滚动物理、右键菜单和输入法(IME)等系统级交互上仍交由操作系统处理。文章还将 Native SDK(Zig)与 GPUI(Rust)在语言、界面描述方式、状态管理模型和产品定位上进行了对比。 这一对比厘清了主流跨平台 UI 方案之间的取舍,有助于开发者根据需求选择合适的框架。同时,它凸显了混合渲染和确定性状态管理等新兴模式,可能影响未来框架的设计方向。 Native SDK 的渲染完全自定义(不使用原生 UI 组件),但将滚动物理、右键菜单、系统对话框、托盘和文本输入(IME)委托给操作系统处理。与 GPUI 相比:Native SDK 使用 Zig 语言和独立的 .native 模板文件,而 GPUI 使用 Rust 并在 Render trait 中编写 UI 代码;Native SDK 采用严格的 Elm 架构(Model/Msg/Update)管理状态,GPUI 则使用 Entity 系统加响应式上下文。
rss · 宝玉(@dotey) · Jul 9, 04:34
背景: 跨平台 UI 框架允许开发者使用单一代码库构建可在多个操作系统上运行的应用。React Native(RN)将 JavaScript 组件桥接到平台原生控件,而 Flutter 使用基于 Skia 的自有渲染引擎。GPUI 是一个基于 Rust 的 UI 框架,用于 Zed 代码编辑器,专为高性能文本渲染和协作而设计。输入法编辑器(IME)是系统组件,用于支持如中文等复杂文字的文本输入。
标签: #cross-platform, #UI framework, #Flutter, #React Native, #native SDK
Grok-4.5 在 Code Arena 前端基准测试中升至第三名
Grok-4.5 reaches #3 in Code Arena: Frontend ⭐️ 8.0/10
SpaceXAI 发布了 Grok-4.5,这是其首个专门为编码和智能体训练的模型,在 Code Arena 前端基准测试中从第 62 名跃升至第 3 名,与 GLM-5.2 (Max) 和 Claude Opus 4.8 (Thinking) 持平。 这一显著提升展示了 Grok-4.5 在前端编码方面的增强能力,使其成为开发者的有力工具,并缩小了与 Claude 和 GLM 等顶级模型的差距。这也凸显了针对现实任务优化的专用编码模型的趋势。 Code Arena 基准测试衡量的是人类对开放式编码和设计任务的偏好,而非静态测试。Grok-4.5 还在内容创作工具、模拟、游戏和参考设计方面获得了第 2 名。
rss · Arena.ai(@lmarena_ai) · Jul 9, 19:29
背景: Code Arena 是一个人工策划的基准测试,包含 40 个类别的 397 个高质量样本,旨在模拟真实世界的编码复杂性。它评估模型从用户查询生成可交付代码的能力,弥合了自动化指标与人类判断之间的差距。Grok-4.5 是 SpaceXAI 的最新模型,使用 Cursor 训练并针对编码效率和成本进行了优化。
参考链接
标签: #AI, #Grok, #Benchmark, #Code Arena, #Frontend
Vercel Labs 开源桌面应用开发工具包 Native SDK
Vercel Labs Open-Sources Native SDK for Desktop Apps ⭐️ 8.0/10
Vercel Labs 开源了 Native SDK,这是一个工具包,让开发者能够使用类似 Web 的声明式 UI 范式构建原生桌面应用,但无需浏览器或 WebView。该 SDK 基于用 Zig 编写的自研渲染引擎,支持 macOS、Windows 和 Linux。 这解决了桌面开发中长期存在的权衡问题,将 Web 框架的开发者体验(声明式 UI、热重载)与原生性能和小体积二进制文件相结合。它可能通过提供更轻量、更快速的替代方案来挑战 Electron 和 Tauri 等成熟框架。 该 SDK 采用 Elm 架构模式,包含 Model、Msg、update 和 View 组件,并用 Zig 实现。开发模式下,.native 标记文件在运行时解析,支持约 2 秒热重载;发布模式下,标记在编译期(comptime)编译进二进制文件,消除了解析器。
rss · meng shao(@shao__meng) · Jul 9, 01:06
背景: 桌面应用开发通常需要在原生方案(Cocoa/Win32/GTK/Qt)和 Web 方案(Electron/Tauri)之间权衡:前者性能好但跨平台差,后者开发简便但捆绑了庞大的浏览器引擎。Zig 是一种注重简洁和性能的系统编程语言,常作为 C 语言的替代品。Elm 架构是一种用于组织 GUI 应用的模式,强调单向数据流。
参考链接
标签: #Vercel, #Desktop Development, #Native SDK, #Declarative UI, #Zig
本地 AI 框架可能成为前沿模型的操作系统
Local AI Harness Could Become the OS for Frontier Models ⭐️ 8.0/10
Perplexity AI 首席执行官 Aravind Srinivas 在推文中表示,当本地 AI 框架、模型和运行时足够成熟时,它可能成为使用前沿 AI 模型的主要入口,前沿模型则在框架内充当顾问角色,框架本身变成一种用于消费前沿 token 的操作系统。 这一设想挑战了当前主要通过云端访问前沿模型的范式,预示着未来本地 AI 将作为用户的主要界面和强大远程模型的协调器。它可能使前沿 AI 的访问更加民主化,并将控制权从集中式提供商转移到用户手中。 推文特别提到该框架将成为'使用前沿 token 的操作系统',这意味着本地和远程模型将共存,本地框架负责管理上下文、工具和交互。该评论有 18 条回复和 13 次转发,表明在 AI 从业者中引发了集中讨论。
rss · Aravind Srinivas(@AravSrinivas) · Jul 9, 22:42
背景: AI 框架也称为智能体框架,它将 AI 模型与外部工具、记忆和环境连接起来,实现自主智能体行为。前沿模型是最强大的通用 AI 系统,通常因其巨大规模而通过 API 访问。本地框架协调本地和远程模型的想法是 AI 基础设施领域的一个新兴概念。
参考链接
标签: #AI, #Local AI, #Frontier Models, #AI Infrastructure, #Perplexity
1X 的 NEO 手部拥有 25 个肌腱,实现类人灵活性
1X's NEO Hand with 25 Tendons Achieves Human-Like Dexterity ⭐️ 8.0/10
1X 公司发布了其 NEO 人形机器人手部,拥有 25 个肌腱驱动的自由度,能够完成拧灯泡、拿螺丝、拉拉链等精细操作。 这一突破消除了人形机器人领域的一个关键硬件瓶颈,使机器人能够执行以前只有人类才能完成的灵巧任务,向通用家庭机器人迈进一步。 该手部具有 25 个主动自由度,采用肌腱驱动传动,实现了接近人类水平的速度和精度。它是为 NEO 人形平台专门设计的。
rss · 歸藏(guizang.ai)(@op7418) · Jul 10, 00:26
背景: 传统机器人手部缺乏精细操作的灵活性。肌腱驱动手部通过使用线缆拉动关节来模仿人类肌腱,实现灵活而有力的运动。NEO 手部的 25 自由度设计接近人类手部能力,是一项重要的工程成就。
参考链接
标签: #robotics, #dexterous manipulation, #robotic hand, #hardware engineering
Ollama 完成 6500 万美元 B 轮融资,拥有 890 万开发者
Ollama Raises $65M Series B, Used by 8.9M Developers ⭐️ 8.0/10
Ollama 宣布完成 6500 万美元的 B 轮融资,目前已有 890 万开发者和 85% 的《财富》500 强公司使用其平台,而公司仅有 14 名员工。 这笔重大投资验证了开源 AI 平台(尤其是本地模型部署)日益增长的需求,并表明 Ollama 正成为开发者轻松运行开放模型的标准选择。 本轮 B 轮融资由未具名投资者领投,资金将用于扩展开放模型和平台。Ollama 通过命令行界面和 REST API 支持多种开放权重模型,如 DeepSeek、Qwen 和 Gemma。
rss · Y Combinator(@ycombinator) · Jul 9, 17:29
背景: Ollama 是一个开源平台,简化了在本地计算机上运行大型语言模型的过程。它提供模型管理工具、本地 REST API 以及编码助手的集成。此次融资顺应了企业出于数据隐私和定制化需求而采用开源 AI 的大趋势。
标签: #funding, #open-source, #AI, #developer tools
腾讯开源 BrowserSkill,连接 AI 智能体与浏览器
Tencent Open-Sources BrowserSkill for AI Agent-Browser Bridging ⭐️ 8.0/10
腾讯开源了 BrowserSkill,这是一个本地桥接工具,能让 Cursor、Claude Code、Codex 等 AI 智能体通过 shell 命令操控用户已登录的浏览器,且不打断用户的正常工作。 该工具填补了 AI 编程助手需要浏览器交互(如填写表单或抓取数据)的关键空白,同时复用了现有登录态,并通过人工介入保障安全,使自动化对开发者更安全实用。 BrowserSkill 通过一个本地守护进程,经 WebSocket 与浏览器扩展通信,在独立的“Agent Window”中执行任务,不影响其他标签页。它支持 macOS、Linux 和 Windows 上的 Chrome 和 Edge,并在遇到验证码、登录或确认弹窗时触发人工接管。
rss · Geek(@geekbb) · Jul 9, 06:25
背景: AI 编程助手可以通过 shell 命令自动化任务,但缺乏直接访问需要身份验证或复杂交互的浏览器的能力。BrowserSkill 通过让智能体安全地使用用户现有的浏览器会话,并在敏感操作时由人工验证,弥补了这一缺口,而不是依赖传统的 Selenium 或 Puppeteer 等无法复用会话的自动化工具。
标签: #AI agents, #browser automation, #open-source, #Tencent, #developer tools
DeepMind 论文提出 AGI 到 ASI 的四条路径
DeepMind paper outlines four paths from AGI to ASI ⭐️ 8.0/10
谷歌 DeepMind 发表了一篇论文,探讨从通用人工智能(AGI)跃升到超级人工智能(ASI)的四条路径:继续堆算力和数据、替换 Transformer 架构、递归自我改进,以及通过专业化智能体实现集体智能。 这篇论文为 AI 领域提供了一个结构化的路线图,将超级智能的转变视为一系列迭代升级而非单个突破。它有助于研究人员和政策制定者理解通往 ASI 的可能方向和风险。 论文认为,ASI 很可能不是由某个突然事件产生,而是源于加速的迭代改进。它识别出四条截然不同的路径:继续扩展规模、超越 Transformer 的架构创新、AI 加速自身研发的递归自我改进,以及由专业化智能体集群形成的集体超级智能。
rss · AI Will(@FinanceYF5) · Jul 9, 02:29
背景: 通用人工智能(AGI)指能够完成人类任何智力任务的 AI,而超级人工智能(ASI)则是在所有领域超越人类能力。Transformer 架构于 2017 年提出,是现代大多数大型语言模型的基础。递归自我改进(RSI)描述了 AI 系统重新设计自身、可能导致智能爆炸的场景。这篇论文系统分析了 AI 领域可能如何规划从 AGI 到 ASI 的过渡。
标签: #AGI, #ASI, #DeepMind, #AI scaling, #recursive self-improvement
Yann LeCun:开源 AI 是主权的关键
Yann LeCun: Open source AI key to sovereignty ⭐️ 8.0/10
Yann LeCun 在推文中表示,AI 最大的风险是权力集中在少数专有 AI 助手的提供商手中,而实现 AI 主权的唯一解决方案是开源基础模型。 这位顶尖 AI 研究人员的言论凸显了关于 AI 治理的日益激烈的辩论,强调需要去中心化的控制以防止权力失衡。它可能影响关于开源 AI 和国家 AI 战略的政策讨论。 该推文获得 72 条评论、239 次转发和 1559 次点赞,表明参与度很高。LeCun 明确将专有 AI 助手与开源基础模型进行对比,这与他一贯倡导开放 AI 研究的立场一致。
rss · Yann LeCun(@ylecun) · Jul 9, 06:20
背景: 基础模型是在大量未标记数据上训练的大型 AI 模型,可以适应各种下游任务。AI 主权是指国家或组织控制自身 AI 基础设施、数据和决策能力,而非依赖外部提供商。开源基础模型允许透明度、定制化和独立于专有供应商。
参考链接
标签: #AI, #open source, #AI governance, #Yann LeCun, #proprietary AI
超级应用时代已到来
Super App Era Has Arrived ⭐️ 8.0/10
作者宣布超级应用时代已开启,标志着应用设计与使用方式的范式转变。 这很重要,因为超级应用将消息、支付、电子商务等多种服务整合到一个平台,重塑了用户期望和各行各业的商业模式。 虽然未提及具体应用,但该推文的高互动量(1773 点赞,196 评论)反映了社区的强烈兴趣;微信、Gojek 和 Grab 等例子展示了超级应用模式。
rss · Logan Kilpatrick(@OfficialLoganK) · Jul 9, 19:43
背景: 超级应用是一种在单一平台内提供消息、支付、电子商务等多种服务的移动应用。该概念起源于亚洲,以微信等应用为代表,随着公司寻求创建集成生态系统而获得全球关注。
参考链接
标签: #super app, #technology trends, #software engineering, #platform evolution
NVIDIA Flex-Forcing:统一双向与自回归视频生成
NVIDIA Flex-Forcing: Unified Bidirectional and Autoregressive Video Generation ⭐️ 8.0/10
NVIDIA AI 研究团队发布了 Flex-Forcing,这是一种视频生成方法,能够训练单个模型同时执行双向生成和自回归生成,用户可以在推理时根据计算预算在两种方法之间切换。 这种统一解决了结构保持与生成速度之间的关键权衡,可能为内容创作和模拟等应用带来更灵活高效的视频生成能力。 Flex-Forcing 在单一模型上训练两种生成范式,用户可在推理时选择光谱上的任意一点。这与之前需要为每种方法分别训练模型的工作形成对比。
rss · NVIDIA AI(@NVIDIAAI) · Jul 9, 21:24
背景: 当前的视频生成方法主要分为两类:双向扩散模型同时关注所有帧(结构好,速度慢)和自回归模型逐帧生成(速度快,但会累积误差)。Flex-Forcing 训练一个模型支持两种方式,提供灵活的权衡。
参考链接
标签: #video generation, #deep learning, #diffusion models, #autoregressive models, #NVIDIA AI
Llama.cpp 无缝集成到 Zed 编辑器 1.10 版本
Llama.cpp seamlessly integrated into Zed editor v1.10 ⭐️ 8.0/10
Llama.cpp 这一用于本地大语言模型推理的开源库已被无缝集成到 Zed 编辑器 1.10 版本中,支持模型自动发现,开发者无需依赖远程 API 即可在本地运行 AI 辅助功能。 这一集成将本地 AI 推理直接引入流行的代码编辑器,降低了延迟,增强了隐私保护,并减少了开发者在寻求 AI 辅助时需将代码发送至外部服务器的成本。 该集成实现了“完全无缝”的自动模型发现,Zed 无需手动配置即可定位并加载兼容模型。它利用了 Llama.cpp 高效的 C/C++ 实现,在消费级硬件上实现高性能推理。
rss · Julien Chaumond(@julien_c) · Jul 9, 12:27
背景: Llama.cpp 是一个开源的 C/C++ 库,能以最小设置在本地的 CPU 和 GPU 上运行 Llama 等大语言模型,是 Ollama 和 LM Studio 等工具的核心引擎。Zed 是一款用 Rust 编写的高性能、多人协作代码编辑器,由前 Atom 开发者创建。此集成使开发者能够直接在使用本地模型的 Zed 中调用 AI 功能(如代码补全、聊天)。
标签: #Llama.cpp, #Zed editor, #AI integration, #local inference, #developer tools
Modal CTO:K8s 不适合 AI,提出 Agent 时代云
Modal CTO: Kubernetes Not Fit for AI, Proposes Agent-Era Cloud ⭐️ 8.0/10
Modal 联合创始人兼 CTO Akshat Bubna 指出,Kubernetes 从根本上不适合突发性、算力密集型的 AI 工作负载,并提出一个面向 Agent 时代的新云范式,采用自供应运行时和代码即配置取代 YAML。 这一观点挑战了目前 AI 基础设施中 Kubernetes 的主导地位,表明专为 AI 构建的平台可以显著提升性能和开发体验,并可能影响云厂商在 Agent 时代设计 AI 基础设施的方式。 Modal 使用 GPU 快照、推测解码(DFlash)和沙箱环境来支持弹性推理和 Agent 沙箱,并在 17 家云厂商之间路由工作负载以优化容量和成本。
rss · 跨国串门儿计划 · Jul 9, 01:46
背景: Kubernetes 是一个容器编排系统,最初为需要渐进式扩缩容的 Web 服务设计,不适合 AI 工作负载所需的突发性 GPU 扩展。Modal 是一个从头为 AI 构建的无服务器平台,提供快速自动扩缩容和即时容器启动。推测解码是一种推理优化技术:小模型提议候选 token,大模型并行验证,在不损失输出质量的情况下将延迟降低 2-3 倍。
参考链接
标签: #AI Infrastructure, #Kubernetes, #Cloud Computing, #AI Agents, #Podcast
AlphaEvolve 现已广泛部署于 Google Cloud
AlphaEvolve now widely available on Google Cloud ⭐️ 8.0/10
Google Cloud 已将其基于 Gemini 的 AI 智能体 AlphaEvolve(用于设计高级算法)正式广泛推出,此前该工具处于私有预览阶段。此次部署允许任何 Google Cloud 客户使用 AlphaEvolve 解决复杂的优化问题。 AlphaEvolve 自动为微芯片设计、物流路由和药物发现等挑战性任务发现最优算法,有望大幅节省时间并提升效率。这可能会改变各行业组织应对优化问题的方式。 AlphaEvolve 是一个基于 Gemini 的编码智能体,能够探索超出传统编码方法的广阔算法搜索空间。它已在 Google 内部用于提升基础设施效率,现在可供所有 Google Cloud 客户使用。
rss · The Keyword · Jul 9, 16:00
背景: 为复杂问题设计高效算法非常困难,因为可能的实现空间极其庞大。AlphaEvolve 通过使用 AI 根据问题的自然语言描述自动生成并测试算法来解决这一难题。Google Cloud 客户现在可以利用这一能力来优化自身运营。
标签: #Google Cloud, #AI, #AlphaEvolve, #optimization, #algorithms
谷歌支持成立开放健康栈基金会,推动全球健康
Google Backs Open Health Stack Foundation for Global Health ⭐️ 8.0/10
谷歌宣布成立开放健康栈软件基金会(OHS-SF),该基金会由 Linux 基金会、世界卫生组织及其他合作伙伴共同建立,旨在推动开源数字健康。 该基金会将提供由社区治理的数字公共产品,降低各国构建可互操作健康系统的门槛,尤其是惠及边缘化人群。 OHS-SF 得到谷歌、世卫组织、联合国儿童基金会等全球健康组织的支持,专注于数字健康的开放标准和互操作性。
rss · The Keyword · Jul 9, 08:00
背景: 数字健康系统常常面临碎片化和缺乏互操作性的问题,阻碍了有效护理。开放健康栈是谷歌的一套用于构建健康应用的开源工具。新基金会将这些工具置于社区治理之下,确保它们广泛可用且可持续。
参考链接
标签: #health, #open source, #software foundation, #global health, #Google
OpenAI 用流行病学方法修复 18 年历史的 GNU libunwind 漏洞
OpenAI Fixes 18-Year-Old GNU libunwind Bug Using Epidemiology ⭐️ 8.0/10
OpenAI 在 ChatGPT 的数据基础设施中发现了两个不相关的漏洞:一个 Azure 主机上的静默硬件损坏,以及 GNU libunwind 的 setcontext 函数中一个存在 18 年的竞态条件。他们通过应用群体级别的崩溃分析(而非检查单独的核心转储)修复了这两个问题。 此修复解决了一个广泛使用的库中长期存在的漏洞,惠及众多依赖 libunwind 的应用程序。这种将崩溃数据视为流行病学数据的新颖调试方法,可能会启发诊断难以复现 bug 的新技术。 该竞态条件只有一条指令的漏洞窗口,极难检测。这两个漏洞伪装成一个,增加了诊断难度。OpenAI 与 libunwind 维护者合作实施了修复。
rss · InfoQ · Jul 9, 10:15
背景: GNU libunwind 是一个可移植的 C API,用于确定程序线程的调用链并恢复执行,常用于调试、异常处理和性能分析。竞态条件是一种依赖于时序的软件 bug,可能导致间歇性故障。群体级别崩溃分析聚合来自多个实例的崩溃数据以识别模式,类似于流行病学家研究疾病爆发的方式。
参考链接
标签: #OpenAI, #GNU libunwind, #debugging, #bug fix, #Azure
Google Cloud Run 沙箱公开预览,安全运行 AI 代码
Google Cloud Run sandboxes public preview for secure AI code execution ⭐️ 8.0/10
Google Cloud 宣布 Cloud Run 沙箱公开预览,这是一个原生、安全且超快速的运行时环境,用于执行不受信任的代码和代理工作负载,启动时间仅需毫秒级。 这解决了开发者在安全运行 AI 生成的代码时必须保护宿主应用和云凭证的一大痛点。它支持 LLM 代码解释器和无头浏览器等用例,无需复杂的沙箱基础设施。 沙箱可在现有 Cloud Run 服务实例内近乎即时启动,示例显示其启动、执行并停止了 1000 个沙箱,平均延迟 500 毫秒。该功能在 WeAreDevelopers World Congress 上宣布。
rss · Cloud Blog · Jul 9, 16:30
背景: Cloud Run 是 Google Cloud 的无服务器容器平台。沙箱是一种将不受信任的代码与宿主系统隔离的技术。此前,开发者需要使用容器集群构建复杂基础设施,或付费购买专用的第三方 microVM 运行时(如 Firecracker)。Cloud Run 沙箱提供了一个更简单、集成的解决方案。
标签: #Google Cloud, #Cloud Run, #sandbox, #AI-generated code, #security
TRACE:自我改进 AI 代理在 SWE-bench 上达到 73.2%
TRACE: Self-Improving AI Agent Achieves 73.2% on SWE-bench ⭐️ 8.0/10
斯坦福 AI 实验室推出了 TRACE,一种自我改进方法,代理通过识别自身失败背后的缺失能力并自我训练来弥补。TRACE 训练的 Qwen3.6-27B 模型在 SWE-bench Verified 上达到 73.2%,优于 Codex 5.2 和 GLM 5 等更大的模型,同时使用的训练轮数不到 GRPO 和 GEPA 的四分之一。 这一突破表明,有针对性的自我改进可以用显著更低的计算成本达到最先进的结果,挑战了扩大模型规模的趋势。它为在代码生成和复杂任务解决中提升 AI 能力指明了更高效的范式。 TRACE 方法通过分析失败模式识别特定的缺失能力,然后针对性地训练以弥补这些不足。使用的模型是 Qwen3.6-27B,一个 270 亿参数的模型,在 SWE-bench Verified 上优于包括 GPT-5.2-Codex 和 Claude 4.5 Sonnet 在内的更大模型。
rss · Stanford AI Lab(@StanfordAILab) · Jul 9, 23:45
背景: SWE-bench Verified 是 SWE-bench 中经人工筛选的 500 个实例子集,与 OpenAI 合作创建,用于评估 AI 模型解决流行 Python 仓库中真实 GitHub 问题的能力。GRPO(组相对策略优化)和 GEPA(遗传-帕累托)是替代性训练算法,依赖于具有可验证奖励的强化学习。递归自我改进的概念(即 AI 系统自我提升能力)已在 AI 安全与能力研究中得到探索。
参考链接
标签: #self-improvement, #AI, #SWE-bench, #machine learning, #code generation
斯坦福 D2D 通过放大隐性偏见来检测 LLM 偏见
Stanford D2D Exposes Hidden LLM Biases by Amplifying Them ⭐️ 8.0/10
斯坦福人工智能实验室的研究人员提出了 Distill to Detect (D2D)方法,通过将嫌疑模型与其基础模型之间的差异蒸馏到 KV-cache 前缀适配器中,放大细微偏见,使其在生成文本中变得可检测。 D2D 解决了 AI 安全中的一个关键盲点:那些仅在未知主题上显现的隐藏偏见。该方法使审计人员能够检测他们不知道要寻找的偏见,从而提高了微调 LLM 的可信度。 D2D 是一种灰盒审计方法,通过在良性提示上训练低容量适配器,集中 Fisher 加权的偏见信号并降低噪声。实验中,对于某些隐形偏见,检测率高达 100%。
rss · Stanford AI Lab(@StanfordAILab) · Jul 9, 23:30
背景: 微调大型语言模型(LLM)可能无意中引入微妙偏见,这些偏见仅在某些特定话题上激活,因此逃避了标准审计。传统方法需要事先知道偏见才能搜索。D2D 通过将模型差异蒸馏到小型设备中放大此类偏见,使其对现有工具可见。
参考链接
标签: #AI safety, #bias detection, #LLM interpretability, #machine learning, #fine-tuning
Cloudflare:立即使用 ML-DSA,无需等待新算法
Cloudflare: Use ML-DSA Now, Don't Wait for New Algorithms ⭐️ 8.0/10
Cloudflare 发布博文,认为尽管 NIST 正在评估九种新的后量子签名算法,但组织应立即采用目前可用的最佳标准 ML-DSA。 这很重要,因为后量子密码学迫切需要抵御未来的量子威胁,延迟采用可能使系统易受攻击。 ML-DSA 是一种基于格密码学的 NIST 批准通用数字签名算法,已在 FIPS 204 中规定,旨在取代 RSA 和 ECC 签名。
rss · The Cloudflare Blog · Jul 9, 14:00
背景: 量子计算机最终可能破解广泛使用的加密算法(如 RSA)。NIST 一直在领导标准化流程以选择抗量子算法,并于 2024 年 8 月发布了 ML-DSA(CRYSTALS-Dilithium)作为首批标准之一。然而,还有九个候选算法正在评估中以备未来标准化。
参考链接
标签: #post-quantum cryptography, #signature algorithms, #ML-DSA, #NIST, #cryptography
人工干预在 AI 外循环中的关键作用
The Human Role in AI Outer Loop Engineering ⭐️ 8.0/10
最近一篇文章解释了为什么在人工智能和机器学习系统的外循环中人工干预至关重要,强调循环工程需要在边界处有人类参与。 这一见解意义重大,因为随着 AI 系统日益自主,在外循环中保持人类监督对于确保安全、对齐和有效的工程至关重要,将影响 AI 工程师和开发者。 文章利用了“循环工程”概念,区分了内循环(如模型训练自动化)和外循环(部署、监控、反馈),而人类判断在外循环中至关重要。
rss · Elevate · Jul 9, 14:31
背景: 在机器学习中,内循环指训练和超参数调优的迭代过程,外循环涉及更广泛的系统上下文,包括部署、监控和人类反馈。循环工程是设计这些循环以有效纳入 AI 代理的实践。
参考链接
标签: #AI Engineering, #Human-in-the-loop, #Machine Learning, #Software Engineering, #Loop Engineering
国家超算互联网核心节点郑州上线,提供超 10 万卡国产算力
National Supercomputing Internet Core Node Launches in Zhengzhou with 100K+ Domestic AI GPUs ⭐️ 8.0/10
2026 年 7 月 9 日,国家超算互联网核心节点在郑州正式上线运行,可提供超过 10 万卡的国产人工智能算力,是国家超算互联网平台接入的最大规模单体国产 AI 算力资源池。 这一里程碑大幅提升了中国的国产 AI 算力基础设施,减少对外国 GPU 的依赖,支持大规模 AI 模型训练和科学计算。它强化了全国算力网络,对数字经济和国家安全至关重要。 郑州核心节点承担运营管理、资源调度等核心功能,并整合供需对接、产业孵化等服务。它是国家超算互联网的一部分,截至 2026 年初已连接 14 个省份超过 30 家国家级超算中心和智算中心。
telegram · zaihuapd · Jul 9, 07:00
背景: 国家超算互联网是科技部启动的国家级项目,旨在将分散的超算中心连接成统一的算力资源网络,为科研和产业提供无缝的先进计算服务(包括 AI 训练)。“AI 算力卡”(如国产 GPU)是专门针对 AI 工作负载(如矩阵乘法)优化的加速器,有别于通用 CPU 或游戏 GPU。
参考链接
标签: #超算, #AI算力, #国产算力, #基础设施, #HPC
OpenAI 与美国战争部修订合同,禁止监控本国公民
OpenAI and US War Department Amend Contract to Ban Citizen Surveillance ⭐️ 8.0/10
OpenAI 与美国战争部(国防部的副称)同意修订双方人工智能合作协议,明确禁止使用 AI 系统对美国公民进行监控。该修订由 OpenAI 首席执行官 Sam Altman 主动提出,旨在回应外界对 AI 可能用于大规模监控的担忧。 此举为 AI 公司限制其技术用于军事设立了先例,可能影响行业规范并重建公众对 AI 伦理的信任。同时也凸显了 AI 创新与政府监控能力之间日益紧张的态势。 修订后的条款明确禁止使用 AI 系统对美国公民进行蓄意监控,并禁止利用商业获取的个人身份信息进行追踪。该协议尚未正式签署;此前,Anthropic 因类似顾虑终止了与战争部的合作协议。
telegram · zaihuapd · Jul 9, 13:22
背景: 美国战争部最初是内阁部门(1789-1947 年),负责陆军及早期海军事务,后被国防部取代。2025 年 9 月,特朗普总统签署行政令,授权将“战争部”作为国防部的副称。Anthropic 是一家由前 OpenAI 员工创立的、注重 AI 安全的公司,此前因监控顾虑终止了与战争部的合作,凸显了军事 AI 合作中的持续紧张。
标签: #OpenAI, #AI ethics, #surveillance, #US military, #AI policy
📊 运行统计 · 总耗时
17m 13s· AI 分析3m 42s· Tokens0.86 MCY(输入0.59/ 输出0.27MCY)