Qwen 3.8 27B 开源权重模型获赞:推理强、本地运行快
Qwen 3.8 27B open-weights LLM earns praise for reasoning and local speed
⭐️ 9.0/10

Qwen 团队在 Hugging Face 上发布了 Qwen 3.8 27B,这是一个 270 亿参数的开权重语言模型,采用 FP8 精度。早期社区测试显示其推理能力强,在普通笔记本电脑上本地运行表现良好。 这一发布之所以重要,是因为一个强大的开权重 27B 模型可以在消费级硬件上本地运行,让更多人无需依赖云服务就能使用高性能 AI。社区的热烈反应也表明,用户对开放替代方案的需求日益增长,开源权重模型(如 Gemma 4)之间的竞争将更加激烈。 据一位评论者称,Qwen 3.8 27B 是继 Gemma 4 之后第二个通过其私有推理基准的本地模型,不过在使用多 token 预测(MTP)的情况下,它需要多花 5 倍的 token 和 12 分 30 秒。其他评论者指出,FP8 版本的显存占用效率似乎低于 Gemma 4 或 Glimmer;还有 RTX 5090 用户在使用 ninfer 推理引擎时测到约 138 tokens/s 的速度。

hackernews · erdaltoprak · Aug 14, 15:00 · 社区讨论

背景: Qwen 是阿里巴巴的 AI 模型系列,其中许多模型以 Apache 2.0 等开放许可证分发。“开权重”意味着模型的训练参数可以公开获取,任何人都能下载、检查、微调或运行。所谓“本地 LLM 推理”,就是在自己的硬件上运行训练好的模型,而不是把提示词发送给 OpenAI、Google 等公司的远程云服务器。

参考链接

社区讨论: 社区反应非常积极:用户称赞 Qwen 3.8 27B 的推理质量,并认为它在笔记本电脑上表现出色,有人说它是“目前见过的最棒的、能在笔记本上运行的鹈鹕模型”。同时也有务实提醒,比如显存占用较高、推理链路较慢;许多人兴奋地表示,开源权重模型正接近此前由美国大厂主导的前沿能力。

标签: #Qwen, #LLM, #Open Source, #Local AI, #Benchmarks


GLM-5.3 发布:前沿编程与突现网络能力
GLM-5.3 Release Shows Frontier Coding and Emergent Cyber Capabilities
⭐️ 9.0/10

Z.ai 发布了 GLM-5.3,这是 GLM 5.2 的后训练升级版本,在编程性能上达到前沿水准,并在 Terminal Bench 3.0 和 Agents' Last Exam 上取得开源模型最优结果。该版本还展现出“突现的网络能力”,用户报告了自主漏洞利用行为,Z.ai 也在 cvd.z.ai 运行协调漏洞披露平台。 这一发布意义重大,因为大模型驱动的网络能力进步速度超出许多人的预期,可能降低漏洞发现成本,同时引发新的安全与披露问题。它影响安全研究人员、企业和 AI 安全团队,并加剧了与 OpenAI、Anthropic 等前沿模型厂商的竞争压力。 基准对比显示部分模型仍然领先,有评论者指出在利用链基准上“Mythos 5 在 181 和 247 项任务上仍然明显领先”。社区测试包括 WordPress 插件 0-day、RCE 漏洞利用,以及 Linux 6.8 内核漏洞利用适配;Z.ai 的 CVD 门户上还列出了大量处于保密期的严重/高危 CVE。

hackernews · pella · Aug 14, 05:19 · 社区讨论

背景: Z.ai(前身为智谱 AI)是一家中国人工智能公司,开发 GLM 系列大语言模型,自 2025 年 7 月起以 MIT 许可发布其中多个模型;该公司于 2025 年 1 月被列入美国实体清单,并于 2026 年 1 月在香港证券交易所上市。AI 的突现能力是指较小模型中不存在、但在更大模型中突然出现的能力;自主智能体如今已能在几分钟内发现、串联并利用漏洞,而人类渗透测试人员过去往往需要数周。

参考链接

社区讨论: 讨论总体积极但保持克制:一位用户描述了在 Claude Code 环境中用 GLM-5.3 无缝执行红队任务,包括 0-day 和 RCE;另一位用户则突出了大规模开源软件漏洞扫描及保密期内的披露行为。还有人指出该模型“与 Sol 和 Fable 仍有一点差距,但仅差一点”,同时提出从 OpenAI 切换的经济顾虑,并赞赏这篇博客读起来像研究人员所写而非营销宣传。此外,讨论中也存在对自主扫描和大规模漏洞披露的伦理与安全担忧。

标签: #AI, #Cybersecurity, #LLM, #Coding, #Vulnerability Discovery


X 开源“为你推荐”算法并推出“限流”自查工具
X Open-Sources 'For You' Algorithm and Adds Shadow-Ban Check Tool
⭐️ 9.0/10

X 已在 GitHub 上开源“为你推荐”页面的推荐算法源代码,并推出一个透明度工具,让用户查看自己的账号或单条帖子在上个月是否被标记为“限制可见性”。这些数据还可以下载下来供离线分析。 X 公开了其最常用信息流背后的代码,推动了算法问责,也让“影子封禁”做法更容易被察觉。此举可能促使其他平台提供类似的透明度,并影响关于内容推荐的公共讨论。 这一“限流”工具目前处于试点阶段,会随机抽取符合条件账号,条件包括账号注册满 1 年,且上个月发帖不少于 10 次。X 还表示,开源 For You 代码后,其开源代码库规模扩大了约 10–15 倍。

rss · 小互(@imxiaohu) · Aug 14, 02:37

背景: “为你推荐”页面是 X(原 Twitter)的默认算法信息流,它结合用户互动、内容信号和声誉评分来选择并排列帖子。过去这些排序机制是专有的,导致外界对不透明审核和“影子封禁”(即用户内容被悄悄降权)产生担忧。开源这些代码并推出可见性标签查询工具,兑现了 Elon Musk 此前关于算法透明的承诺。公开的代码库还包括基于 PageRank 的用户声誉组件和基于 GraphJet 的实时流式服务。

参考链接

标签: #recommendation algorithm, #open source, #social media, #transparency, #algorithmic accountability


X 开源 For You 时间线算法,权重全面透明
X Open-Sources Its For You Timeline Algorithm with Transparent Weights
⭐️ 9.0/10

X 已将其 For You 时间线的推荐算法开源,代码发布在 xai-org/x-algorithm 仓库中。此次发布公开了决定帖子可见性的排名因素和权重,使推荐逻辑可被公众审查。 这标志着主流社交平台在透明度方面取得了重大突破,让用户、研究人员和监管机构能够准确了解内容是如何被排名的。同时,这也为 AI/ML 系统中的算法问责树立了先例。 该仓库专注于影响 For You 帖子可见性的代码透明化;部分组件(如 Phoenix 评分模型)设计为可端到端运行。该算法每天从约 5 亿条帖子中筛选出最终显示在用户设备上的少量帖子。

rss · meng shao(@shao__meng) · Aug 14, 02:20

背景: X(前身为 Twitter)曾于 2023 年在 twitter/the-algorithm 仓库中首次开源其推荐算法。For You 时间线算法通常根据用户的历史互动、类似用户的参与情况以及热门话题对帖子进行评分。开源这些代码旨在让用户完全了解帖子是如何被推荐的。

参考链接

标签: #algorithm, #open-source, #transparency, #recommendation-system, #X/Twitter


Qwen 3.8-Max 登陆 Modal,支持 100 万上下文与 DFlash 推测解码
Qwen 3.8-Max Debuts on Modal with 1M Context and DFlash Speculator
⭐️ 9.0/10

阿里 Qwen 宣布,Qwen 3.8-Max(Qwen3.8-2.4T-A95B)现已在 Modal 平台上提供,配备定制的 DFlash 推测器并支持完整的 100 万 token 上下文窗口。这是拥有 2.4T 参数的重大模型发布。 将拥有 2.4T 参数的 MoE 模型和 100 万上下文窗口部署到无服务器平台,标志着大规模 LLM 推理可及性的一个里程碑。这也凸显了 DFlash 等推测解码技术在降低延迟和成本方面日益重要的作用。 该模型名为 Qwen3.8-2.4T-A95B,表明其采用混合专家(MoE)架构,总参数 2.4T,但仅约 95B 参数处于激活状态。定制的 DFlash 推测器使用以工具调用为主的数据训练,并且 Modal 提供的是完整上下文窗口,而非缩减版本。

rss · Qwen(@Alibaba_Qwen) · Aug 14, 15:32

背景: DFlash 是一种推测解码方法,由一个小型草稿模型(推测器)提出一批未来 token,再由更大的验证模型(主 LLM)接受或拒绝这些 token,从而在不损害输出质量的前提下加速推理。Modal 是面向 AI 和数据团队的无服务器计算平台,让开发者能够大规模运行 GPU 和 CPU 工作负载。DFlash 等推测解码技术正被主要推理服务提供商广泛采用,可将每秒 token 数提升 2-3 倍。

参考链接

社区讨论: 引用的 Modal 推文强调了该模型的可用性和定制 DFlash 推测器。原帖公开评论有限,但从“喜欢看到我们的发布合作伙伴 Modal 从第一天就全力投入!”以及高互动量(345 个赞、28,964 次浏览)来看,整体情绪积极。在所提供的内容中,没有看到批评性讨论或反驳意见。

标签: #LLM, #Qwen, #Modal, #AI Infrastructure, #Model Release


Qwen3.8-Max 在 Together AI 上线,总参数达 2.4T
Qwen3.8-Max Goes Live on Together AI with 2.4T Parameters
⭐️ 9.0/10

阿里巴巴 Qwen 团队宣布,Qwen3.8-Max(正式名称为 Qwen3.8-2.4T-A95B)现已在 Together AI 上线,Together AI 是 Day 0 发布合作伙伴。这款开源权重混合专家模型拥有 2.4T 总参数、95B 活跃参数和 1M token 的上下文窗口。 这是一次重要的开源权重模型发布,规格达到企业级水平,Day 0 合作表明 Together AI 提供了强大的基础设施支持。这可能加速大型 MoE 模型在云 GPU 平台上的应用,并加剧开源 LLM 领域的竞争。 模型名称 'Qwen3.8-2.4T-A95B' 揭示了其混合专家(MoE)架构:总参数 2.4 万亿,但每个 token 仅激活 950 亿参数,从而提升推理效率。Together AI 强调其强大的编码和智能体(agent)能力,1M 上下文窗口支持长文档和复杂智能体工作流。

rss · Qwen(@Alibaba_Qwen) · Aug 14, 15:24

背景: 混合专家(MoE)是一种机器学习技术,将模型划分为多个专门的子网络(即“专家”),并通过路由机制在每次输入时只激活少数相关专家。这就是该模型总参数达 2.4T 但推理时仅激活 95B 参数的原因,从而在不大幅牺牲能力的前提下降低计算成本。开源权重的 MoE 模型已成为 LLM 发展的重要趋势,其他大规模模型发布也体现了这一点。

参考链接

标签: #Qwen, #Together AI, #LLM, #Model Release, #AI Infrastructure


GPT-5.6-Sol 在 16 小时内自主证明 Crouzeix 猜想
GPT-5.6-Sol Autonomously Proves Crouzeix's Conjecture in 16 Hours
⭐️ 9.0/10

北京神经外科住院医师 Shanmu Jin 使用 ChatGPT Work 中的 OpenAI GPT-5.6-Sol 模型,在 16 小时内自主得出了 Crouzeix 猜想的证明。该结果经 Michel Crouzeix 本人审阅,并由包括 Alex Townsend 在内的数学家验证。 这标志着一个重大里程碑:AI 系统自主提出了证明一个长期数学猜想的关键思路。它预示着 AI 辅助研究的范式转变,可能加速数学及其他科学领域的发现。 该证明是在模型断网的状态下自主运行 16 小时生成的。根据 arXiv 论文,该解决方案结合了先前用于较弱估计的工具和针对 2-膨胀的简单扰动引理。GPT-5.6-Sol 是 OpenAI 的前沿模型,以强大的编码和推理能力著称。

rss · The Rundown AI(@TheRundownAI) · Aug 14, 15:20

背景: Crouzeix 猜想是 Michel Crouzeix 于 2004 年提出的矩阵分析领域的未解问题,涉及复矩阵函数范数与其数值域之间的关系,在数值线性代数中具有重要意义。GPT-5.6-Sol 是 OpenAI GPT-5.6 系列中的旗舰模型,专为复杂推理和智能体工作流设计。ChatGPT Work 是 OpenAI 的一款产品,允许用户委派任务并运行长时间的工作流。

参考链接

标签: #AI, #mathematics, #GPT, #breakthrough, #research


Cursor 被 SpaceX 收购,加入 SpaceXAI 助力 Grok
Cursor Acquired by SpaceX, Joins SpaceXAI to Build Grok
⭐️ 9.0/10

Cursor 官方宣布已完成被 SpaceX 的收购,正式加入 SpaceXAI 团队。团队将致力于改进 Grok、Grok Build、Grok Bot、Grok API 以及 Cursor 等产品,目标是让 Grok 成为全球最实用的 AI。 此次收购重塑了 AI 编程工具格局,将最广泛使用的 AI 代码编辑器之一与 Grok 模型置于同一阵营。这标志着 AI 工具与模型的整合进一步加深,并可能对依赖 Cursor 的开发者以及整个 AI 助手市场产生重大影响。 该交易为全股票交易,对 Cursor(Anysphere)的估值达 600 亿美元,并于 2026 年 8 月 14 日完成。Cursor 将成为 SpaceX 的全资子公司,整合至 SpaceXAI 部门;另有报道称,Grok 4.6 在预训练时已使用了 Cursor 的数据。

rss · Cursor(@cursor_ai) · Aug 14, 13:02

背景: Cursor 成立于 2022 年,前身为 Anysphere,是一款 AI 驱动的编程助手和 IDE,允许开发者通过自然语言指令编辑代码、搜索代码库并完成编程任务。SpaceXAI 前身为 xAI,是 SpaceX 旗下的 AI 部门,负责开发包括 Grok 4.6 在内的 Grok 模型系列。此次收购发生在 2026 年 5 月更大规模的重组之后,当时 Grok 和 X 已并入 SpaceX 的 AI 部门。

参考链接

标签: #acquisition, #AI, #SpaceX, #Cursor, #Grok


Gemini 4:谷歌 DeepMind 最雄心勃勃的预训练运行
Gemini 4 Announced as Google DeepMind's Most Ambitious Pre-training Run Yet
⭐️ 9.0/10

谷歌 DeepMind 的 Logan Kilpatrick 宣布,Gemini 4 是他们迄今为止最雄心勃勃的预训练运行,确认下一代前沿模型已进入训练阶段。 这很重要,因为 Gemini 4 代表了谷歌的下一代旗舰 AI 模型,更雄心勃勃的预训练运行意味着可能带来重大能力跃升,从而重塑领先 AI 实验室之间的竞争格局。 Gemini 4 尚未作为公开模型发布,已确认处于预训练阶段。谷歌在 2026 年 7 月 21 日的模型公告末尾宣布了这一计划,据报道公司正转向每月发布 AI 模型的节奏。

rss · Logan Kilpatrick(@OfficialLoganK) · Aug 14, 02:28

背景: 预训练是构建大型语言模型的初始阶段,系统从大量未标记数据中学习通用模式和知识,之后再进行微调以适应特定任务。Gemini 是谷歌 DeepMind 的多模态 AI 模型系列,Gemini 4 是即将推出的前沿模型,目前正处于预训练阶段,表明它仍处于开发的早期阶段。

参考链接

标签: #AI, #Gemini 4, #Google DeepMind, #Pre-training, #LLM


npm 12 发布:安装脚本默认关闭,注册表转向显式信任
npm 12 Released: Install Scripts Default Off, Registry Shifts to Explicit Trust
⭐️ 9.0/10

npm 12 默认将安装脚本改为可选启用,并限制非注册表来源,以提升安全性和信任度。运行脚本(包括隐式构建)现在需要明确批准。 这是全球最大包注册表在安全默认配置上的重大变化,改变了包安装的信任模型。它将影响数百万 JavaScript 开发者和组织,减少供应链攻击面,但可能需要调整工作流程。 脚本许可现在默认关闭,更新还限制非注册表来源。这些变化回应了社区长期以来对包安装过程中自动执行脚本的担忧。

rss · InfoQ · Aug 14, 06:39

背景: npm 生命周期脚本在包安装过程中会自动执行,攻击者曾在 Axios 的 postinstall 远程访问木马等事件中利用这一点。新的显式信任模型要求开发者批准此类行为,这与 ignore-scripts 等现有最佳实践一致,也属于行业向更强软件供应链安全迈进的更广泛趋势。

参考链接

标签: #npm, #security, #JavaScript, #package management, #software supply chain


Meta 开源 Muse Glimmer:30B 端侧智能体模型
Meta Open-Sources Muse Glimmer: 30B On-Device Agentic Model
⭐️ 9.0/10

Meta AI Research 发布了 Muse Glimmer,这是一个采用 Apache 2.0 许可证的 300 亿参数开源权重模型,专为端侧自主智能体和多模态任务执行而设计。它让消费级 GPU 上的本地工作流无需依赖云端 API。 此次发布通过将智能体能力带到消费级硬件,显著推动了开源权重 AI 的发展,并减少了对云端 API 的依赖。开发者、研究人员和企业现在可以使用 30B 模型构建私有的本地自动化和编码助手。 Muse Glimmer 采用多阶段训练方法以实现高效性能,并支持多模态输入,从而增强编码和自动化任务。Apache 2.0 许可证允许广泛的商业和研究用途。

rss · InfoQ · Aug 14, 05:05

背景: 智能体模型指能够自主运行、表现出目标驱动行为和适应性的 AI 系统,通常利用工具和记忆来完成任务。开源权重模型允许任何人下载并在本地运行其训练参数,从而在没有专有限制的情况下进行研究、修改和部署。Muse Glimmer 结合了这些概念,目标是消费级 GPU 上的本地执行。

参考链接

标签: #AI, #Open Source, #On-Device, #Agentic Model, #Meta


苹果换帅:库克卸任 CEO,特努斯 2026 年起接任
Apple CEO Transition: Cook to Board Chairman, Ternus Takes Helm in 2026
⭐️ 9.0/10

苹果宣布管理层交接:现任 CEO 蒂姆·库克将出任董事会执行董事长,硬件工程高级副总裁约翰·特努斯将从 2026 年 9 月 1 日起担任新任 CEO。董事会已一致批准这项安排,库克将在整个夏天继续担任 CEO,与特努斯完成过渡。 这是苹果自 2011 年以来首次更换 CEO,对公司未来发展方向具有关键意义。特努斯多年来领导硬件工程,他将在后库克时代主导苹果的产品战略,影响整个科技行业和全球消费者。 特努斯于 2001 年加入苹果,2013 年升任硬件工程副总裁,2021 年进入高管团队。现任董事长 Arthur Levinson 将于 2026 年 9 月 1 日转任首席独立董事,特努斯同日加入董事会。

telegram · zaihuapd · Aug 14, 11:00

背景: 蒂姆·库克自 2011 年接替史蒂夫·乔布斯以来一直担任苹果 CEO,带领公司成为全球最有价值的企业之一。此次交接意义重大,因为苹果的领导层变动并不常见。约翰·特努斯是硬件领域的资深管理者,近年负责 iPhone、Mac、iPad、AirPods 等产品的研发。为期五个月的有序交接反映出苹果对继任计划进行了周密安排。

标签: #Apple, #CEO transition, #Tech industry, #Leadership


PostgreSQL 修复 to_char 高危堆溢出漏洞,可执行任意代码
PostgreSQL Patches Critical to_char Heap Overflow Enabling Code Execution
⭐️ 9.0/10

PostgreSQL 披露了 CVE-2026-14669,这是 to_char(timestamptz) 函数在处理超长 POSIX 时区缩写时引发的堆缓冲区溢出。该漏洞允许低权限数据库用户以 PostgreSQL 服务进程的操作系统权限执行任意代码,修复版本为 18.6、17.11、16.15、15.19 和 14.24。 该漏洞 CVSS 评分为 8.8,影响所有受支持的 PostgreSQL 分支,并允许已认证的低权限用户完全控制数据库服务器。鉴于 PostgreSQL 部署广泛,管理员应将此视为紧急修补事项。 受影响版本包括 18.5、17.11、16.15、15.19 和 14.24 之前的所有版本;由于 18.5 因回归问题未正式发布,18 系列用户应直接升级至 18.6,其他版本用户应分别升级至 17.11、16.15、15.19 或 14.24。此次小版本更新无需转储数据库或运行 pg_upgrade,更新程序文件并重启服务即可。

telegram · zaihuapd · Aug 14, 14:35

背景: to_char 是 PostgreSQL 的格式化函数,可将时间戳、区间和数字转换为格式化字符串,而 timestamptz 是带时区的时间戳类型。POSIX 时区规范允许使用类似 'EST' 的缩写或尖括号内的任意字符串,当 to_char 处理超长或畸形缩写时就可能溢出缓冲区。堆溢出是一种内存安全缺陷,攻击者通常可利用它实现任意代码执行,因此这是一个严重的远程代码执行风险。

参考链接

标签: #postgresql, #security, #CVE, #vulnerability, #database


密码学专家探讨执法黑客的“走向黑暗”时代
Cryptography Expert Explores the 'Going Dark' Era of Law Enforcement Hacking
⭐️ 8.0/10

在 Cryptography Engineering 博客的一篇新文章中,一位密码学专家指出,“走向黑暗”的争论已从推动后门转向拥抱执法部门黑客手段——即主动利用软件漏洞来访问加密设备和通信。 这种重新定义之所以重要,是因为它将监控辩论从法律授权转向技术能力,引发了关于漏洞披露、消费设备安全以及隐私与执法之间平衡的关键问题。这篇文章引发了热烈讨论,反映了它与当前加密政策之争的相关性。 文章讨论了窃听的历史、漏洞公平裁决流程(VEP)以及漏洞挖掘的实际限制,包括可能触及有用漏洞“天花板”的说法。它还涉及安全差距,指出虽然资源充足的参与者能发现漏洞,但许多组织在基本安全卫生方面仍然失败。

hackernews · vslira · Aug 14, 20:52 · 社区讨论

背景: “走向黑暗”之争指的是执法部门在访问加密通信和数据方面遇到的挑战,他们认为这妨碍了刑事调查。作为回应,一些政府推动后门或其他合法访问机制,而另一些政府则转向执法黑客手段——利用漏洞访问设备。漏洞公平裁决流程(VEP)是美国政府的一个框架,用于决定是向供应商披露新发现的零日漏洞,还是将其保留用于情报和进攻性网络行动。从历史上看,窃听需要实体基础设施,但现代拦截越来越依赖技术利用和科技公司的合作。

参考链接

社区讨论: 社区评论涵盖了多种观点:Animats 提供了昂贵的数字前窃听的历史背景,而 mbroshi 认为 AI 生成的代码正在增加漏洞,挑战了漏洞“天花板”的说法。Insimwytim 对资源充足的国家行为者与忽视基本安全的公司进行了对比,fitblipper 则鉴于监控摄像头和元数据共享的普遍性,质疑“走向黑暗”这一标签本身。

标签: #cryptography, #law enforcement, #security, #hacking, #government surveillance


Opus 5 为何让人感觉更难用?面向智能体的表达与过度道歉引不满
Why Opus 5 Feels Worse to Work With: Agent-Speak and Over-Apologies Frustrate Users
⭐️ 8.0/10

一篇关于 Anthropic Claude Opus 5 的新批评文章(发布于 mun-logadan.github.io)指出,尽管该模型能力更强,但由于省略式表达、过度道歉和面向智能体的沟通方式,使用体验反而更差。这篇文章在 Hacker News 引发了 770 分、705 条评论的热烈讨论。 这场讨论标志着 AI 开发可能出现转向:模型优化目标从面向人类用户变成了面向其他智能体。这对依赖 Claude 的开发者、专业用户和普通用户都很重要,也为新一代前沿模型的用户体验设计提出了紧迫问题。 根据 Anthropic 的发布说明,Opus 5 定位为强大的智能体编程模型,适合长时、多步骤任务,在公开基准测试中名列前茅,但在网络安全任务上仍落后于 Mythos 5。然而,评论者反馈其沟通风格令人疲惫,有人甚至改用 OpenAI 的 Sol,或退回 Opus 4.8。

hackernews · numeri · Aug 14, 10:12 · 社区讨论

背景: Claude Opus 是 Anthropic 的高端模型系列,Opus 5 针对智能体编程和知识工作进行优化。“省略式表达”(elliptical writing)指省去词汇和上下文的文风,往往显得简短而抽象;“面向智能体的沟通”(agent-oriented communication)指输出主要为了给其他 AI 智能体读取,而不是给人阅读。理解这些概念是看懂这篇批评文章的关键。

参考链接

社区讨论: 评论者大体认同这篇批评,抱怨省略式表达、过多的“认错”式坦白,以及话多但令人疲惫的对话。有人表示已改用 OpenAI 的 Sol 或退回 Opus 4.8,还有人推测 Anthropic 正在优先优化智能体而非人类;也有观点担心基准分数掩盖了日常使用体验的下降。

标签: #AI, #LLM, #UX, #human-AI interaction, #model behavior


Firefox 成为唯一支持 uBlock Origin 的主流浏览器
Firefox now the only major browser supporting uBlock Origin
⭐️ 8.0/10

Firefox 现在是最后一个仍能运行完整版 uBlock Origin 的主流浏览器,而 Chrome、Edge 等基于 Chromium 的浏览器已迁移到不再支持该扩展的 Manifest V3。这使得 Firefox 成为主流用户进行强力内容拦截的唯一选择。 这很重要,因为 uBlock Origin 长期以来是拦截广告、追踪器和恶意脚本最有效的工具之一,而 MV3 的限制削弱了大多数浏览器的广告拦截能力。这也体现了浏览器厂商而非用户决定扩展权限的行业趋势。 关键技术限制在于 Manifest V3 移除了广泛的 webRequestBlocking 权限,替代的 declarativeNetRequest API 限制了扩展的规则集数量并设置了静态规则上限。Firefox 仍同时支持 Manifest V2 和 V3,并且会对 uBlock Origin 等热门扩展进行人工代码审查;此外还有一个非官方的 MV3 移植版,但并非完整替代品。

hackernews · DemiGuru · Aug 14, 19:03 · 社区讨论

背景: 浏览器扩展是修改浏览器行为的小程序,其能力由 manifest 文件定义。Manifest V3(MV3)是 Google 推出并主导的最新扩展平台版本,它改变了权限模型以提升隐私、安全和性能,但也使 uBlock Origin 这类功能完整的内容拦截器无法在基于 Chromium 的浏览器上运行。Firefox 的扩展平台则继续支持旧版 API,因此这些扩展仍可正常使用。

参考链接

社区讨论: 评论者大多认为这是用户自由的损失,有评论指出 Google 无视反对意见强行推进 MV3,就像“温水煮青蛙”。也有人提到 Firefox 对 uBlock Origin 的额外代码审查,讨论非官方 uBlock-MV3 移植版,并对 uBlock Origin Lite 的广告拦截效果给出了不同评价。

标签: #privacy, #ad-blocking, #browsers, #extensions, #manifest v3


智谱发布 GLM-5.3:凭强化学习登顶开源编程,仍逊于闭源模型
GLM-5.3 Debuts as Top Open-Source Coding Model via RL, Trailing Closed Models
⭐️ 8.0/10

智谱 AI 发布了 GLM-5.3,它与 GLM-5.2 共用同一个基座模型,所有提升均来自后训练阶段的强化学习。GLM-5.3 在 Terminal Bench 3.0 上获得 28.3 分、在 DeepSWE v1.1 上获得 66.9 分,拿下了多项编程基准的开源模型最高分。 这一发布表明,在不更换基座模型的情况下,扩大后训练阶段的强化学习规模可以显著提升编程与安全能力。由于 GLM-5.3 的权重将公开发布,一个接近前沿水平的漏洞发现引擎将进入公共领域,既带来机遇也引发安全担忧。 关键指标包括 CyberGym 得分 84.5%,超过 GPT-5.6 Sol 的 83.6%和 Fable 5 的 83.8%;ExploitBench 从 24.4%跃升至 54.4%。GLM-5.3 不再支持关闭思维链,只能在 low、high、max 三档思考级别间切换,权重将在两周后发布。技术栈沿用 GLM-5.2 时期的 slime 框架、IndexShare 和 SAO。

rss · 宝玉(@dotey) · Aug 14, 05:50

背景: 强化学习后训练是在预训练之后,通过任务执行的反馈来优化模型行为。Terminal Bench 3.0、DeepSWE 和 Agents' Last Exam 等基准用于衡量智能体在终端或软件环境中完成长周期真实任务的能力。智谱还表示,该模型在 269 个开源项目中发现了 2,436 个真实漏洞,其中 1,097 个为中高危,暗示出了涌现式的攻防安全能力。

参考链接

标签: #AI, #GLM, #LLM, #强化学习, #编程


智谱 GLM-5.3 仅靠后训练大幅提升编程与网络安全能力
Zhipu's GLM-5.3 Boosts Coding and Cybersecurity via Post-Training Only
⭐️ 8.0/10

智谱 AI 发布了 GLM-5.3,底层基座模型与 GLM-5.2 完全相同,所有提升均来自后训练。内部评测显示其编程能力较 GLM-5.2 提升 50%,网络安全能力据称与 Anthropic 的 Mythos 5 持平,并在 269 个开源项目中发现了 2436 个真实漏洞。 这一发布表明,仅靠后训练就能在编程、网络安全等专业领域带来显著提升,而无需更换基础模型。这加剧了前沿大模型厂商之间的竞争,对开发者、安全研究人员以及评估模型能力的企业都具有重要意义。 相关说法来自第三方摘要和智谱内部评测,而非官方技术报告。该模型据称在 269 个开源项目中发现了 2436 个真实漏洞,这一具体成果为网络安全能力的宣称提供了支撑。

rss · 小互(@imxiaohu) · Aug 14, 13:41

背景: 大语言模型通常分为两个训练阶段:预训练从大规模数据中获取广泛知识,后训练则用于对齐行为并强化特定技能。Anthropic 的 Mythos 5 是一款主打网络安全的进阶模型,因此与之持平是一个值得关注的基准。这一案例说明,仅靠后训练也能成为提升能力的强有力手段。

参考链接

标签: #AI, #GLM, #LLM, #Post-training, #Cybersecurity


X 开源 For You 算法,公布精确动作权重
X Open-Sources For You Algorithm, Reveals Exact Action Weights
⭐️ 8.0/10

X 已开源其 For You 时间线推荐算法的源代码,首次公开了用户动作对应的精确数值权重,例如点赞计 0.5 分、复制链接转出计 20 分。此次发布还包含过滤与标签系统以及真实的训练代码。 这种前所未有的透明度为研究者和开发者提供了一个主流社交平台如何对内容排序的具体参考,其思路从黑盒式的相关度打分转向显式的动作预测。这可能引发社区更深入的讨论,并推动对推荐系统的独立审计。 该算法采用多任务方式,分别预测用户是否会点赞、回复、复制链接转发或举报某条帖子,再将各概率合成为一个分数。配置文件中列出了 21 个正权重和 5 个负权重,相比此前仅公开结构框架的开源版本有大幅扩展。

rss · 小互(@imxiaohu) · Aug 14, 11:49

背景: X(原 Twitter)已根据 Apache v2 许可在 GitHub 上开源其 For You 推荐算法,本次扩展版本包含模型配置、过滤器以及核心排序系统细节,据报道开源代码库规模增加了约 10 到 15 倍。这一做法反映了业界向多任务深度推荐系统发展的趋势,即模型同时优化多个目标,而不是只计算单一相关度分数。

参考链接

标签: #algorithm, #open source, #recommendation system, #machine learning, #X/Twitter


GPT-5.6 Sol 低推理强度超越 GPT-5.5 高推理强度
GPT-5.6 Sol Outperforms GPT-5.5 at Lower Reasoning Intensity
⭐️ 8.0/10

OpenAI 官方测试显示,GPT-5.6 Sol 在“低”推理强度下的表现超越了 GPT-5.5 在“高”推理强度下的水准,同时使用更少的 Token,并能更敏锐地识别无效信息。 这标志着 LLM 推理效率的一次重大飞跃,意味着用户可以用更低的算力和延迟获得同等甚至更好的结果。这可能改变开发者配置推理强度参数的方式,并促使竞争对手在效率上加大投入。 GPT-5.6 于 2026 年 7 月 9 日全面开放,并以三个独立模型发布:Sol、Terra 和 Luna,而不是同一模型上的三种设置。Sol 是面向最困难编码、智能体和研究工作的顶级能力档,在公开基准榜单中排名靠前。

rss · 小互(@imxiaohu) · Aug 14, 11:27

背景: GPT-5.6 是 OpenAI 最新一代模型,已在 ChatGPT、Codex 和 API 中提供。推理强度是一个控制模型在回答前“思考”多少算力的设置;强度越高通常准确率越高,但会消耗更多 Token 并增加延迟。这条消息表明,Sol 的原生能力提升显著,其低强度输出甚至超过了上一代模型的高强度输出,从而节约成本和时间。

参考链接

标签: #GPT-5.6, #OpenAI, #LLM, #Efficiency


MiniMax 开源 Music 3.0,8GB 显存生成 5 分钟完整歌曲
MiniMax Open-Sources Music 3.0, Generates 5-Minute Songs on 8GB GPUs
⭐️ 8.0/10

MiniMax 开源了 Music 3.0 模型,只需输入歌词和一段风格描述,即可一次性生成包含前奏、副歌、桥段在内的五分钟完整歌曲,输出 32kHz 立体声音频。整个模型在单张 8GB 显存的显卡上即可运行,官方还同时开源了 1000 个模板和一个扩写技能。 仅需 8GB 显存就能运行,Music 3.0 大幅降低了本地生成完整歌曲的门槛,使个人开发者和小型团队都能利用先进的 AI 音乐创作能力。同时,开源策略鼓励社区进行二次开发和创新,在日益激烈的 AI 音乐赛道中具有重要影响。 该模型输出 32kHz 立体声音频,虽低于 CD 标准的 44.1kHz,但足以满足大多数收听场景。值得注意的是,它能一次生成长达五分钟、结构完整的歌曲,而官方附带的 1000 个模板和扩写技能也能帮助用户更方便地创作出多样化的作品。

rss · 小互(@imxiaohu) · Aug 14, 05:38

背景: AI 音乐生成模型通常根据文本提示、歌词或风格描述来生成音频,但许多模型需要较大的 GPU 显存和算力,限制了实际应用。MiniMax Music 3.0 的特点在于完全开源,并且能在仅有 8GB 显存的环境下运行,还支持对流派和风格的精准控制。32kHz 采样率是数字音频中常见的一种标准,常见于消费级设备,虽然低于 CD 的 44.1kHz,但足以满足日常聆听和原型制作的需求。

参考链接

标签: #AI音乐生成, #开源模型, #MiniMax, #音频生成, #深度学习


GLM-5.3 发布,本周 AI 大模型密集上新
GLM-5.3 Launches Amid a Week of Major AI Releases
⭐️ 8.0/10

智谱 AI(Z.ai,原智谱 AI)在本周末发布了 GLM-5.3。本周此前已有 Grok 4.6、DeepSeek V4 Pro、DeepSeek Harness 以及 DeepSeek API 涨价等消息,推文还提到甚至没有提及 Gemini 3.7 Flash。 GLM-5.3 紧随其他前沿模型发布,标志着 AI 实验室之间的竞赛进一步加速,也为开发者提供了更多领先的开源权重选择。这可能会影响编程和智能体(agent)任务的模型选型。 据智谱 AI 官方文档,GLM-5.3 在多项主流基准测试中位居开源模型前列,编程与智能体能力比肩 Claude Fable 5。推文本身未披露技术参数,DataLearner 提醒不宜将 GLM-5.2 的 753B MoE 架构、1M 上下文、价格和 MIT 许可证信息直接套用到新版本。

rss · meng shao(@shao__meng) · Aug 14, 05:40

背景: GLM(General Language Model)是智谱 AI(Z.ai)旗舰大语言模型系列。Z.ai 在海外曾以智谱 AI(Zhipu AI)名义运营,是中国“AI 六虎”之一,并于 2026 年 1 月在港交所上市;自 2025 年 7 月起以 MIT 开源许可发布 GLM 模型。本次发布发生在一个异常拥挤的周末,此前已有 Grok 4.6、DeepSeek V4 Pro 及 DeepSeek Harness 开发者预览版等发布。这一背景凸显了 2026 年开源权重模型发展的快速节奏。

参考链接

标签: #GLM, #大语言模型, #AI发布, #人工智能


Qwen3.8-27B 现已支持 Ollama
Qwen3.8-27B Is Now Available on Ollama
⭐️ 8.0/10

阿里巴巴通义千问宣布 Qwen3.8-27B 现已支持 Ollama,Ollama 官方确认可通过 CLI 命令在 Claude Code、OpenCode、Hermes Agent 和 Pi 等工具中使用该模型。此次发布还包含面向 Apple Silicon 优化的 MLX 版本,模型标识为 qwen3.8:27b-mlx。 此次集成让开发者通过熟悉的本地工具即可使用 27B 规模下性能领先的开源权重模型,降低了智能体编程和专业 AI 工作流的使用门槛。它也巩固了 Ollama 作为本地运行开源模型重要枢纽的地位,并反映了 AI 生态中模型与 harness 兼容性日益重要的趋势。 Ollama 文档提供了类似ollama launch claude --model qwen3.8的命令,用于 Claude Code,并为 OpenCode、Hermes Agent 和 Pi 提供了类似命令。模型卡还显示 Qwen3.8-27B 在 SWE-bench Pro 上获得 61.7 分。

rss · Qwen(@Alibaba_Qwen) · Aug 14, 17:44

背景: Qwen 是阿里巴巴的开源大语言模型系列,Qwen3.8-27B 是 27B 参数规模的最新一代模型,面向编码、智能体任务和专业工作负载设计。Ollama 是广泛使用的本地大模型运行时,用户可通过简单的 CLI 和 API 拉取并运行开源模型。这里的“harness”指将模型连接到开发者工作流的应用框架或智能体工具。在 Ollama 上可用意味着开发者无需自建基础设施,就能在现有工具中使用这些模型。

参考链接

标签: #Qwen, #Ollama, #大语言模型, #模型发布, #AI


Qwen3.8-2.4T-A95B:2.4 万亿参数开源模型在 SiliconFlow 上线
Qwen3.8-2.4T-A95B: 2.4T-Parameter Open Model Goes Live on SiliconFlow
⭐️ 8.0/10

阿里 Qwen 已开源 Qwen3.8-2.4T-A95B 模型,SiliconFlow 已提供 Day-0 支持。该模型现已在 SiliconFlow 平台上线,可通过 API 立即使用。 这次发布意义重大,因为一个拥有 2.4 万亿参数、但仅激活 950 亿参数的开源模型,通过易用的 API 为开发者带来了前沿级别的智能。它支持自主编程、深度研究和端到端智能体执行,适用于高强度工作负载,影响整个 AI 生态。 Qwen3.8-2.4T-A95B 拥有 2.4 万亿总参数,每次推理激活 950 亿参数,支持 100 万 tokens 上下文窗口和最多 12.8 万 tokens 输出。SiliconFlow 上的定价为:每 100 万输入 tokens 2.00 美元,每 100 万输出 tokens 6.00 美元,每 100 万缓存输入 tokens 0.25 美元。

rss · Qwen(@Alibaba_Qwen) · Aug 14, 16:50

背景: Qwen 是阿里巴巴的开源大语言模型系列,命名中的“2.4T-A95B”表示采用混合专家(MoE)设计,总参数达 2.4 万亿,但每次前向传播仅激活 950 亿参数。这种稀疏激活方式在保留巨大模型容量的同时控制了推理成本。SiliconFlow 是一个 AI 推理云平台,为开源模型提供优化且可通过 API 访问的部署服务,因此 Day-0 可用性对希望立即使用新模型的开发者很有价值。

参考链接

标签: #AI/ML, #LLM, #Model Launch, #Qwen, #SiliconFlow


Qwen3.8-2.4T-A95B 模型现已上线 DeepInfra
Qwen3.8-2.4T-A95B MoE Model Now Available on DeepInfra
⭐️ 8.0/10

阿里巴巴 Qwen 团队宣布,新的稀疏混合专家模型 Qwen3.8-2.4T-A95B 现已上线 DeepInfra API 平台。该模型拥有 2.4 万亿总参数、950 亿激活参数、512 个专家,以及原生 262K token 上下文窗口。 此次发布使得前沿规模的 MoE 模型可通过托管 API 获得,开发者无需拥有大规模 GPU 基础设施即可构建先进的编码、智能体及推理应用。这也反映了在 DeepInfra 等高性价比推理平台上部署超大规模稀疏模型的趋势。 根据 DeepInfra 的公告,定价为每百万输入 token 2.00 美元、每百万输出 token 6.00 美元、每百万缓存 token 0.20 美元。该模型专为编码、智能体工作流和复杂推理场景设计。

rss · Qwen(@Alibaba_Qwen) · Aug 14, 16:27

背景: 专家混合(MoE)是一种机器学习技术,将模型划分为多个专门的子网络(即“专家”),并且对于每个输入仅激活其中的一部分。这使得模型可以扩展到数万亿参数,同时保持推理计算量可控。DeepInfra 是一个为大型机器学习模型提供高性价比、生产级托管的平台,用户可以通过简单的 API 调用来部署这些模型。

参考链接

标签: #LLM, #AI, #Qwen, #DeepInfra, #Model Release


Qwen3.8-27B 开源模型发布,首发日即支持 AMD 本地运行
Qwen3.8-27B open-source model launches with day-zero AMD local support
⭐️ 8.0/10

阿里 Qwen 团队发布了 Qwen3.8-27B,这是一款原生多模态 dense 开源权重模型,并在发布首日即支持 AMD Ryzen AI Max+处理器和 Radeon AI PRO R9700 显卡。用户可通过 LM Studio 和 lemonade server 在发布当天就在本地运行该模型。 此次发布通过首发日即支持 AMD 平台,强化了开源本地 AI 生态,为开发者提供了不依赖 NVIDIA/CUDA 的高性能替代方案。这降低了在消费级及专业级 AMD 硬件上本地开发编码、智能体和办公自动化应用的门槛。 Qwen3.8-27B 是一个拥有 270 亿参数的 dense 原生多模态模型,擅长编码、智能体工作流和办公自动化任务。AMD 的首日支持覆盖集成 RDNA 与 XDNA 加速器的 Ryzen AI Max+处理器,以及单块 Radeon AI PRO R9700 显卡,并通过 LM Studio 和 lemonade server 实现运行。

rss · Qwen(@Alibaba_Qwen) · Aug 14, 16:18

背景: AMD GPU 在 LLM 软件支持方面历来落后于 NVIDIA,因为许多 AI 工具都围绕 CUDA 构建,而 AMD 的 ROCm 栈为受支持的硬件提供了一个开源的 GPU 计算平台,可用于 LLM 推理。首发日支持意味着该模型和工具链在公开发布前或发布时已与 AMD 团队合作,针对这些 AMD 平台进行了测试和优化。Qwen3.8-27B 是阿里巴巴最新 Qwen3.8 开源权重系列的一部分,定位为面向开发者的高性能本地运行模型。

参考链接

标签: #Qwen, #LLM, #AMD, #Open Source, #Local AI


Qwen 联合 SGLang 在 RTX 5090 上实现 206 tok/s 推理速度
Qwen and SGLang Achieve 206 tok/s on RTX 5090 for Qwen3.8-27B
⭐️ 8.0/10

阿里巴巴 Qwen 宣布,SGLang 已对开源的 Qwen3.8-27B 模型提供 Day-0 支持,在单张 RTX 5090 显卡上实现了每秒 206.1 token 的解码速度。该性能依托 NVFP4 量化与 DSpark 技术,同时在 DGX Spark 上测得了 38.28 tok/s 的速度。 这一里程碑表明,小型开源模型可以在消费级硬件上以实时速度运行,降低了本地部署智能体 AI 的门槛。同时,它也凸显了模型开发者与 SGLang 等推理引擎之间紧密协作的重要性。 基准测试数据为:在单张 RTX 5090 上使用 NVFP4 与 DSpark 实现 206.1 tok/s 解码速度,在 DGX Spark 上为 38.28 tok/s。Qwen3.8-27B 面向智能体规划与长程任务设计,SGLang 通过其开源框架提供了即时支持。

rss · Qwen(@Alibaba_Qwen) · Aug 14, 15:55

背景: SGLang 是一个开源框架,用于大语言模型的高吞吐量服务,其设计目标是降低延迟并提高推理效率。Qwen 是阿里巴巴出品的大语言模型系列,Qwen3.8-27B 是该系列中最新发布的小型模型。每秒 token 数是衡量 LLM 推理速度的常用指标,而 RTX 5090 是 NVIDIA 最新款消费级 GPU。所谓'Day-0 支持',是指模型发布的当天推理框架即完成优化并可用。

参考链接

标签: #LLM Inference, #SGLang, #RTX 5090, #Performance, #GPU


Qwen3.8-Max 在 Fireworks 上线,提供 Day-0 支持
Qwen3.8-Max Launches on Fireworks with Day-0 Support
⭐️ 8.0/10

阿里巴巴的 Qwen3.8-Max 模型(Qwen3.8-2.4T-A95B)现已在 Fireworks AI 上线,Fireworks 作为 Day-0 发布合作伙伴。这个拥有 2.4 万亿参数的混合专家(MoE)模型面向智能体工作负载、重度编程和长上下文任务。 这使开发者能够通过 Fireworks 的高性能推理平台,立即在生成环境中使用 Qwen 3.8 系列中最大的开源权重模型之一。这可能加速阿里巴巴旗舰模型在编程智能体和长上下文应用中的采用,加剧开放模型提供商之间的竞争。 该模型采用混合专家(MoE)架构,总参数达 2.4 万亿,激活参数约 950 亿(A95B)。它已在 fireworks.ai/models/fireworks/qwen3p8-max 上线,并针对编程、智能体工作流和大上下文窗口进行了优化。

rss · Qwen(@Alibaba_Qwen) · Aug 14, 15:26

背景: Qwen 是阿里巴巴云开发的大型语言模型系列;Qwen3.8-Max 是 Qwen 3.8 系列中旗舰的正式发布模型,是 Qwen 3.8 Max Preview 的继任者,支持多模态推理、视觉理解、编程和智能体工作流。Fireworks AI 是一个推理和模型服务平台,托管 Qwen、Llama、DeepSeek 等开源模型,注重速度和成本效率。大上下文窗口允许模型处理长输入,而 MoE 架构通过每 token 仅激活部分参数来高效扩展参数数量。

参考链接

标签: #Qwen, #LLM, #AI, #Model Release, #Fireworks


阿里公布 Qwen3.8-27B 性能
Alibaba Qwen Details Performance of New Qwen3.8-27B
⭐️ 8.0/10

阿里 Qwen 团队通过推文公布了新模型 Qwen3.8-27B 的性能详情,并展示了基准测试图表。该模型是基于 Qwen3.5 架构的原生多模态稠密开源模型,在编程、智能体工作流和办公自动化方面表现出色。 Qwen3.8-27B 以紧凑、易部署的形态在本地硬件上提供出色性能,让开发者和企业更容易获得高性能多模态 AI。作为顶级 AI 实验室的开源权重发布,它加强了开源生态,也加剧了中等尺寸模型的竞争。 根据 Hugging Face 模型卡,Qwen3.8-27B 在 MathVision 评测中使用固定提示词,要求逐步推理并用\boxed{}格式输出答案,而其他模型则从两种提示变体中取较高分。它是一款稠密视觉语言模型,支持灵活的思维控制,并可通过 LM Studio 本地部署。

rss · Qwen(@Alibaba_Qwen) · Aug 14, 15:02

背景: Qwen 是阿里巴巴的开源大语言模型系列,涵盖稠密和混合专家架构。'原生多模态'意味着模型可以直接处理文本和图像,无需单独的视觉编码器。稠密模型在推理时激活全部参数,性能表现可预测,而开源权重让开发者可以在自己的基础设施上微调和部署模型。

参考链接

标签: #Qwen, #LLM, #AI, #Model Performance


阿里 Qwen 发布 Qwen3.8-27B 及 Max 级 MoE 开源权重
Alibaba Qwen Releases Open Weights for Qwen3.8-27B and Max-Level MoE
⭐️ 8.0/10

阿里巴巴 Qwen 团队发布了 Qwen3.8-27B 的开源权重,这是一个原生多模态稠密模型,综合表现超过 Qwen3.7-Plus;同时发布了 Max 级 Qwen3.8-2.4T-A95B 的权重。两者现均以 Apache 2.0 许可开放下载。 此次发布使高性能多模态模型以宽松许可证广泛可用,开发者无需依赖特定厂商即可本地运行或构建智能体。这也凸显了开源权重发布与封闭前沿模型竞争的日益增长趋势。 Qwen3.8-27B 拥有 270 亿参数,原生支持 262K token 的上下文长度,并可通过 YaRN 扩展至 100 万 token。Qwen3.8-2.4T-A95B 是一个混合专家(MoE)模型,总参数为 2.4 万亿,每次激活 950 亿参数。

rss · Qwen(@Alibaba_Qwen) · Aug 14, 15:02

背景: 开源权重模型会发布训练好的神经网络参数,任何人都可以下载并在本地运行,但通常不包含完整的训练数据或代码库。稠密模型对每个输入都使用全部参数,而混合专家(MoE)模型则将输入路由到专门的专家子集,以提高效率。YaRN 是一种位置插值技术,可以将基于旋转位置编码的模型的上下文窗口扩展到超过原始训练长度。

参考链接

标签: #AI, #LLM, #Open Source, #Qwen, #Multimodal


Qwen 预告 Qwen3.8-27B 即将在 HuggingFace 发布
Qwen Teases Qwen3.8-27B Release on HuggingFace Within Hours
⭐️ 8.0/10

阿里巴巴 Qwen 团队在 X 上发布预告,称新模型 Qwen3.8-27B 将在不到两小时内上线 HuggingFace,并附带了倒计时图片和模型页面链接。 此次发布表明领先 AI 实验室之一在开源大语言模型方面继续发力,为开发者提供了又一个强大的密集多模态选择。它可能加剧与其他开源模型系列的竞争,并影响围绕 HuggingFace 的生态。 根据早期的模型页面信息,Qwen3.8-27B 是一个基于 Qwen 3.5 架构、拥有 270 亿参数的密集因果语言模型,并带有视觉编码器。它原生支持 262,144 个 token 的上下文,可通过 RoPE 缩放扩展到约 100 万 token,权重开放。

rss · Qwen(@Alibaba_Qwen) · Aug 14, 13:08

背景: Qwen 是阿里巴巴的开源权重 AI 模型系列,在 HuggingFace 上被广泛使用和下载。此前的 Qwen2.5、Qwen3 等型号使该系列成为其他开源 LLM 的热门替代选择,通常提供长上下文窗口和多模态能力。

参考链接

标签: #LLM, #Qwen, #HuggingFace, #Model Release, #AI


卡兰尼克公开透露一直在默默打造工业 AI 公司 Atoms
Travis Kalanick Reveals He Was Quietly Building Industrial AI Company Atoms
⭐️ 8.0/10

特拉维斯·卡兰尼克公开透露,过去八年他一直在低调打造工业 AI 公司 Atoms。这一消息是在与本·霍洛维茨的炉边对话中披露的,霍洛维茨表示对 Atoms 的投资是他迄今为止开出的最大一笔支票。 这标志着卡兰尼克这位科技与风险投资界最具影响力的人物之一的高调回归,也表明投资界对工业 AI 作为下一个前沿领域下了重注。a16z 的投资规模凸显了对制造、房地产和物流等实体行业自动化的高度期待。 Atoms 将制造业、房地产和物流视为物理世界的 CPU、存储和网络,并致力于部署‘有薪工作的机器人’。据 TechCrunch 报道,Atoms 完成了由 a16z 领投的 17 亿美元融资,优步也参与其中。

rss · a16z(@a16z) · Aug 14, 15:32

背景: 卡兰尼克最广为人知的身份是优步的联合创始人兼前 CEO,他于 2017 年在争议中离开。工业 AI 指的是为高风险的实体环境专门构建的 AI 系统,与通用 AI 不同,它注重可靠性、可预测性和可解释性。Atoms 官网阐述的愿景是制造‘有薪工作的机器人’——拥有生产性工作、为所有者和社会带来富足的专用机器人。

参考链接

标签: #AI, #Industrial AI, #Venture Capital, #Startups, #Podcast


15 张数据图揭秘 DeepSeek Harness 的插件架构与 AI 辅助开发
15 Charts Reveal DeepSeek Harness's Plugin Architecture and AI-Driven Development
⭐️ 8.0/10

一篇新的数据分析文章用 15 张数据图剖析了 DeepSeek 刚以开发者预览版发布的开源智能体框架 DeepSeek Harness。分析发现其插件系统与 Koishi 高度相似,大量提交疑似由 AI 生成,整个项目在 65 天内产出了约 84 万行代码。 这件事很重要,因为它提供了首批独立、代码层面的视角,展示 DeepSeek 如何构建生产级 Agent 基础设施以及多么依赖 AI 辅助开发。它也凸显了 DeepSeek Harness 生态的快速增长——发布 20 小时内 GitHub star 已超过 8 万。 分析显示,Codex 相关命名出现在 21.2%的主干 PR 和 28.2%的分支信息中,项目引用最多的外部 Agent 项目依次是 Pi、Codex 和 Claude Code。界面方面,项目最初采用 TUI,后来改为 Web UI 与 TUI 双入口,最终删除了全部 TUI;同时原本 52 个工具和科学模型 schema 最终只保留一个,以减少上下文占用。

rss · 歸藏(guizang.ai)(@op7418) · Aug 14, 09:40

背景: DeepSeek Harness(dsh)是 DeepSeek AI 推出的开源 Agent Harness,模型、工具、技能、会话、沙箱、存储、循环、调度和 UI 等所有能力都以插件形式组合,底层基于 Cordis 框架。其插件架构与 Koishi 相似,Koishi 是一个围绕插件系统构建的跨平台聊天机器人框架,因此分析者猜测 DeepSeek 可能大量复用了 Koishi 的代码或挖角了其核心开发者。Claude Code 是 Anthropic 面向开发者的 Agentic 编码工具,分析认为提交信息与分支命名中留有这类 AI 助手的痕迹,说明项目大量使用了 AI 辅助开发。

参考链接

标签: #DeepSeek, #AI Development, #Data Analysis, #Software Engineering, #Harness


ExtractBench 基准:评测扫描、旋转与手写文档提取
ExtractBench Ranks Document AI on Scans, Rotations, Handwriting
⭐️ 8.0/10

LlamaIndex 发布了 ExtractBench,这是一个覆盖扫描、旋转和手写文档的新型文档提取基准。对 14 个系统的初步测试显示,Codex 擅长扫描文档但在旋转文档上表现不佳,而 OCR API 恰好相反。 现实世界的文档往往很杂乱——复印件、传真件或手写表格——该基准揭示出主流 AI 提取系统存在不均的“感知盲区”。ExtractBench 为企业和研究者提供了一种标准化方法,可以在真实生产中遇到的挑战上对系统进行比较,而不仅仅是在干净的电子 PDF 上。 该基准包含 1950 年代的监管申报文件、手填税务表格,以及受传真阈值处理、复印机色调曲线、传感器噪声和手机拍摄等影响的退化页面。LlamaIndex 自家的 Agentic Plus 提取层级是唯一没有明显盲区的被测系统,在旋转、扫描和手写文档上分别得分 95.9%、93.9% 和 93.8%。

rss · Jerry Liu(@jerryjliu0) · Aug 14, 23:28

背景: 文档提取是将非结构化或半结构化文档转换为结构化数据(通常是 JSON)以供下游工作流使用的过程。干净的电子 PDF 对现代 LLM 和 OCR 工具来说相对容易,但经过扫描、旋转或手写的实体文档会带来感知挑战,许多系统对这些情况的处理不一致。ExtractBench 旨在将这些真实场景下的评估标准化。

参考链接

标签: #document extraction, #benchmark, #OCR, #LLM, #AI


SQLite WAL 重置漏洞经数月遥测取证终被发现
SQLite WAL-Reset Bug Found via Forensic Telemetry After Months of Outages
⭐️ 8.0/10

SQLite 的 WAL(预写日志)代码中一个深层漏洞(被 SQLite 开发者命名为“WAL 重置 bug”)被确认为持续生产中断的根本原因。团队在生产环境中部署被动取证遥测,花了数月时间才定位到这一可能已存在至少 16 年的 bug。 SQLite 是最广泛使用的数据库引擎之一,嵌入在无数应用中,因此一个造成真实中断的隐蔽损坏 bug 影响深远。该案例还凸显了生产遥测和长期取证调试对于诊断罕见且无法复现的竞态条件的重要性。 该 bug 涉及 WAL 索引文件中的一个竞态条件(具体涉及 mxFrame 和 nBackfill 字段),并且似乎只在非常特定的时序条件下触发,导致无法进行合成复现。由于没有可靠的触发条件来复现该问题,团队不得不依赖被动取证遥测。

rss · Michael Tsai · Aug 14, 18:59

背景: SQLite 通常使用回滚日志来实现原子提交,但 WAL 模式通过将更改写入单独的日志文件来提升并发性和性能。在 WAL 模式下,检查点操作将 WAL 合并回主数据库,而协调该过程中的竞态条件可能在不产生任何错误提示的情况下损坏数据库。此类损坏可能数月不被察觉,尤其是在特定 I/O 时序或多进程访问模式下才显现时。

参考链接

标签: #sqlite, #database, #bug, #reliability, #forensics


Faraday:270 亿参数智能体在研究复现中击败 Claude Opus 4.8 和 GPT-5.5
Faraday: 27B Agent Beats Claude Opus 4.8 and GPT-5.5 on Research Replication
⭐️ 8.0/10

研究人员提出了 Replica——一个用于研究复现的可扩展强化学习任务空间,并据此训练出 270 亿参数的智能体 Faraday。Faraday 在留出的研究复现任务上,以自动生成的评分标准评判器作为奖励信号,超越了 Claude Opus 4.8 和 GPT-5.5。 这表明,在正确的强化学习目标下,一个相对较小的 270 亿参数模型也能在科学推理任务上超越更大的前沿模型。它指向了将长周期科学能力直接训练进权重、而非依赖复杂外部机制的方向。 Replica 的每个任务都要求智能体在有限的时间和计算预算内、在不查看原图的情况下复现论文中的一张图。初始任务集包含 310 个任务,来自 100 篇机器学习和 AI for Science 论文,涵盖自然语言处理、材料科学等领域。

rss · elvis(@omarsar0) · Aug 14, 17:00

背景: 研究复现是指独立重现实验结果以验证结论的过程,但这一过程很少被自动化。Replica 将其转变为可扩展的强化学习环境,奖励来自自动生成的评分标准评判器,该评判器与人类对复现质量的评估一致。Faraday 将编程智能体作为工具调用,回滚分析表明它学会了科学原则性的策略,而不是钻评分标准的空子。

参考链接

标签: #AI, #Reinforcement Learning, #Research Replication, #Agent


Meta 的 Wiggle 框架:LLM 评委在压力下高达 91%的判决翻转
Meta's Wiggle Framework: LLM Judges Flip Verdicts Up to 91% Under Pressure
⭐️ 8.0/10

Meta 的 Wiggle 框架对 9 个前沿模型在 14 项评审任务中进行了压力测试,发现 LLM 评委在静态重新提示下 25%–71%的情况下会翻转判决,在面对对抗性说服者时 62%–91%的情况下会翻转。这表明基于黄金数据的标准准确性验证并不能反映判决能否经受住质疑。 这些发现挑战了仅通过黄金数据上的准确性来验证 LLM 评委的常见做法,因为高准确率并不能说明其在压力下的稳健性。这对 LLM 评估、AI 安全以及任何依赖模型判断的系统都有广泛影响。 该框架沿三个轴评估稳定性:重新提示下的稳定性、单次质疑下的稳定性以及持续压力下的稳定性。论文还报告称,改变判决的压力几乎总是相对于真实答案具有净腐蚀作用,而陪审团多数基线强度是预测哪些条目会发生变化的最佳单次指标。

rss · elvis(@omarsar0) · Aug 14, 15:50

背景: LLM 评委是用于评估其他模型输出的语言模型,通常通过黄金数据(人工标注的参考答案)进行验证。然而,这篇论文认为,这种验证忽略了评委的判决受到质疑时是否保持稳定。Wiggle 框架为 LLM 评委引入了压力测试,预印本已在 arXiv 上发布。

参考链接

标签: #LLM, #evaluation, #Meta, #AI safety, #research


开源权重模型 GLM-5.3 达到前沿性能
Open-Weight Model GLM-5.3 Hits Frontier Performance
⭐️ 8.0/10

Z.ai 发布了开源权重模型 GLM-5.3,并声称其性能达到前沿水平,可与 OpenAI 和 Anthropic 的模型匹敌。该模型经过 743B 基础模型的后训练,具备顶级的代码编写和智能体(agentic)能力。 这一里程碑表明,开源权重模型正在缩小与封闭专有系统的差距,有望让开发者和企业以更低成本、更高定制性接入前沿 AI。这可能加剧 AI 模型市场的竞争,并加速开源替代方案的采用。 GLM-5.3 定位为编程和网络防御设计,其网络安全能力被描述为开源模型中的重大飞跃。据 Z.ai 称,该模型顶级的编码和智能体能力来自对 743B 参数基础模型的后训练;技术博客见 z.ai/blog/glm-5.3。

rss · elvis(@omarsar0) · Aug 14, 15:23

背景: 开源权重模型是指训练参数公开的 AI 模型,任何人都可以下载、运行并在自己的硬件上进行微调。Z.ai 是一家中国 AI 公司,推出了 GLM 系列开源权重模型;GLM-5 是其新一代基础模型,面向智能体工程和长程任务设计。在大型基础模型上进行后训练是一种常见技术,用于提升模型在编程、安全等任务上的专门能力。

参考链接

标签: #AI, #Open-Weight Models, #GLM, #Machine Learning


编码工具链几乎攻克 ARC-AGI-3,Amjad Masad 宣称
Coding Harness Nearly Solves ARC-AGI-3, Amjad Masad Claims
⭐️ 8.0/10

Amjad Masad 声称,仅添加一个编码工具链就几乎解决了 ARC-AGI-3 基准测试,并引用了 Jeremy Berman 使用 Opus 5 取得的 96.2%的成绩。这条推文表明编码能力可以泛化 LLM,这一预测似乎得到证实。 这支持了近期的一种观点:编码能力可以将 LLM 泛化到抽象推理任务,可能加速 AGI 的进程。同时表明基准测试的表现可能更依赖于脚手架而非仅仅模型架构。 Jeremy Berman 报告称,使用 Claude Code 加 Opus 5(high)及一个操作命令和文件系统日志,在 ARC-AGI-3 上取得 96.2%的成绩,pass@2 为 99.3%。据其推文称,该设置几乎完全与任务无关,'几乎没有 ARC 特定内容'。

rss · Amjad Masad(@amasad) · Aug 14, 04:45

背景: ARC-AGI(通用人工智能抽象与推理语料库)是一个基准测试,通过简单的人类易解但对 AI 困难的网格推理任务来测试系统的通用流体智力。编码工具链是包装大语言模型的基础设施层,为其提供工具、权限和上下文管理,使其成为自主编码代理。

参考链接

标签: #ARC-AGI, #LLM, #Coding, #AI Generalization, #Benchmarks


Anthropic 发布负责任扩展政策下的第二份风险评估报告
Anthropic Publishes Second Risk Report Under Responsible Scaling Policy
⭐️ 8.0/10

Anthropic 在 X(推特)上宣布,其第二份风险评估报告已发布,可在 anthropic.com/aug-2026-risk-report 查看。该报告详细说明了其 AI 系统的风险以及公司在负责任扩展政策下的应对准备。 此次发布对 AI 安全治理具有重要意义,因为它提高了前沿模型风险的透明度。它会影响整个 AI 行业、政策制定者和研究人员,他们依赖此类披露来理解和降低 AI 相关风险。 该报告是 Anthropic 负责任扩展政策(RSP)要求的定期报告系列中的第二份,该政策将模型部署与安全阈值挂钩。这条推文显示了很高的参与度(211 条评论,40.2 万次浏览),表明公众对 AI 风险透明度有浓厚的兴趣。

rss · Anthropic(@AnthropicAI) · Aug 14, 18:00

背景: Anthropic 于 2023 年 9 月推出了负责任扩展政策,作为预测和防范日益强大的 AI 模型带来的新兴威胁的框架。该政策要求定期发布风险报告,分享有关系统风险和准备情况的详细信息。第二份风险评估报告延续了这一透明度努力。

参考链接

标签: #AI Safety, #Responsible Scaling, #Risk Report, #Anthropic, #AI Policy


DeepSeek V4 Flash 之后,大模型开始卷「智效比」
After DeepSeek V4 Flash, LLM Race Shifts to Intelligence Efficiency
⭐️ 8.0/10

DeepSeek 发布了 V4 Flash,这是一个总参数量 284B(激活参数 13B)的混合专家(MoE)模型,支持百万 token 上下文,定位为更快捷、经济的轻量级选项。该发布推动大模型行业的竞争焦点从单纯的能力转向 '智效比'。 这一转变意义重大,因为在 Agent 时代,模型需要自主执行长程多步任务,效率与成本与原始智能同样重要。开发者和企业在选型时将更多依据 '智能性价比' 而不是顶尖的基准分数。 V4-Flash-0731 正式版于 2026 年 7 月 31 日发布,标志着该系列从预览态进入成熟的生产可用阶段,并针对长程 Agent 和工程任务进行了优化。DeepSeek V4 Pro 目前保持不变,正式版预计将很快发布。

rss · 爱范儿 · Aug 14, 02:14

背景: 大多数大语言模型以推理能力和上下文长度等能力为评估标准,但实际部署还取决于推理成本与速度。MoE 架构通过每次只激活部分参数来降低算力消耗。DeepSeek 是一家以开源权重模型闻名的中国 AI 研究公司。代理型 AI 的兴起使得模型需要自主完成多步任务,长上下文与效率由此成为关键的选型指标。

参考链接

标签: #DeepSeek, #大模型, #AI效率, #模型发布


Hacker News 每日摘要:AI 模型发布与安全担忧
Hacker News Daily Digest Highlights AI Model Releases and Security Concerns
⭐️ 8.0/10

2026 年 8 月 15 日的 Hacker News 摘要涵盖十条重要新闻,头条是开源模型 GLM-5.3 编程能力显著提升并涌现出网络安全能力,以及 Google 正式发布 Gemini 3.7 Flash,价格仅为前代一半。 这份摘要反映了 AI 模型开发竞赛的加速,尤其是开源权重模型正接近闭源模型性能,同时带来新的安全风险。它还显示出编码和智能体任务上价格竞争加剧和性能提升,直接影响开发者与企业。 值得注意的条目包括 GLM-5.3 在 CyberGym 上得分 84.5%、在 ExploitBench 上得分 54.4%;Gemini 3.7 Flash 每百万 token 输入 $0.75、输出 $3.75;Cerebras 与 OpenAI 的 GPT-5.6 Sol Ultrafast 每秒输出 750 token。摘要还涵盖支持 262K 上下文的 Qwen3.8-27B-FP8、Opus 5 的可用性问题,以及一个讽刺现代网站烦人设计的网页。

rss · HackerNews每日摘要 on SuperTechFans · Aug 14, 23:22

背景: Hacker News 是一个以科技为核心的社交新闻网站,用户提交并讨论链接,每日摘要会精选评分最高的故事。本期摘要突出了大语言模型的趋势:GLM-5.3 等开源权重模型正在缩小与专有模型的差距,而 Gemini 3.7 Flash 和 Qwen3.8-27B-FP8 等新模型系列针对编码和智能体工作流进行了优化。FP8 指 8 位浮点格式,用于降低 AI 推理中的内存和计算成本。

参考链接

社区讨论: 关于 GLM-5.3 的评论褒贬不一:许多人称赞其强性能和低成本(例如通过 OpenCode 每月 10 美元就能匹敌每月 200 美元的订阅),但也有人担心该模型能在没有安全限制的情况下自主执行 0-day 漏洞利用。用户还讨论了 Claude Code、OpenCode 等“harness”在塑造模型行为中的作用,对手动审查模式和安全实践各有偏好。

标签: #AI, #Hacker News, #Tech News, #Security, #Open Source


AI 将 zlib 的 C 代码翻译为 Lean,并证明压缩往返属性
AI proves zlib round-trip property by translating C to Lean
⭐️ 8.0/10

最近在一次播客访谈中,受访者提到同事 Kim Morrison 借助 AI 把广泛使用的压缩库 zlib 从 C 语言翻译成证明助手 Lean,并形式化证明了“先压缩再解压能恢复原始数据”这一性质。大约一周就完成了,而在六个月前这还被认为是不可能的。 这标志着 AI 辅助形式化验证的一个重要里程碑:AI 现在能够把真实世界的 C 库移植到证明助手中,并证明深层正确性属性,而不仅仅是玩具示例。它意味着形式化验证的软件库可能变得实用得多——由 AI 承担大部分验证工作,人类只需审查证明。 该证明确立了 zlib 基于 Deflate 的数据格式中“解压是压缩的逆操作”这一关键不变量。初始证明完成后,后续工作转向优化代码,同时确保这些优化不会破坏已验证的往返属性。

rss · Ryan Peterman · Aug 14, 13:03

背景: zlib 是一个免费、广泛使用的无损压缩库,实现了 Deflate 算法,并随许多操作系统一起分发。Lean 是一个开源证明助手和函数式编程语言,允许用户编写可被机器检查的数学证明。形式化验证利用这些证明来说明软件对所有可能的输入都满足某种形式化规范,而传统上这项工作非常耗费人力。

参考链接

标签: #AI, #formal verification, #Lean, #zlib, #software engineering


Anthropic 推出检测 Claude 文本的水印检测 API
Anthropic announces watermark detection API for Claude-generated text
⭐️ 8.0/10

Anthropic 宣布将推出水印检测 API,让第三方能够验证文本是否由 Claude 生成。该技术基于 Google DeepMind 的 SynthID,在不影响文本质量的前提下调整词汇选择的随机性。 这将为独立平台、出版方和监管机构提供一种实用工具,用于验证 AI 生成文本的真伪并遏制虚假信息。这也标志着行业在溯源标准方面迈出重要一步,继 Google 推出 SynthID 之后。 该水印技术通过调整词汇选择时的随机性来工作,但在事实密集型文本、代码以及大幅改写的内容上存在已知局限。Anthropic 在公告中未透露具体发布日期或 API 条款。

rss · The Decoder · Aug 14, 21:29

背景: SynthID 是 Google DeepMind 的一项技术,可直接在 AI 生成的图像、音频、文本或视频中嵌入人眼不可感知的数字水印,并能在不降低输出质量的情况下进行检测。文本水印一直是一个活跃的研究领域,因为大型语言模型让人们越来越难以区分人类写作和 AI 写作。第三方能够使用检测工具,被视为建立线上 AI 内容信任的关键。

参考链接

标签: #AI, #Watermarking, #Anthropic, #Content Detection, #API


阿里巴巴 Qwen 发布 Apache 2.0 许可的 Qwen 3.8 开放权重模型
Alibaba's Qwen Releases Qwen 3.8 Open-Weight Models Under Apache 2.0
⭐️ 8.0/10

阿里巴巴 Qwen 团队以 Apache 2.0 许可发布了 Qwen 3.8,这是一个稠密的 270 亿参数模型。该模型原生支持最高 262,000 个 token 的上下文,并旨在编程和办公任务上超越更大的 Qwen 3.7 Plus。 此次发布通过提供具有宽松许可的高性能、可本地部署的模型,增强了开放权重 AI 生态系统。它为开发本地和智能体应用的开发者提供了一个替代大型专有模型的竞争性选择。 Qwen 3.8 是一个稠密模型,意味着它在每次输入时激活全部参数,而非采用混合专家(MoE)架构。其 262K token 的上下文窗口支持长文档处理和复杂的智能体工作流,同时 Apache 2.0 许可允许商业使用和修改(需保留署名)。

rss · The Decoder · Aug 14, 17:01

背景: 开放权重模型使初创企业、大学和企业无需从头进行昂贵训练或按任务支付 API 费用即可使用先进 AI。稠密模型每次输入都会使用全部参数,提供一致的性能;上下文窗口则决定了模型生成输出时能同时考虑多少文本。

参考链接

标签: #AI, #Open Source, #Model Release, #Qwen, #Alibaba


研究质疑 OpenAI 与 Anthropic 关于自主 AI 研究即将实现的声明
Study challenges OpenAI, Anthropic claims that autonomous AI research is near
⭐️ 8.0/10

一项与普林斯顿大学和英国 AI 安全研究所合作开展的研究发现,使用 Claude Opus 4.8 和 GPT-5.6 Sol 的前沿 AI 智能体未能写出可发表的科研论文,原作者将其成果评为“拒绝”。这些模型能处理研究工程,但在研究判断、创造性解决问题以及放弃失败方法方面存在不足。 这一结果反驳了 Anthropic 和 OpenAI 近期关于自主 AI 研究即将实现的声明。它为 AI 安全与评估讨论提供了实证依据,表明前沿模型仍缺乏关键的人类研究能力。 这些智能体获得了六天时间、3000 美元 API 额度和 GPU 访问权限,被要求根据未发表的 NeurIPS 论文独立撰写论文。尽管它们能完成整个研究工程流程,但在研究判断、创造性解决问题以及判断何时放弃失败方法方面表现不佳。

rss · The Decoder · Aug 14, 16:06

背景: 前沿 AI 模型是当前可用的最先进人工智能系统,经过海量数据训练,在众多任务上达到顶尖性能。OpenAI 和 Anthropic 等公司曾表示,这些模型可能很快就能执行自主研究,但本研究表明,真正的科学工作所需的判断力和创造力仍难以自动化。研究工程(运行流程、编写代码、格式化结果)与研究判断(选择有前景的方向、解读发现、放弃死胡同)之间的区别,是评估 AI 距离真正独立研究还有多远的核心。

参考链接

标签: #AI research, #autonomous agents, #AI evaluation, #frontier models, #AI safety


OpenAI 推出 Ultrafast 模式:GPT-5.6 Sol 在 Cerebras 硬件上提速 14 倍
OpenAI's Ultrafast mode makes GPT-5.6 Sol 14x faster on Cerebras hardware
⭐️ 8.0/10

OpenAI 推出了名为“Ultrafast”的新推理模式,通过 Cerebras 硬件使 GPT-5.6 Sol 的输出速度达到每秒 750 个 token,提升 14 倍。该模式与“Standard”和“Fast”一起构成了三级定价结构,将推理速度本身转化为产品。 这一举措将推理速度变成高端产品层级,可能重塑 AI 服务的定价和交付方式。它会影响依赖低延迟 AI 响应的企业和开发者,并凸显 Cerebras 晶圆级硬件作为 GPU 基础设施的有力竞争者。 该模式基于 OpenAI 与 Cerebras 之间 100 亿美元的合作伙伴关系;速度以每秒输出 token 数衡量,这与任务总耗时不同,因为推理模型在输出前通常需要“思考”时间。价格分为 Standard、Fast 和 Ultrafast 三档。

rss · The Decoder · Aug 14, 14:21

背景: Cerebras 制造晶圆级引擎(WSE),其芯片面积远大于典型 GPU,专为超快 AI 工作负载设计。GPT-5.6 Sol 是 OpenAI GPT-5.6 系列中的旗舰模型,于 2026 年 7 月发布,擅长复杂推理、编码和智能体工作流。“每秒输出 token 数”衡量模型开始生成后的文本生成速度,但不包含“思考”时间在内的完整延迟。此次发布反映了将推理速度作为 AI 市场关键差异化因素这一更广泛的趋势。

参考链接

标签: #OpenAI, #Cerebras, #GPT-5.6, #inference, #AI hardware


智谱 AI 发布 GLM-5.3,号称最强开放权重编程模型
Zhipu AI releases GLM-5.3, claims strongest open-weights coding model
⭐️ 8.0/10

智谱 AI 发布了 GLM-5.3,这是一款开放权重的编程模型,据称仅通过后训练就在其前代基础上实现了 50%的提升。根据智谱的基准测试,GLM-5.3 帮助安全团队在 269 个项目中发现了 2,436 个漏洞,模型权重计划在两周后开源。 如果得到独立验证,GLM-5.3 可能成为最强大的开放权重编程模型,为专有编程助手提供一个可信的开源替代方案。其强大的漏洞发现能力也凸显了 AI 在网络安全中日益重要的作用,可能改变安全团队进行代码审计和漏洞挖掘的方式。 所声称的性能提升完全来自后训练,而非基础模型架构或预训练的变化。漏洞发现结果基于智谱自己的基准测试,尚未被独立复现;两周后的开放权重发布将使更广泛的社区能够验证这些说法。

rss · The Decoder · Aug 14, 10:21

背景: 开放权重 AI 模型将其训练后的参数公开提供,允许开发者下载并针对特定任务进行微调。后训练是指在初始预训练之后的额外微调阶段,它将通用语言模型转变为面向编程或安全分析等任务的专用助手。GLM 是智谱 AI 开发的一系列大语言模型,智谱 AI 是一家以具有竞争力的开源模型而闻名的中国人工智能公司。

参考链接

标签: #AI/ML, #coding model, #open-weights, #GLM, #cybersecurity


AI 人体组织实验室年测 300 万样本,有望终结动物试验
AI Human-Tissue Labs Test 3M Samples a Year, Aim to End Animal Testing
⭐️ 8.0/10

Vivodyne 在旧金山湾区运营 12 个机器人“蜂巢”实验室,培养人体组织并用 AI 设计实验,每年可进行超过 300 万次受控测试。这一年度产能大约是美国全部临床试验受试者总数的两倍。 由于约 90%的临床试验在通过动物测试后仍然失败,这种大规模的人体组织模型有望大幅提升对药效和安全性的预测能力。如果得到验证,它可能使动物测试过时并加速药物开发。 每个机器人实验室大约一个衣柜大小,AI 系统会设计实验以优化信息获取。该技术仍处于早期阶段,在监管审批中取代动物模型之前还需要进一步验证。

telegram · zaihuapd · Aug 14, 01:48

背景: 动物测试长期以来一直是预测人体药物反应的标准方法,但往往无法转化到人体结果。器官芯片和先进组织工程旨在用培养细胞更好地模拟人体生理。Vivodyne 培养仿真人体组织,并利用 AI 与自动化进行高通量实验,大规模生成与人体相关的数据。

参考链接

标签: #AI, #drug testing, #tissue engineering, #robotics, #animal testing alternatives


苹果寻求最高法院复审 App Store 收费裁决,获暂停执行
Apple Seeks Supreme Court Review of App Store Fee Ruling, Wins Stay
⭐️ 8.0/10

苹果于 4 月 6 日获得法院批准,暂缓执行一项限制其对外部支付收费能力的裁决,并计划就本案向美国联邦最高法院提起上诉。Epic Games 随即对这一暂缓执行提出异议。 最高法院的审理结果可能从根本上重塑 App Store 的商业模式和 30%(或 27%)的佣金制度,影响全球数百万开发者。它还将为美国反垄断法如何适用于数字平台守门人确立先例。 2025 年 12 月,第九巡回上诉法院维持了下级法院对苹果藐视法庭的认定,原因是苹果对使用外部支付系统的开发者收取 27%佣金。苹果于 4 月 6 日获得上诉法院的暂缓执行许可,Epic Games 随即对此提出质疑。

telegram · zaihuapd · Aug 14, 02:33

背景: 本案源于 Epic Games 诉苹果案(2020 年反垄断诉讼),争议焦点是 App Store 要求开发者使用苹果内购系统并支付佣金的规则。地方法院发出反引导禁令,允许开发者链接到外部支付方式,但苹果仍对这些交易收取费用,从而引发藐视法庭争议。苹果现正寻求最高法院对藐视裁定和收费限制进行复审。

标签: #Apple, #App Store, #Epic Games, #antitrust, #legal


智谱发布 GLM-5.3,代码基准提升 50%,两周后开源权重
Zhipu releases GLM-5.3 with 50% code-bench gain; weights open in two weeks
⭐️ 8.0/10

智谱发布了 GLM-5.3,基于 GLM-5.2 基座,全部提升来自后训练。其在智谱内部 Z.ai Code Bench 上的成绩比 GLM-5.2 提升 50%,据称在 Terminal Bench 3.0 上达到开源最优,权重将在两周后开源。 此次发布表明,开源大语言模型即使不训练新基座,仅靠后训练也能快速提升。其声称的安全能力提升也可能让开放权重模型在真实漏洞检测和企业应用中更具吸引力。 所有提升均来自后训练,而技术细节仍然较少。安全方面,漏洞利用基准成绩较前代翻倍以上,并已协助安全团队在 269 个项目中识别 2436 个漏洞,其中 1097 个为中高危。

telegram · zaihuapd · Aug 14, 05:27

背景: 大语言模型通常先进行预训练,再进行监督微调、偏好对齐等后训练阶段。GLM-5.2 是智谱上一代开源模型,据称在 SWE-bench Pro 上以远低于 GPT-5.5 的成本取得更高成绩(62.1 对 58.6)。Terminal Bench 是广泛用于衡量智能体在容器化环境中完成实际任务能力的基准。

参考链接

标签: #GLM, #AI, #open-source, #LLM, #benchmark


小红书开源 dots3-note:280B MoE 仅 16B 激活参数
Xiaohongshu Open-Sources dots3-note: 280B MoE with 16B Active Parameters
⭐️ 8.0/10

小红书 dots 实验室在 Hugging Face 上开源了 dots3-note preview,这是 dots3 系列首个开放权重模型。该模型总参数达 280B,采用 MoE 架构,每次仅激活 16B 参数,支持 512K 上下文,可处理文字、图片、视频和音频。 此次开源意义重大:它展示了一个大规模多模态 MoE 模型可以以相对较低的算力运行,降低了部署大规模模型的门槛。同时推出的 TEMPO 强化学习方法以及 VibeSearchBench、VibeLifeBench 真实场景智能体基准,有望推动长程智能体的训练与评测。 该模型的 TEMPO 训练方法利用自批判和测试时价值估计来训练长程智能体。除权重外,小红书还同步发布了 VibeSearchBench 和 VibeLifeBench 两个真实场景智能体基准,用于评估相关能力。

telegram · zaihuapd · Aug 14, 08:27

背景: 混合专家(MoE)是一种将神经网络拆分为多个专门子网络(专家)的架构,通过路由机制为每个 token 仅激活最相关的专家,从而以极小计算代价实现巨大规模。面向 LLM 智能体的强化学习(RL)通过与环境的交互来训练模型,而非仅依赖标注数据;测试时价值估计则是在推理阶段、没有真实标签时估算奖励的技术。这些技术对于构建高效的大模型和强大的长程智能体至关重要。

参考链接

标签: #open-source, #MoE, #multimodal, #reinforcement-learning, #large-language-model


美国法官责令谷歌取消第三方应用商店安装障碍
US Judge Orders Google to Remove Third-Party App Store Installation Barriers
⭐️ 8.0/10

美国地区法官 James Donato 下令谷歌在一周内简化竞争对手安卓应用商店的安装流程,删除 Play Store 中的多余步骤和警告弹窗。该裁定源于 Epic 诉谷歌反垄断案,陪审团认定谷歌在安卓应用分发领域构成非法垄断。 这项裁定直接重塑安卓应用的分发方式,可能降低替代应用商店的门槛并增强竞争。它影响谷歌对其生态系统的控制力,也可能在全球范围内加强对应用商店行为的反垄断审查。 法院认为,用户必须先点击“查看”才能看到“安装”按钮的步骤,是蓄意制造的“反竞争摩擦”,用来吓退普通用户。谷歌必须让安装第三方市场像安装普通安卓应用一样直接。

telegram · zaihuapd · Aug 14, 09:55

背景: Epic Games 因 Fortnite 绕过 Google Play 支付系统而被 Google 下架后提起反垄断诉讼,陪审团裁定谷歌败诉。该案目前仍在第九巡回上诉法院审理,美国司法部和联邦贸易委员会也以法庭之友身份参与。长期以来,Android 的侧载机制一直存在争议,谷歌需要在安全警告与系统开放性之间取得平衡。

参考链接

标签: #Antitrust, #Google, #Android, #App Stores, #Epic Games


苹果携手阿里自研中国区 AI 大模型
Apple trains China-specific AI model with Alibaba support
⭐️ 8.0/10

据报道,苹果已专门为中国市场训练了一款自研大语言模型,并获得了阿里巴巴的支持。Apple Intelligence 预计将在未来数月内随 iOS 更新在中国上线,标志着苹果从依赖第三方模型转向自研模式。 如果获得批准,苹果将成为首家获北京批准在华提供自有 AI 模型的外国公司。这将使苹果在其最大海外市场更好地掌控 AI 体验,并可能重塑中国 AI 行业的竞争格局。 知情人士称,中国网信办已于上月对苹果的生成式 AI 服务完成备案。该模型是专为中国市场训练的,阿里巴巴提供支持,并将随未来几个月的 iOS 更新一同上线。

telegram · zaihuapd · Aug 14, 14:47

背景: Apple Intelligence 是苹果的 AI 功能套件,在其它地区目前依赖 ChatGPT 等第三方模型。在中国,外国 AI 服务面临严格的监管要求,包括安全评估和政府审批,因此许多跨国公司选择与本土企业合作。在阿里的支持下训练专属模型,有助于苹果更好地遵守当地法规,并为中国用户定制 AI 体验。

标签: #AI, #苹果, #阿里巴巴, #中国监管, #大模型



📊 运行统计 · 总耗时 16m 02s · AI 分析 4m 18s · Tokens 0.95 MCY (输入 0.56 / 输出 0.40 MCY)