通义千问 Qwen3.8-Max 发布,Max 系列首次开源
Qwen3.8-Max Released; First Open-Source Max Series Model
⭐️ 9.0/10

阿里巴巴正式发布 Qwen3.8-Max,这是一个总参数量达 2.4 万亿、激活参数 95B 的混合专家(MoE)模型,官方称其在编程、办公、长任务执行和多模态理解上实现了巨大跃升。同时官方宣布该模型将于下周开源,这是 Qwen Max 系列首次开源。 此次发布标志着人工智能正朝着能够长期自主工作、自我进化迭代的智能体范式转变,而无需人类持续干预。由于 Qwen Max 系列此前从未开源,下周的开源将可能深刻改变开源大模型格局,降低开发者与研究人员的使用门槛。 官方声称 Qwen3.8-Max 在 oh-my-cli 项目中完全自主运行了 16 天;在真实电商多模态意图识别竞赛中,以 45 次提交将准确率从 0.60 提升至 0.853,击败了 458 支人类队伍中的 87%;并在 365 天模拟电商经营中实现 4.16 倍资金回报。它还从零编写 7,600 行代码、用 5 天时间复现一篇最新 AI 训练数据选择论文,并通过 18 种自主改进方案在 AIME24 数学基准上反超原论文 2.71 分。

rss · 小互(@imxiaohu) · Aug 3, 04:08

背景: Qwen(通义千问)是阿里巴巴推出的大语言模型系列,其中 Max 级别代表公司旗舰级、能力最强的模型。Qwen3.8-Max 采用混合专家(MoE)架构,通过每个 token 只激活部分专家(本例为 2.4T 总参数中的 95B)来扩大总参数量、同时控制推理成本。其宣称的自主编程与长周期任务执行能力,反映了整个行业正朝着能在较长时间内自行规划、行动与纠错的智能体 AI 方向发展。AIME24 是一个数学推理基准,题目来自 2024 年美国数学邀请赛,常用于评估模型的进阶数学推理能力。

参考链接

标签: #qwen, #llm, #open-source, #ai, #multimodal


OpenAI 称下一代模型 Astra 解开 10 个数学难题
OpenAI Says Next-Gen Astra Model Solved 10 Long-Standing Math Problems
⭐️ 9.0/10

2026 年 8 月 1 日,OpenAI 发布了一份 200 多页的论文和 GitHub 仓库,称其下一代旗舰模型 Astra 的一个内部版本解开了数学与理论计算机科学领域中 10 个长期未解的问题。 这意义重大,因为它表明 AI 现在可以攻克研究级别的数学难题,可能加速数学及相关领域的发现。如果经过验证,这可能标志着 AI 推理能力的范式转变。 这些问题分布在八个不同分支,最早可追溯到 1964 年,最年轻的也已搁置二十多年。Astra 是一个多智能体模型,其证明是可机器验证的,且该模型尚未公开发布。

rss · 小互(@imxiaohu) · Aug 3, 01:27

背景: OpenAI 一直在开发越来越强大的 AI 模型,Astra 据称是其下一款主力模型系列。解决开放数学问题被视为高级推理能力的标杆。此次发布没有采用传统的新闻发布会形式,而是直接发布论文和 GitHub 代码。

参考链接

标签: #OpenAI, #Astra, #AI research, #Mathematics, #Breakthrough


Qwen 3.8-Max 正式发布,下周开源权重
Qwen 3.8-Max Released; Open Weights Coming Next Week
⭐️ 9.0/10

阿里巴巴正式发布了 Qwen 3.8-Max,这是其迄今能力最强的多模态模型,参数规模达 2.4 万亿,并确认下周将开放 Qwen 3.8-Max 和 Qwen3.8-27B 的权重。 这是一次前沿规模的发布,而且承诺开源 2.4T 参数模型的权重,可能重塑开源 LLM 格局,并加剧顶级厂商之间的竞争。开发者和企业将能以相对较低的成本使用顶级模型。 Qwen 3.8-Max 支持文本、图像和视频输入并返回文本,采用混合专家(MoE)架构。定价为输入每百万 token 2.0 美元、输出每百万 token 6.0 美元、隐式缓存每百万 token 0.25 美元,并已在 Qwen Chat 和 Qwen Cloud 上线。

rss · meng shao(@shao__meng) · Aug 3, 04:48

背景: Qwen 是阿里巴巴的开源大语言模型系列,Qwen 3.8-Max 是其中首个超过 1 万亿参数的多模态模型。原推文指出,阿里巴巴官方基准对比只纳入了 Qwen、Gemini、GPT 和 Claude,没有包含国内近期发布的顶尖开源模型,因此社区自行补充了对比。

参考链接

社区讨论: 作者对发布表示欢迎,但指出官方基准缺少国内开源模型,因此自行补充了对比。引用的 Qwen 公告和讨论反映出社区对开源权重发布的强烈兴奋,以及对独立基准测试的兴趣。

标签: #Qwen, #LLM, #AI Model Release, #Open Source, #Benchmark


Qwen3.8-Max:阿里发布 2.4 万亿参数开源权重模型
Qwen3.8-Max: Alibaba's 2.4T-Parameter Open-Weights Model Announced
⭐️ 9.0/10

阿里巴巴 Qwen 团队发布了 Qwen3.8-Max,这是一个 2.4 万亿参数的旗舰模型,其开放权重将于下周发布,同时发布的还有 Qwen3.8-27B 开放权重模型。该公告强调了自主编程能力、长周期规划以及原生多模态智能。 这标志着开放权重 AI 的一个重要里程碑,使开发者能够使用前沿规模的 2.4 万亿参数模型,可能加速自主编程和智能体 AI 应用。它通过以有竞争力的价格提供透明、可修改的权重,对闭源模型构成了挑战。 定价为每百万输入 token 2.0 美元、每百万输出 token 6.0 美元、隐式缓存每百万 token 0.25 美元。该模型声称可进行 10 天以上的自我演化开发、500 多轮芯片设计优化以及 365 天的电商策略规划。

rss · Qwen(@Alibaba_Qwen) · Aug 3, 02:15

背景: 开放权重模型允许开发者下载并微调模型权重,相比 GPT-4 或 Gemini 等闭源模型提供了更高的透明度和控制力。自主编程指的是 AI 智能体能够在无需人工干预的情况下处理多日软件项目,而长周期任务则需要在较长时间内进行规划和执行,涉及复杂的决策。

参考链接

标签: #AI, #Qwen, #Open Weights, #Large Language Model, #Coding


阿里通义千问发布 Qwen3.8-Max:2.4 万亿参数编程与协作旗舰模型
Alibaba Qwen Unveils Qwen3.8-Max: 2.4T-Parameter Coding and Cowork Flagship
⭐️ 9.0/10

阿里巴巴通义千问发布了新一代旗舰大语言模型 Qwen3.8-Max,主打编程(coding)与协作(cowork)能力。据报道,这是一个 2.4 万亿参数的混合专家(MoE)模型,支持 100 万上下文,开源权重预计下周发布。 此次发布将开源模型生态在编程和协作 AI 方面的标准提升到了新高度,直接与 GPT-5.6 等前沿模型竞争。对开发者和企业意义重大,因为 Qwen 系列模型广泛使用且通常采用 Apache 等开源许可,可能成为闭源系统之外的强大替代选择。 据报道,Qwen3.8-Max 在多项基准测试上超越 GPT-5.6 Sol 和 Fable;在一项财务余额测试中取得 ¥416,252,领先 GLM 5.2 达 38%,是上一代 Qwen3.7-Max 的两倍以上。它采用 MoE 架构,支持 100 万上下文;官方承诺下周开放权重,但部分版本仍通过阿里云以专有方式提供。

rss · Qwen(@Alibaba_Qwen) · Aug 3, 01:46

背景: Qwen(通义千问)是阿里云开发的大语言模型家族,涵盖 Apache 开源许可、源代码可用许可、研究许可及专有模型。其中的“Max”系列代表阿里最大的旗舰模型;而“cowork”指能够在本地应用、云工具和浏览器中与用户协作的 AI 智能体,这种形态由 Claude Cowork 等产品带火。MoE(混合专家)是一种模型设计,每个 token 只激活部分参数,从而在保持高效推理的同时实现超大规模。

参考链接

标签: #AI, #Large Language Model, #Coding, #Alibaba, #Model Release


Qwen3.8-Max 正式发布,2.4T 参数,开放权重即将推出
Qwen3.8-Max Launches with 2.4T Parameters, Open Weights Coming
⭐️ 9.0/10

阿里旗下 Qwen 团队正式发布了其迄今最强大的模型 Qwen3.8-Max,拥有 2.4 万亿参数。下周将开放模型权重,同时开放较小的 Qwen3.8-27B,目前该模型已可通过 API 和 Qwen Chat 使用。 这对于开放权重 AI 社区而言是一个重大事件,因为如此规模的先进模型开放出来,可能极大地推动研究和商业应用。同时,这也加剧了顶级 AI 实验室之间的竞争,尤其是与 Kimi K3 等模型的竞争。 该模型强调自主编码(超过 10 天的自我进化开发)、长周期规划(例如 500 多轮芯片设计优化)以及用于规划与自我纠正的原生多模态反馈。API 定价为每百万输入 token 2.0 美元,每百万输出 token 6.0 美元,每百万 token 隐式缓存 0.25 美元。

rss · 歸藏(guizang.ai)(@op7418) · Aug 3, 03:34

背景: Qwen 是阿里云构建的大语言模型和多模态模型系列,通过阿里云和 Hugging Face 等平台分发。此前,该公司已于 2026 年 7 月预览了 Qwen3.8-Max,如今正式发布,并宣布将开放模型权重,这对于如此规模的模型而言是不同寻常的一步。竞争对手如月之暗面的 Kimi K3 最近也推出了类似的超大模型,凸显了开放权重 AI 领域快速发展的步伐。

参考链接

标签: #AI, #LLM, #Qwen, #Model Release, #Alibaba


Qwen3.8 Max 上线 OpenRouter,2.4T 参数旗舰模型
Alibaba Qwen3.8 Max, 2.4T-Parameter Flagship, Launches on OpenRouter
⭐️ 9.0/10

阿里巴巴的 Qwen3.8 Max 旗舰模型现已上线 OpenRouter,总参数量 2.4T,活跃参数 95B。该模型首次为 Qwen Max 级模型开放权重,预计下周发布。 这标志着阿里巴巴首次开放 Max 级旗舰模型,可能加速其在编程、研究和多模态智能体工作流中的采用。开发者现在可以通过统一 API 访问前沿规模的性能。 该模型采用混合专家(MoE)架构,总参数 2.4T,每个 token 激活 95B 参数,专为长时任务设计。OpenRouter 已提供访问,开放权重计划于下周发布。

rss · OpenRouter(@OpenRouterAI) · Aug 4, 00:18

背景: 混合专家(MoE)是一种大模型技术,模型包含多个称为“专家”的子网络,路由器对每个 token 只激活其中一部分。这使得在推理计算量较低的情况下实现巨大参数量。OpenRouter 是一个统一 API 平台,让开发者可访问 70 多家服务商的 400 多个 AI 模型,简化集成与对比。

参考链接

标签: #AI, #LLM, #Qwen, #OpenRouter, #Open Source


OpenAI 内部模型攻克 10 个长期未解数学与 CS 难题
OpenAI Internal Model Produces 10 New Results on Open Math, CS Problems
⭐️ 9.0/10

OpenAI 在 X 上宣布,其下一代主要模型的内部版本在数学和理论计算机科学的长期开放问题上取得了 10 项新成果。据该帖子称,计算成本大约相当于按 GPT-5.6 Sol API 费率计算的 2,000 美元代币。 这一声明标志着 AI 推理和自动定理证明方面的重大飞跃,可能使 AI 能够帮助数学家解决多年来人类努力未能攻克的难题。如果得到证实,它可能加速数学和理论计算机科学的研究,并重塑人们对前沿模型能力的预期。 该推文未提供详细证明或同行评审证据,仅附带一段视频和互动数据;该模型被描述为“内部”版本,尚未公开发布。基准成本使用 GPT-5.6 Sol API 费率,表明新模型以极低的成本超越了现有旗舰级模型的表现。

rss · OpenAI(@OpenAI) · Aug 3, 18:54

背景: 自动定理证明(ATP)是人工智能和数学逻辑的一个子领域,专注于用计算机程序证明定理,近年来的系统如 Aristotle 和 Ax-Prover 已在形式化证明验证中达到接近 IMO 金牌的水平。GPT-5.6 Sol 似乎是 OpenAI 面向高级推理、编程和工具使用的旗舰 API 层级,这些结果表明下一代模型可能将 ATP 进一步推向开放式研究问题。该声明延续了更广泛的趋势,例如 AxiomProver 在 2026 年初解决了四个此前未解的问题,并已在 Lean/Mathlib 中验证。

参考链接

标签: #AI, #Mathematics, #Theoretical Computer Science, #OpenAI, #Breakthrough


OpenAI 宣布在数学与理论计算机科学领域取得突破性成果
OpenAI announces groundbreaking results across mathematics and theoretical computer science
⭐️ 9.0/10

OpenAI 在 X 上宣布其研究涵盖球堆积、编码理论、群论、量子复杂性、格密码学和极值组合学等多个领域,包括非 sofic 群的存在性以及对高维球堆积界限的指数级改进。 这些成果可能解决长期悬而未决的问题,并加深我们对基础数学结构的理解。它们还可能影响作为后量子安全基石的格密码学,并在多个方向上推动理论计算机科学的发展。 该公告特别提到了非 sofic 群和球堆积界限的指数级改进,但没有提供论文名称或作者。球堆积改进很可能指的是对 Minkowski 界限的指数级改进,这是高维空间中的一个重大开放难题。

rss · OpenAI(@OpenAI) · Aug 3, 18:54

背景: 球堆积问题探讨的是在 n 维空间中,相同球体能达到多大的堆积密度;在高维空间中,已知界限通常较为宽松,指数级改进非常罕见。Sofic 群是指可以被有限对称群近似的群;是否存在非 sofic 群曾是一个著名的开放问题,证实非 sofic 群的存在将对这一问题给出否定答案。格密码学依赖于格问题的困难性,是后量子密码学的主要候选方案之一。

参考链接

标签: #mathematics, #theoretical computer science, #sphere packing, #group theory, #cryptography


微软发布 TypeScript 7.0,采用原生 Go 编译器
Microsoft Ships TypeScript 7.0 with Native Go Compiler
⭐️ 9.0/10

微软已发布 TypeScript 7.0,其中包含一个原生 Go 编译器(tsgo),构建速度提升 8 到 12 倍。该版本是这款基于 Go 的编译器的首个稳定版本,稳定的编程 API 计划在 7.1 中推出。 TypeScript 是全球使用最广泛的编程语言之一,这一性能突破有望大幅缩短大型代码库的构建时间,也为未来编译器优化和更好的开发者工具奠定基础。 该编译器是用 Go 从头重新实现的,目标是达到与 TypeScript 6.0 的功能对等。在预览阶段,安装使用 npm install @typescript/native-preview,命令为 npx tsgo;从 TypeScript 7.0 RC 开始,命令变为 tsc。现有工具可通过兼容包完成迁移。

rss · InfoQ · Aug 3, 05:22

背景: TypeScript 是微软开发的一种静态类型化的 JavaScript 超集。原来的 tsc 编译器用 JavaScript/TypeScript 编写,在大型项目上可能很慢。微软一直在开发 typescript-go,这是一个基于 Go 的移植版本,旨在大幅提升性能。TypeScript 7.0 是首个包含这一新编译器的稳定版本。

参考链接

标签: #TypeScript, #compiler, #performance, #Microsoft, #open source


阿里发布 Qwen3.8-Max:2.4 万亿参数开源权重模型,主打长周期任务
Alibaba launches Qwen3.8-Max, a 2.4T-parameter open-weight model for long-horizon tasks
⭐️ 9.0/10

阿里巴巴发布了 Qwen3.8-Max,这是一个 2.4 万亿参数的开源权重模型,专为长期自主任务设计,例如复现研究论文和芯片设计。该公司计划下周发布权重。 此次发布标志着前沿规模 AI 模型开源可用的重要一步,可能让研究者和企业无需依赖专有 API 即可运行先进的自主代理。它有望加速 AI 驱动的科学研究和硬件设计。 据公告,Qwen3.8-Max 能够自主处理持续数天的复杂任务。权重发布的具体日期仅提及'下周',未进一步说明。

rss · The Decoder · Aug 3, 10:48

背景: 长周期任务要求 AI 模型在较长时间内进行规划和执行,通常涉及数小时、数天或数周内数十到数百个连续步骤。开源权重模型是指公开发布训练后参数(主要是权重和偏置)的 AI 模型,任何人都可以下载、运行和修改,但再分发权取决于许可证。阿里巴巴的 Qwen 系列一直是业界知名的开源权重语言模型家族。

参考链接

标签: #AI, #Alibaba, #Open Source Model, #Large Language Model, #Autonomy


阿里巴巴 Qwen3.8-Max 声称在智能体基准上超越 GPT-5.6 Sol Max 与 Fable 5
Alibaba's Qwen3.8-Max claims lead over GPT-5.6 Sol Max and Fable 5 on agentic benchmarks
⭐️ 9.0/10

阿里巴巴 Qwen 团队发布了 Qwen3.8-Max,这是一个 2.4 万亿参数的混合专家多模态大语言模型,并声称其在 OSWorld-Verified 上取得 86.1 分,领先于 GPT-5.6 Sol Max(83.2)和 Fable 5(85.0)。公司表示将于下周发布开放权重以及 Qwen3.8-27B。 如果这些基准测试的声称成立,Qwen3.8-Max 将成为首款可自托管部署的 Max 级 Qwen 模型,可能重塑企业对开放权重前沿模型的采用。这也表明阿里巴巴正瞄准自主长周期工作,这是 AI 领域日益激烈的竞争前沿。 值得注意的细节包括:阿里巴巴尚未公布许可证条款,因此开放权重版本可能使用限制性自定义许可而非 Apache 2.0。基准测试结果均为公司自行报告,尚未被独立复现,其演示(如 10 天自主软件项目、芯片设计优化)也尚未得到广泛验证。

rss · VentureBeat · Aug 3, 23:50

背景: 混合专家(MoE)是一种稀疏架构,将大型模型划分为多个专门化专家,并仅为每个输入激活相关子集,使得 30B 模型能够像 3B 模型一样运行。智能体 AI(Agentic AI)指能够自主感知、推理并行动以完成多步骤任务的系统,而 OSWorld-Verified 是一个基准测试,评估计算机使用智能体在 369 个真实桌面与网页任务上的表现。这些概念有助于理解 Qwen3.8-Max 发布及其基准分数的意义。

参考链接

标签: #AI, #LLM, #Alibaba, #Agentic Computing, #Benchmarks


英伟达 170HX 矿卡被破解:解锁 80GB 显存,性能暴涨
Researchers Crack Nvidia CMP 170HX to Unlock 80GB VRAM and 94 TFLOPS
⭐️ 9.0/10

亚利桑那州立大学的研究人员公开了针对英伟达 CMP 170HX 矿卡的破解方案。他们利用 GPU 的 Falcon 安全协处理器中的栈溢出漏洞绕过 OTP 熔丝锁定,最高解锁至 80GB 显存,并将 FP32 算力从 0.39 TFLOPS 提升到 94 TFLOPS。 该成果意义重大,因为它推翻了英伟达通过硬件强加的、曾被认为不可逆转的产品限制,催生了廉价的高性能 AI 算力来源。同时,它也给 GPU 安全协处理器的设计以及 OTP 熔丝机制在整个行业内的可靠性带来了严峻质疑。 CMP 170HX 与 A100 使用相同的 GA100 核心,但出厂时通过 OTP 熔丝对算力、显存和 PCIe 施加限制。据称,研究团队利用 Falcon 安全协处理器的 DMA 无界溢出漏洞劫持权限并逐个修改寄存器;社区测试显示,解锁后的显卡可在 Windows 和 Linux 下运行 AI 图像生成与大型语言模型推理,但长期稳定性及不同批次的解锁上限仍存在差异。

telegram · zaihuapd · Aug 3, 11:29

背景: CMP 170HX 是英伟达 2021 年推出的加密货币矿卡,采用与数据中心级 A100 相同的 GA100 GPU,但被 OTP 熔丝刻意限制了显存、算力和 PCIe 带宽。Falcon 是嵌入英伟达 GPU 中的一系列定制微处理器,负责安全与管理等任务;OTP 熔丝是一种一次性可编程存储器,用于写入永久的硬件配置与安全信息。这些背景有助于理解该破解为何令人意外:此类熔丝通常被视为难以逆转的硬件边界,而安全协处理器中的漏洞却突破了这一边界。

参考链接

社区讨论: 报道称国内矿卡社区已跟进并验证了该解锁方案。玩家们对低成本 AI 算力机会的态度较为兴奋,同时也有评论提醒:长期稳定性尚未得到验证,不同批次的显卡可能解锁上限不同。

标签: #Nvidia, #GPU security, #hardware hacking, #AI compute, #mining card


LLM 放大已有专长,而非取代它
LLMs amplify existing expertise instead of replacing it
⭐️ 8.0/10

肖恩·盖德克(Sean Gedecke)的文章认为,大语言模型(LLM)会回报并放大已有的专业知识,而非使其过时。文章主张,在使用 LLM 等 AI 工具时,领域知识和实践经验变得更加宝贵。 这一重新定义挑战了“AI 将取代熟练专业人员(尤其是软件工程师)”的普遍担忧。它表明,深刻理解自身领域的专家受益最大,而新手可能难以有效使用 LLM。 文章强调,表达专业信号——知道该问什么、如何描述问题以及如何评估输出——是从 LLM 中获得价值的关键。作者用“放大镜”之类的比喻来描述 LLM 如何反映用户自身的知识与思维方式。

hackernews · MaxMussio · Aug 3, 21:13 · 社区讨论

背景: 大语言模型是在海量文本上训练的人工智能系统,能够对提示生成类人的回答。人们常担心这类工具会取代编程、写作等领域的专家。这篇文章对此提出反驳,认为 LLM 更像是对用户现有专业知识的一种“放大器”或“倍增器”。

社区讨论: 评论者大体认同文章论点,有人将 LLM 比作图形计算器——只有熟练的人才能发挥其威力。sramsay 强调“表达专业信号”很重要;Austiiiiii 则指出需要正式研究以排除确认偏误;还有人提到在不亲自动手的情况下获得代码库熟悉度存在“先有鸡还是先有蛋”的困境。

标签: #LLM, #expertise, #productivity, #AI tools, #software engineering


OpenAI 盘点人工智能在数学与理论计算机科学中的十项突破
OpenAI highlights ten AI breakthroughs in mathematics and theoretical CS
⭐️ 8.0/10

OpenAI 发布了一篇文章,列举了数学与理论计算机科学领域的十项近期进展,展示了人工智能在形式化证明和数学发现中日益重要的作用。该公告重点介绍了由大语言模型和自动推理系统所取得的成就。 这之所以重要,是因为它标志着人工智能正在成为形式化推理的实用工具,可能改变数学研究的进行方式和证明的验证方式。这也引发了关于人类数学家未来角色以及人工智能指数级进步对更广泛影响的重要问题。 在提供的内容中并未详细列出这十项具体进展,但文章强调了形式化证明与发现方面的成就。社区评论指出,当前的 AI 模型仍无法“直觉”性地提出猜想,但可以通过计算快速否定某些猜想,从而与人类能力互补。

hackernews · milkshakes · Aug 3, 16:27 · 社区讨论

背景: 形式化证明是一个有限的句子序列,它遵循严格的推理规则,并且可以由计算机机械地验证。自动定理证明是计算机科学的一个子领域,专注于使用程序自动证明或否定数学陈述。大语言模型的进展使 AI 系统更容易生成候选证明并检查其正确性,这正是 OpenAI 这份清单值得关注的原因。

参考链接

社区讨论: 评论者普遍对 AI 的指数级进展感到兴奋,有人指出数学似乎正在被快速改变。少数人提到局限,例如 AI 对猜想缺乏直觉,但认可其在快速否定猜想方面的能力。还有人引用道格拉斯·亚当斯,并担心这些工具可能颠覆一些数学家近年来的工作。

标签: #AI, #Mathematics, #Theoretical Computer Science, #OpenAI, #Research


开发者工具必须开源,以实现 LLM 驱动的定制化
Devtools Must Be Open Source for LLM-Driven Customization
⭐️ 8.0/10

博客文章认为开发者工具必须开源,并设想了一个未来场景:LLM 通过修改和重建源代码来定制软件,而非依赖配置文件。这一提议引发了关于这种方法的效率和可维护性的讨论。 这一愿景可能从根本上改变开发者和最终用户定制软件的方式,有可能让深层修改对每个人都变得可及。然而,其可行性存在争议,批评者指出重建软件和维护分支的效率低下。 文章建议设置一个夜间 cron 任务,获取上游更改并变基本地修改,自动重建软件。评论者反驳说这不可靠,因为 AI 每晚重做软件可能会破坏工作流程,而且维护开发者工具的分支是一项实际工作,可能与上游功能产生冲突。

hackernews · bryanmikaelian · Aug 3, 14:15 · 社区讨论

背景: 开源软件赋予用户检查和修改代码的自由,但实际上大多数人由于时间投入而依赖他人进行修改。配置文件提供了一种无需重新编译即可定制行为的轻量级方式。LLM 可能降低代码修改的门槛,但重新编译与配置之间的权衡仍在持续争论中。

社区讨论: 评论显示出分歧:simonw 认为 LLM 使开源修改的梦想更加可行,而 kelnos 强烈反对用代码更改取代配置文件,认为效率低下。theamk 称夜间重建的想法是“地狱”,开发者工具维护者 lalitmaganti 则认为,考虑到维护分支的实际工作,这种方法过于理想化。

标签: #open source, #LLMs, #developer tools, #customization, #software engineering


MiniMax H3 在 ComfyUI 获得 Day-0 支持:开源权重与 2K 视频
MiniMax H3 Gets Day-0 ComfyUI Support with Open Weights and 2K Video
⭐️ 8.0/10

ComfyUI 已为 MiniMax H3 提供 Day-0 支持,这是一款开源权重的全模态模型,能以最高 2K 分辨率生成带原生音频的视频。该集成让用户可以通过 ComfyUI 的节点式界面在消费级 GPU 上本地运行 H3。 作为主要 AI 实验室发布的开源权重模型,H3 标志着多模态生成向超越文生图的民主化迈出一步。ComfyUI 的 Day-0 集成意味着创作者和研究者无需等待自定义工具,即可立即体验最先进的视频与音频生成。 据 MiniMax 团队介绍,H3 的调制权重(约占 40% 的参数)可以被剪枝并替换为功能等效的查找表,使最小变体的内存占用从 123.6 GB 降至 42.5 GB,减少 66%。结合动态 VRAM 卸载,2K 视频模型可在 RTX 3060 上本地运行。

hackernews · vblanco · Aug 3, 13:34 · 社区讨论

背景: ComfyUI 是一个开源、基于节点的生成式 AI 界面与推理引擎,常与扩散模型配合用于生成图像、视频和音频。MiniMax H3 是一个全模态生成模型,能同时理解文本、图像、视频和音频;其开源权重发布允许本地执行和定制。该发布还包含 H3-VA 视觉语言变体,可处理视觉问答、文档分析等任务。

参考链接

社区讨论: 社区反响积极,用户称赞在消费级 GPU 上的生成质量与速度,但也有人指出在非日常场景下仍存在瑕疵。技术讨论聚焦于模型的权重剪枝方法及其能否迁移到 LLM;评论者对内存大幅缩减感到好奇,同时对“无损输出质量”的说法表示怀疑。

标签: #AI video generation, #ComfyUI, #MiniMax H3, #open weights, #multimodal


数据库教授 Andy Pavlo 加入 ClickHouse 以创立研究实验室
Database Professor Andy Pavlo Joins ClickHouse to Launch Research Lab
⭐️ 8.0/10

卡内基梅隆大学知名数据库教授 Andy Pavlo 已加入 ClickHouse,并成立了新的企业研究实验室 ClickHouse Labs。该消息通过 ClickHouse 官方博客发布。 此举表明 ClickHouse 致力于推进数据库基础研究,而不仅仅是产品开发,并可能影响未来的 OLAP 架构。它也突显了在数据库系统学术经费减少的背景下,企业资助研究实验室日益成为趋势。 ClickHouse Labs 是 ClickHouse 内部新成立的企业研究实验室,由 Pavlo 牵头。Pavlo 以其广受欢迎的 CMU 数据库课程和系列讲座而闻名,社区成员希望这些讲座能在 ClickHouse 的资助下继续更新。

hackernews · nikolay_sivko · Aug 3, 14:09 · 社区讨论

背景: ClickHouse 是一个开源的列式 SQL 数据库管理系统,专为在线分析处理(OLAP)优化,适用于对大型数据集进行快速实时分析。OLAP 是一种支持快速多维分析查询的技术,通常用于数据仓库和数据湖。Andy Pavlo 是数据库系统领域备受尊敬的学者,他进入企业研究领域标志着学术与企业界兴趣的一次重要交汇。

参考链接

社区讨论: 评论者大多非常热情,称这是 AI 浪潮之外一股清新的企业研究之风。一些人呼吁 Pavlo 推动 ClickHouse 资助学术界的数据库研究,因为政府资助已经很少。还有人讨论 ClickHouse、StarRocks 等快速 OLAP 引擎与 Trino 的融合趋势,质疑解耦计算/存储将如何影响数据摄入、索引和本地连接。一位前学生也感谢 Pavlo 的课程启发了他/她的毕业论文工作。

标签: #database, #clickhouse, #OLAP, #research, #Andy Pavlo


字节跳动发布 Seedance AI 视频生成官方提示词指南
ByteDance releases official prompt guide for Seedance AI video generation
⭐️ 8.0/10

字节跳动为其 Seedance 视频生成模型发布了一份官方提示词指南,涵盖从单句生成到调度 50 份参考素材、对 30 秒长片进行分段的各类任务模板。该指南通过一条推文分享,为即梦平台和 API 用户提供了可直接套用的模板。 这是第一份面向 Seedance/API 用户的成体系官方写法手册,为 AI 视频创作者提供了可直接复制的实用模板,降低了产出高质量内容的门槛。它为 AI 视频生成领域的提示词工程树立了新标杆,并提升了整个创作者生态的生产效率。 该指南覆盖了多种场景,包括如何调度多达 50 份参考片段、将 30 秒长视频分段,以及只修改视频中某一部分而不影响其他内容。推文链接到 best.xiaohu.ai 上的详细文章,并将该指南定位为 Seedance 工作流的首份全面参考。

rss · 小互(@imxiaohu) · Aug 3, 14:07

背景: Seedance 是字节跳通的视频生成模型,支持多镜头文生视频和图生视频,可输出 1080p 视频,并具备出色的语义理解和电影级动态表现。即梦 AI 是字节跳动的一站式 AI 创作平台,基于自研模型提供文生图、文生视频等功能。在这一领域,提示词工程至关重要,因为生成视频的质量在很大程度上取决于用户如何组织指令。

参考链接

社区讨论: 该推文互动有限(1 条评论、1 次转发、5 个点赞、2200 次浏览),但作者强调这是首份官方手册,表明其对 Seedance 和即梦用户具有很强实用价值。在现有讨论中未出现实质性反对观点。

标签: #AI video generation, #prompt engineering, #ByteDance, #Seedance, #official guide


MiniMax-H3 成为 LMArena 视频竞技场排名第一的开源模型
MiniMax-H3 becomes #1 open model in LMArena Video Arena
⭐️ 8.0/10

MiniMax-H3 在 LMArena 的 Video Arena 中被评为排名第一的开源模型,在文本生成视频和图像生成视频两个榜单上均位列榜首。在图像生成视频赛道中,它获得 1476 分,仅比 Dreamina Seedance-2.0(1478 分)少 2 分,实际上并列总排名第一。 这一里程碑表明,开源视频生成模型正在缩小与商业模型的差距,这可能加速高质量视频 AI 的采用和定制。这也巩固了 MiniMax 在开源视频模型生态中的领先地位。 MiniMax-H3 比第二名的开源模型 hunyuan-video-1.5 高出 280 多分,相比 MiniMax 自己的 Hailuo-2.3(第 27 名,1199 分)和 Hailuo-02-pro(第 28 名,1197 分)是巨大进步。该模型为开放权重,支持原生 2K 生成,并带有同步立体声,单次生成 4 到 15 秒视频。

rss · Arena.ai(@lmarena_ai) · Aug 3, 22:37

背景: LMArena(又称 Arena)是一个由社区驱动的平台,通过真实用户的匿名盲测对 AI 模型进行排名;其中 Video Arena 赛道专门评估视频生成模型。MiniMax-H3 是 MiniMax 最新的开放权重视频模型,将生成、参考和编辑统一在一个模型中,并能理解文本、图像、视频和音频输入。从历史上看,开源视频模型落后于专有模型,但这一排名表明差距正在显著缩小。

参考链接

标签: #MiniMax, #Video Generation, #Open Source, #AI Model, #LMArena


Qwen3.8-Max 登上前端代码竞技场第 4 名
Qwen3.8-Max Reaches #4 on Frontend Code Arena
⭐️ 8.0/10

阿里巴巴的 Qwen3.8-Max 在 Frontend Code Arena 排行榜上以 1,668 分位列第 4,仅次于 Claude Opus 5 (Max)和 Kimi K3 (Max)。该模型在所有评测领域均进入前 5,其中在 Consumer Product 领域排名第 2。 这一排名表明,阿里巴巴的 Qwen 系列在前端代码生成这一重要实际基准上已可与领先的西方和中国模型竞争。即将发布的开源权重版本可能进一步加速开发者的采用,并对专有模型构成挑战。 Qwen3.8-Max 是一个 2.4 万亿参数的多模态模型,其开源权重计划于下周与 Qwen3.8-27B 一同发布。定价为每百万输入 tokens 2.0 美元,每百万输出 tokens 6.0 美元,隐式缓存每百万 tokens 0.25 美元。

rss · Arena.ai(@lmarena_ai) · Aug 3, 02:46

背景: Frontend Code Arena 是一个基于人类偏好对模型前端网页代码生成能力进行排名的排行榜,依据真实从业者的评估。Qwen3.8-Max 是阿里云下一代旗舰模型的预览版,于 2026 年 7 月 19 日发布,主打自主编码、长周期规划和原生多模态反馈闭环。该基准只针对前端任务,信号实际但范围较窄,不衡量后端可靠性或智能体任务的整体表现。

参考链接

标签: #AI, #Benchmark, #Code Generation, #Frontend, #Qwen


推文展示使用 MiniMax H3 本地生成视频
Local Generation of Video with MiniMax H3 Shown in Tweet
⭐️ 8.0/10

venturetwins 的一条推文展示了一个使用 MiniMax H3 本地生成的视频,证明高质量视频生成可以在设备端运行。该视频由 u/sixhaunt 制作,推文重点突出了本地实现这一能力的令人惊讶之处。 这很重要,因为本地视频生成能带来更高的隐私性、更低的延迟和离线自定义能力,减少对云服务的依赖。这也标志着向让消费者硬件上也能使用先进生成式 AI 迈出了重要一步。 MiniMax H3 是一个通用全模态生成模型,能够联合理解文本、图像、视频和音频,并生成带有原生立体声、最高 2K 分辨率、时长 15 秒的视频。该推文本身没有提供具体硬件细节或性能基准,但展示的输出看起来非常逼真。

rss · Justine Moore(@venturetwins) · Aug 3, 15:20

背景: MiniMax H3 是 MiniMax 发布的一个开放模型,定位为下一代多模态模型,旨在超越专门的生成任务,迈向更广泛的模态智能。在本地运行这类模型通常需要很高的计算资源,但最近量化技术(如 INT4 和 FP8)的进步使其在高性能 GPU 上更具可行性。这一能力与将强大的生成式 AI 模型直接部署到用户设备上的增长趋势相符。

参考链接

标签: #video generation, #MiniMax H3, #local AI, #generative AI, #machine learning


Cloudflare Computer 库让 Agent 在 Durable Object 上拥有虚拟文件系统
Cloudflare Computer library gives agents a virtual file system on Durable Objects
⭐️ 8.0/10

Cloudflare 刚刚发布了 @cloudflare/computer 库,为每个 AI Agent 在 Durable Object 内提供基于 SQLite 持久化的虚拟文件系统,并可通过 workspace.runtime 在不同运行时之间切换。 这一方案意义重大,因为 Agent 可以跨会话保留持久化状态,同时根据任务动态选择最高效的运行时。这可能广泛影响 Cloudflare 边缘网络上 AI Agent 沙箱与工作空间的架构方式。 该库支持三种运行时:Container 通过 FUSE 把 SQLite 状态挂载到真实 Linux 沙箱容器;Isolate Shell 在 Dynamic Worker 里模拟轻量级假 Shell 并运行 just-bash;Isolate JavaScript 在隔离的 Dynamic Worker 中运行 JS。Durable Object 在 SQLite 中保存权威状态,并通过 workspace.runtime 暴露可插拔的执行面。

rss · Viking(@vikingmute) · Aug 3, 14:25

背景: Durable Objects 是 Cloudflare 提供的状态化无服务器函数,可保持状态并协调实时应用,属于 Cloudflare 边缘平台的一部分。Dynamic Workers 允许按需创建任意数量的 Worker 来执行运行时指定的代码,是容器之外另一种轻量级沙箱方案。新的 @cloudflare/computer 库将这些概念结合,为 Agent 提供基于 SQLite 的虚拟文件系统与可插拔的运行时。

参考链接

标签: #Cloudflare, #Durable Objects, #SQLite, #Virtual File System, #AI Agents


Qwen 3.8 Max 与 MiniMax-H3 数小时内相继发布
Qwen 3.8 Max and MiniMax-H3 Launch Within Hours
⭐️ 8.0/10

阿里巴巴的 Qwen 3.8 Max 与上海 MiniMax 公司的 H3 模型在数小时内相继发布。MiniMax-H3 已在 Hugging Face 上公开提供,而 Qwen 3.8 Max 则定位为 2.4T 参数的旗舰模型,并宣称在多项基准测试中优于 GPT-5.6 Sol。 这两次接连发布显示出开放权重 AI 模型的前沿正以极快速度推进,尤其来自中国实验室的进展。开发者和企业如今在多模态生成和大规模推理任务上有了新的强大选择。 MiniMax-H3 是一个全模态(omni-modal)模型,能够理解文本、图像、视频和音频,并可生成最高 2K 分辨率、15 秒时长、带原生立体声的视频。Qwen 3.8 Max 据称采用 2.4T 参数的混合专家(MoE)架构,并与 Claude Opus 4.8 和 GPT-5.6 Sol 等模型进行了对比测试。

rss · Simon Willison(@simonw) · Aug 3, 03:42

背景: Qwen 是阿里巴巴云开发的大语言模型系列,通常以开源或源码可用许可证发布。MiniMax 是一家总部位于上海的人工智能公司,以多模态模型和 Talkie、海螺 AI 等消费者应用闻名,被视为中国“AI 六虎”之一。MiniMax-H3 延续了开放权重模型处理多种模态的趋势,而 Qwen 3.8 Max 则在推理和智能体基准测试的高端领域展开竞争。

参考链接

标签: #AI, #Large Language Models, #Qwen, #MiniMax, #Model Release


MiniMax 开源 H3 视频模型,声称质量接近 Seedance 2.0
MiniMax Open-Sources H3 Video Model, Claimed Near Seedance 2.0 Quality
⭐️ 8.0/10

MiniMax 已将其 H3 视频生成模型(MiniMax-H3)开源,现已在 Hugging Face 上的 MiniMaxAI/MiniMax-H3 公开提供。初步的非正式说法称其性能达到 Seedance 2.0 的约 80%,使其成为开源视频生成模型中的 SOTA 级别。 开源视频生成历来落后于专有的黑盒系统,而 H3 显著缩小了这一差距。如果该说法成立,它将使接近前沿的视频生成能力得以普及,让独立开发者和研究人员能够构建高保真的视频工具和应用。 该模型已以 MiniMaxAI 组织名义上线 Hugging Face,早期社区测试显示它可在 RTX 3060 等消费级显卡上运行。“Seedance 2.0 的 80%”的说法来自非正式轶事而非正式基准测试,实际质量可能因使用场景而异。

rss · Orange AI(@oran_ge) · Aug 3, 03:18

背景: SOTA 是 'State-of-the-Art' 的缩写,表示某一领域当前的最佳水平。Seedance 2.0 是字节跳动推出的专有文生视频模型,以从文本或图像生成逼真的好莱坞风格短片而闻名。开源视频模型通常在质量和能力上落后于这类专有系统,而 H3 的发布可能标志着这一局面的转变。

参考链接

标签: #视频生成, #开源, #AI模型, #SOTA, #MiniMax


马克·安德森:软件责任提案是对行业的“致命一击”
Marc Andreessen: Software Liability Proposal Is a 'Kill Shot' to Industry
⭐️ 8.0/10

马克·安德森在 a16z crypto 的视频中,将一项让软件开发者对其代码未来使用负监管责任的提案称为对软件行业的“致命一击”,并用酒店和汽车工程师的类比来说明其荒谬性。 该提案源于欧盟的《网络韧性法案》和修订后的《产品责任指令》等法规,可能会让开源开发者承担责任,威胁支撑现代软件基础设施的协作模式。这可能会将创新驱离欧盟,并在全球范围内抑制开源贡献。 安德森在与克里斯·迪克森和瑞安·哈克特的播客中发表了上述言论,其中名为“开发者责任是致命一击”的环节认为,让开发者对未来无法预料的使用负责是不可能做到的。欧盟《产品责任指令》(2024/2853) 明确将软件视为产品,而《网络韧性法案》在修订前也曾对开源维护者施加义务。

rss · a16z(@a16z) · Aug 3, 19:45

背景: 开源软件由个人和组织协作构建,通常免费分发,支撑着绝大多数数字基础设施。欧盟推出了新法规以加强网络安全和消费者保护,包括《网络韧性法案》和涵盖软件的更新版《产品责任指令》。像安德森这样的批评者认为,这些规则没有考虑到开源的实际运作方式——开发者无法控制或预见每一个下游用途。这场辩论反映了数字经济中创新与监管之间更广泛的全球冲突。

参考链接

标签: #open-source, #regulation, #software-industry, #policy, #security


阿里云发布千问 3.8 Max 正式版,加入 AI‘重置’潮流
Alibaba Cloud Rolls Out Qwen 3.8 Max, Joins AI 'Reset' Trend
⭐️ 8.0/10

阿里云正式发布千问 3.8 Max,这是其最新旗舰大语言模型,结束了预览阶段。该消息由@op7418 在推特上公布,新模型对标 GPT-5.6 Sol 和 Claude Fable 5 等竞争对手。 千问 3.8 Max 是阿里云的重要发布,也是少数能与西方顶级实验室正面竞争的中国模型系列之一。其基准测试成绩可能改变外界对中国大模型的看法,并加剧全球 AI 模型竞赛。 基准对比显示,千问 3.8 Max 在编程智能体、通用智能体任务和通用能力上均超过 GPT-5.6 Sol 和 Claude Fable 5,也优于前代 Qwen3.7-Max。该模型参数规模约 2.4 万亿,价格和自托管部署方案仍是企业用户关注的重点。

rss · 歸藏(guizang.ai)(@op7418) · Aug 3, 07:23

背景: 千问(通义千问)是阿里云开发的大语言模型系列,通过多种开源和商业许可证分发。从 Qwen3.7-Max 到 Qwen3.8-Max 的快速迭代,反映了阿里云在竞争激烈的 LLM 市场中的激进发布节奏。据搜索结果,千问 3.8 Max 是一个约 2.4 万亿参数的旗舰模型,经常与西方领先模型进行基准对比。

参考链接

标签: #Qwen, #Alibaba Cloud, #LLM, #AI release, #Artificial Intelligence


MiniMax 开源全模态 H3 模型
MiniMax Open-Sources Its Omni-Modal H3 Model
⭐️ 8.0/10

MiniMax 宣布其 MiniMax-H3 模型现已在 Hugging Face 上公开发布。H3 是一款全模态(omni-modal)生成模型,可同时处理文本、图像、视频和音频,并能生成带原生立体声的视频。 开源 H3 使全球开发者和研究人员都能使用先进的多模态 AI 技术,有望加速视频生成和多模态理解领域的创新。这也巩固了 MiniMax 作为中国“AI 虎”(AI Tigers)企业之一在开放 AI 生态中的地位。 该模型在 Hugging Face 的 MiniMaxAI/MiniMax-H3 仓库中提供。它支持最高 2K 分辨率、15 秒时长、带原生立体声的视频生成,并有一个单独的 H3-VA 视觉语言变体,用于图像与文本的联合理解。

rss · 歸藏(guizang.ai)(@op7418) · Aug 3, 03:35

背景: MiniMax 是一家总部位于上海的人工智能公司,开发多模态 AI 模型和消费者应用,是中国“AI 虎”(AI Tigers)企业之一。H3 代表了从专门的文本或视频模型向通用全模态模型的转变,能够跨文本、图像、视频和音频进行联合理解与生成。通过在 Hugging Face 上发布权重,MiniMax 允许更广泛的社区使用并基于该技术进行构建。

参考链接

标签: #AI, #Open Source, #MiniMax, #Model Release


Qwen3.7 Max 在智能体与视觉基准测试中大幅领先
Qwen3.7 Max Surges Ahead on Agent and Visual Benchmarks
⭐️ 8.0/10

在一则推文中,Qwen 报告其 Qwen3.7 Max 模型在长周期与视觉智能体基准测试中胜过 Qwen3.5,其中 PaperBench 从 64.8 升至 93.0,OSWorld-Verified 从 73.3 升至 86.1,Vision2Web 从 42.1 升至 69.0。 这些提升值得关注,因为长周期任务和视觉智能体任务被视为 AI 助手的核心前沿领域。如果这些数据经得起验证,Qwen3.7 Max 将可能成为智能体与计算机使用应用的强力竞争者,影响基于 Qwen 模型进行开发的开发者与企业。 这些得分来自一条推文,尚未有独立的公开验证结果。PaperBench 衡量 AI 智能体复现研究论文的能力,而 OSWorld-Verified 涉及完成真实的桌面与网页任务,因此这些进步涵盖了编码、规划与多模态理解。

rss · OpenRouter(@OpenRouterAI) · Aug 4, 00:18

背景: 像 PaperBench 和 OSWorld-Verified 这样的智能体基准测试,旨在评估 AI 系统在需要规划与工具使用的长周期任务上的表现。PaperBench 由 OpenAI 提出,要求智能体通过编写并执行代码来复现最前沿的机器学习研究。OSWorld-Verified 是 OSWorld 的后续版本,通过 369 个真实桌面与网页任务来评估计算机使用智能体。此类基准测试已成为超越简单对话与编码测试、比较前沿模型的重要手段。

参考链接

标签: #AI, #Qwen, #LLM, #Benchmarks, #Agents


OpenAI 发布十项数学进展的 Lean 证书与推理详解
OpenAI Releases Lean Certificates and Walkthroughs for Ten Math Advances
⭐️ 8.0/10

OpenAI 已发布十项近期数学进展背后的手稿、正式 Lean 证书和推理过程详解,使数学家能够核验这些结果并在此基础上继续研究。相关材料已在 OpenAI 官网公开。 此次发布使 OpenAI 的 AI 驱动数学结果能够被独立核验和再利用,回应了 AI 生成证明可信度方面的关键担忧。这可能加速形式数学研究,并为 AI 辅助发现在透明性方面树立先例。 正式证书使用 Lean 证明助手编写,可以机械地检查证明;而推理详解则提供了模型推理过程的分步叙事说明。此次发布配套 OpenAI 的论文《数学的十项进展》(Ten Advances in Mathematics),OpenAI 鼓励数学家研读并基于这些思路展开工作。

rss · OpenAI(@OpenAI) · Aug 3, 18:54

背景: Lean 是一个开源证明助手和函数式编程语言,用于形式化验证数学定理。正式证明证书是一种可机器检查的产物,能确保定理被正确推导,从而提供很强的正确性保证。借助这类证书,数学家无需仅凭信任即可核验复杂的 AI 生成结果。

参考链接

标签: #Lean, #Formal Verification, #AI for Math, #OpenAI, #Mathematics


Vercel 发布全新 v0 API,实现编程式应用构建
Vercel Launches New v0 API for Programmatic App Building
⭐️ 8.0/10

Vercel 宣布推出新的 v0 API,让开发者可以以编程方式访问 v0 的 AI 应用构建能力。该 API 支持从提示词、代码仓库或 ZIP 文件启动对话,渲染开发服务器预览,发送后续消息,以及部署到 Vercel。 这使 v0 从交互式 Web 应用扩展为可编程平台,开发者可以将 AI 辅助生成、预览和部署集成到自己的工具和 CI/CD 流程中。它巩固了 Vercel 在 AI 辅助开发生态中的领先地位。 公告列出了四项核心能力:从提示词、仓库或 ZIP 启动对话;渲染开发服务器预览;发送后续消息;以及部署到 Vercel。公告未包含具体的认证方式、接口名称和定价信息。

rss · v0(@v0) · Aug 3, 19:41

背景: v0 是 Vercel 推出的 AI 驱动开发平台,用户可以通过自然语言提示生成全栈 Web 应用、智能体、网站和界面。它支持快速原型制作、代码生成和一键部署。新的 API 将这些现有能力以编程方式开放出来,使外部应用可以驱动 v0 的工作流程。

参考链接

标签: #v0, #API, #Vercel, #AI, #web development


Next.js 16.3 推出即时导航与更快的构建速度
Next.js 16.3 Introduces Instant Navigations and Faster Builds
⭐️ 8.0/10

Next.js 16.3 引入了 Instant Navigations(即时导航)这一可选功能,让服务端渲染应用也能像单页应用一样即时响应。该版本还带来了更快的开发服务器、更快的构建,以及针对 AI 代理的改进工具。 这一版本显著改善了最广泛使用的 React 框架之一的开发者和终端用户体验,有望消除服务端渲染与客户端交互性之间的取舍。更快的开发与构建时间可直接提升大规模场景下的开发者生产力。 Instant Navigations 以可选预览功能的形式发布,团队可以逐步采用而无需破坏性变更。该更新还包含针对 AI 代理的增强工具,反映了 AI 编程助手日益普及的趋势。

rss · Next.js Blog · Aug 3, 17:00

背景: Next.js 是一个流行的 React 框架,支持服务端渲染和静态站点生成。传统的服务端渲染应用在导航时通常较慢,因为每次页面加载都需要与服务器往返通信,而单页应用(SPA)通过在浏览器中运行所有逻辑来即时更新视图。Instant Navigations 旨在通过预取和缓存资源,让链接点击立即响应,同时仍然使用服务器,从而结合两种方式的优点。此版本延续了 Vercel 在 Next.js 16.1 和 16.2 之后快速迭代的节奏。

参考链接

标签: #Next.js, #React, #Web Development, #Performance, #Framework


论文按交互边分类 41 种智能体故障模式
Paper Organizes 41 Agent Failure Modes by Interaction Edges
⭐️ 8.0/10

arXiv 上一篇论文(2607.28802)提出了一种分类体系,将 41 种智能体故障模式按照其来源的组件间交互边进行分类,并标注了应进行修复的一侧。 这为生产环境中的智能体开发者提供了一套共同的术语,用于调试故障,这些故障通常出现在模型与其脚手架之间的接缝处。该分类体系经过前沿模型验证,Cohen's kappa 达到 0.76,表明可以自动化运行,对生产轨迹进行持续标注。 该分类体系将每种故障模式分配到六个组件(模型、脚手架、用户、工具、记忆、环境)中两个组件之间的某条边上,并包含故障侧以指明修复应归属的位置。在四种前沿模型中,最强的评估器与人工标签达到了高度一致。

rss · elvis(@omarsar0) · Aug 3, 19:56

背景: 智能体脚手架是围绕大语言模型的软件基础设施,使其能够作为智能体运行,管理工具使用、记忆、状态持久化和反馈循环。Cohen's kappa 是一种衡量评分者间信度的统计量,考虑了偶然一致性。随着脚手架工程成为智能体开发者的关键手段,一个通用分类体系有助于区分脚手架故障与模型故障,这与微软对智能体 AI 系统故障模式的分类工作方向一致。

参考链接

标签: #agents, #failure modes, #production, #taxonomy, #AI engineering


Locus AI 自动化后训练,击败人工调优的 Qwen3
Locus AI Automates Post-Training, Beats Human-Tuned Qwen3
⭐️ 8.0/10

Intology 的自动化研究系统 Locus 对 Qwen3 1.7B 基础模型进行后训练,使其性能超过了官方人工调优的 Qwen3 1.7B Instruct 模型,并在 PostTrainBench 上取得了最先进的结果。该结果由 Intology 在 X(推特)上公布,称 Locus 目前在该基准测试中排名第一。 这一结果表明,自动化 AI 研究系统现在可以在大语言模型的后训练中超越人类专家的调优,有望降低模型优化的成本并提高其可扩展性。它可能会改变 AI 社区对后训练的看法,使自动化流水线成为人工专家调优的可靠替代方案。 PostTrainBench 评估在固定 10 小时 H100 预算内对模型进行后训练的 CLI 代理,Intology 将其扩展为 PostTrainBench+,后者使用数千个 H100 小时以更清晰地区分各方法。作为泛化测试,Locus 还参与了所有有奖金和公开排行榜的正在进行的 Kaggle 竞赛,在 16 天后所有参赛者中平均排名第 4。

rss · elvis(@omarsar0) · Aug 3, 18:08

背景: 后训练是指在大型文本语料库上预训练的基础语言模型上进行进一步调优,使其遵循指令或提升特定能力的过程,通常由人类专家完成。PostTrainBench 是一个基准测试,用于评估 CLI 代理在固定 H100 和 10 小时预算下自主后训练小型语言模型的能力。Locus 是 Intology 开发的一个通用自动化研究系统,建立在早期工作之上,代表了自动化科学发现和模型优化这一更广泛趋势。

参考链接

标签: #AI, #LLM, #Post-training, #Qwen3, #Automated Research


Next.js 16.3 发布:更快构建、即时导航与 Agent 原生开发体验
Next.js 16.3 Launch: Faster Builds, Instant Navigations, Agent-Native DX
⭐️ 8.0/10

Next.js 16.3 现已发布,开发模式内存占用最高可降低 90%,构建与类型检查速度更快,支持自定义错误边界(Custom Error Boundaries),并提供类 SPA 的即时导航(Instant Navigations)。Vercel CEO Guillermo Rauch 强调,这是迄今为止对 AI 代理(Agent)最友好的版本,内置了带版本化的文档和代理驱动的迁移支持。 Next.js 是最广泛使用的 React 框架之一,因此这些性能与成本效率提升将影响庞大的开发者生态,覆盖从自托管项目到 Serverless 部署。对 Agent 原生工具链的重视,也反映了整个行业正在向构建 AI 编程代理可稳定使用的框架转变。 该版本包含增量 next build 缓存,以及归功于 Fable 的内存优化;Instant Navigations 即将默认启用。此外还新增了自定义错误边界、面向代理的内置版本化文档,并宣称在自托管和 Serverless 环境中运行成本更低,共有 90 位贡献者参与。

rss · Guillermo Rauch(@rauchg) · Aug 3, 22:49

背景: Next.js 是 Vercel 推出的全栈 React 框架,内置图片、字体和脚本优化,并使用以 Rust 编写的增量打包器 Turbopack。新增的增量构建缓存建立在 Next.js 现有的 CI 构建缓存机制之上,后者通过持久化 .next/cache 缓存来加速重复构建。即时导航(Instant Navigations)旨在提供类 SPA 的响应速度,取代传统服务端渲染导航较慢的体验。Agent 原生开发体验(Agent-native DX)意味着框架在设计上更便于 AI 编程代理使用,包括版本化文档和脚手架选择。

参考链接

标签: #Next.js, #Web Development, #Performance, #AI, #Framework


海螺 AI 宣布 H3 开放权重,支持多模态视频生成
Hailuo AI Makes H3 Open-Weight for Multimodal Video Generation
⭐️ 8.0/10

海螺 AI(MiniMax)正式宣布其 H3 多模态视频生成模型已开放权重,向创作者和开发者公开训练好的模型权重。这是 Hailuo 3.0 模型首次可以下载并在本地运行。 开放前沿多模态视频模型的权重,意味着不再只能通过 API 使用,开发者可以在本地或自有基础设施上运行、微调和集成 H3。这有望降低成本、加速创新,并加剧 AI 视频生成市场的竞争。 H3 是 MiniMax 的 Hailuo 3.0,能够从文本、图像、视频和音频生成原生 2K、24fps 且音画同步的视频。早期社区测试显示,它可以在 RTX 5090 上通过 ComfyUI 以 int8 量化方式本地运行,生成 1344x768、8 秒的视频约需 15 分钟,但其提示词语法与竞争对手 Seedance 2.5 有所不同。

rss · Hailuo AI (MiniMax)(@Hailuo_AI) · Aug 3, 14:23

背景: 开放权重模型是指将训练后学到的参数(权重和偏置)公之于众的 AI 模型,任何人都可以在其许可条款下下载、运行、微调和修改。H3 是一款多模态视频生成模型,它将生成、编辑和参照任务视为一个统一的创意上下文,而非相互独立的工作流,延续了 MiniMax 此前的 Hailuo 系列(包括 Hailuo 2.3 和 Hailuo 2.2)。

参考链接

标签: #multimodal, #video generation, #open-weight, #AI, #Hailuo AI


MiniMax 发布开放权重视频模型 MiniMax-H3
MiniMax Releases Open-Weight Video Model MiniMax-H3
⭐️ 8.0/10

MiniMax 通过 X(推特)和 Hugging Face 宣布公开开放权重视频生成模型 MiniMax-H3。该模型已验证可在 NVIDIA RTX 5090 和 RTX 6000 GPU 上运行。 开放权重视频模型降低了研究者和开发者在自有硬件上运行最新视频生成技术的门槛,支持定制、微调及多样化应用部署。此次发布表明 MiniMax 致力于开放 AI,有望加速视频合成领域的社区驱动创新。 该模型托管在 Hugging Face 的 MiniMaxAI/MiniMax-H3 仓库。公告强调“来自社区,回馈社区”,并在消费级(RTX 5090)和专业级(RTX 6000)GPU 上通过验证。

rss · Hailuo AI (MiniMax)(@Hailuo_AI) · Aug 3, 03:44

背景: 开放权重 AI 模型是指将训练好的参数(权重)公开发布,任何人都可以下载并在本地运行、研究或针对特定任务进行微调。视频生成模型是根据文本、图像或其他输入生成动态影像的 AI 系统,在文生图技术基础上增加了时间维度。GPU 兼容性验证对于希望不依赖云服务、自主部署模型的用户至关重要。

参考链接

标签: #open-weight, #video generation, #AI model, #GPU compatibility, #MiniMax


OpenAI 发布 GPT-Live,一种全双工实时语音架构
OpenAI unveils GPT-Live, a full-duplex realtime voice architecture
⭐️ 8.0/10

Greg Brockman 宣布了 GPT-Live,这是一套用于实时音频的新架构和技术栈,能够让模型边听边说。OpenAI 表示,他们从客户端到模型重建了语音技术栈,使音频在对话中持续流动。 GPT-Live 可以让与 AI 的语音交互感觉更自然、更像真实对话,因为推理和工具调用不再打断语音的连贯性。它可能成为 ChatGPT 规模下实时语音的基础,并提高整个行业语音 AI 产品的门槛。 GPT-Live 基于全双工(full-duplex)架构构建,即可以同时收听和说话,并采用无轮次语音模型(turnless speech model)与低延迟设计。它还能在用户说话时提供“嗯”“对”等主动倾听回应。

rss · Greg Brockman(@gdb) · Aug 3, 22:25

背景: 大多数传统语音助手是半双工(half-duplex)的:它们会等用户说完再回应,因此会产生停顿和打断。GPT-Live 是一个全双工系统,可连续处理音频,让模型在推理时也能实时发出应答和插话。OpenAI 称这是一代新的语音模型,面向 ChatGPT 规模的自然对话,覆盖从客户端到模型的整个技术栈。

参考链接

标签: #AI, #realtime audio, #architecture, #OpenAI


Jina AI 发布 Reranker v3.5,采用混合注意力实现更快列表式重排序
Jina AI releases Reranker v3.5 with faster listwise reranking and hybrid attention
⭐️ 8.0/10

Jina AI 宣布发布 Reranker v3.5,一款通过混合注意力与自蒸馏实现更快列表式重排序的新重排序模型。公告附带了博客文章、arXiv 论文(2607.18152)以及 Hugging Face 模型页面(jinaai/jina-reranker-v3.5)。 此次发布推动了重排序技术(信息检索与检索增强生成(RAG)流程中的关键环节)的发展。通过加速列表式重排序,它可以提升开发者与研究人员在搜索和基于大语言模型的答案生成方面的效率与质量。 该模型引入了融合多种注意力机制的混合注意力,并借助自蒸馏提升训练效果。Hugging Face 模型以 jinaai/jina-reranker-v3.5 为标识提供,技术细节见 arXiv 论文 2607.18152。

rss · Jina AI(@JinaAI_) · Aug 3, 14:41

背景: 重排序是一种两阶段检索技术,由更强的模型对初始候选文档集重新评分以改善最终排序。列表式重排序一次性处理整个候选列表,能更好地捕捉文档间依赖,而传统逐点方法则对每篇文档独立打分。混合注意力通常融合不同的注意力操作(如通道注意力与空间注意力)以捕获更丰富的特征交互,自蒸馏则利用模型自身的预测作为软标签来提升泛化能力与训练效率。

参考链接

标签: #Reranker, #Information Retrieval, #NLP, #Jina AI, #Model Release


Jina AI 发布 jina-reranker-v3.5:高效 0.6B 列表式重排序模型
Jina AI Unveils jina-reranker-v3.5: Efficient 0.6B Listwise Reranker
⭐️ 8.0/10

Jina AI 在 X(推特)上发布了 jina-reranker-v3.5,一个 0.6B 参数的列表式(listwise)重排序模型。它在 BEIR 上取得 63.20 nDCG@10,超越 Qwen3-Reranker-4B,同时参数量约为后者的 1/7。 这一发布意义重大,因为它表明更小、更高效的重排序模型可以在关键检索基准上击败更大的模型,有望降低企业搜索和 RAG 管道的成本与延迟。它也强化了信息检索领域注重效率的模型设计趋势。 该模型改进了 jina-reranker-v3 的“last-but-not-late”交互机制,使其速度更快,并更适配企业数据。BEIR 上 63.20 nDCG@10 的结果与 Qwen3-Reranker-4B 对比,显示出很强的效率与效果平衡。

rss · Jina AI(@JinaAI_) · Aug 3, 14:41

背景: 重排序器(reranker)是在初步检索后对文档重新排序,以提升相关性的模型。列表式(listwise)重排序会同时考虑多个文档,常与 LLM 结合,但成本较高;jina-reranker-v3 提出了“last but not late”(LBNL)交互,在共享上下文窗口中对查询和候选文档应用因果注意力。BEIR 是一个异构的零样本信息检索基准。Jina AI 的新版 v3.5 在此基础上进一步优化。

参考链接

标签: #AI, #Machine Learning, #NLP, #Reranker, #Model Release


微软 Agent Framework Harness 与 Foundry 托管代理正式全面可用
Microsoft's Agent Framework Harness and Hosted Agents Reach GA
⭐️ 8.0/10

微软宣布 Agent Framework 的 Harness 运行时与 Foundry 托管代理现已全面上市(GA)。该 Harness 及 GitHub Copilot、Claude Agent SDK 连接器和编排模式在 Build 2026 上转为稳定版,随后达到 GA。 这标志着从用于构建代理的 SDK 转向经过治理并获得支持的规模化运行平台。企业现在可以依赖微软提供支持的运行时和内置治理能力,这将加速 AI 代理在生产环境中的采用。 Harness 是一个面向 Python 和 .NET 的“全家桶”式代理运行时,提供记忆、技能和审批流程。Foundry Agent Service 中的托管代理以容器化应用形式运行在微软托管的基础设施上,由平台处理缩放、会话状态持久化、安全性和生命周期管理。

rss · InfoQ · Aug 3, 10:30

背景: Microsoft Agent Framework 是一个用于构建 AI 代理的 SDK,而 agent harness 是连接模型推理与实际执行的运行时层,包括 shell 和文件系统访问、审批流程以及跨长时间运行会话的上下文管理。Foundry 托管代理允许开发者将自己的代理代码打包为容器镜像并部署到 Agent Service,由平台处理扩展、安全等运维问题。此举为开发者提供了一条从代理原型到生产部署的、受支持且适合企业的路径。

参考链接

标签: #Microsoft, #Agent Framework, #AI Agents, #General Availability, #Cloud Computing


智能体计算(Agentic Compute):企业 AI 复杂性的缺失层
Agentic Compute: The Missing Layer for Enterprise AI Complexity
⭐️ 8.0/10

在本次 InfoQ 演讲中,Arun Joseph 主张智能体计算(agentic compute)是企业 AI 中缺失的基础层,并以德国电信的 LMOS 平台为例。他倡导用临时智能体(ephemeral agents)和智能体定义语言(ADL)等核心平台抽象来取代工具泛滥,并超越聊天机器人走向运营智能。 这很重要,因为许多企业在将 AI 扩展到孤立聊天机器人之外时面临工具泛滥和组织孤岛等挑战。该演讲提供了一个具体的架构视角,可帮助平台团队设计更具弹性、可用于生产环境的智能体系统。 该演讲基于德国电信的 LMOS——一个开源的、面向大规模部署 AI 智能体的语言模型操作系统,横跨多个国家。关键抽象包括临时智能体(即按需创建的短期智能体)和智能体定义语言(ADL,一种描述智能体身份、能力、工具和权限的声明式格式)。

rss · InfoQ · Aug 3, 08:08

背景: 智能体 AI(Agentic AI)是指能够推理、与其他智能体和系统协调并执行多步骤工作流的 AI 系统,超越单任务自动化,实现端到端的流程执行。智能体企业(agentic enterprise)将此类智能体集成到各个业务职能中,使它们能够与人类员工一起规划和行动。LMOS(Language Model Operating System)是德国电信自主开发的、对开发者友好的平台,用于构建和扩展 AI 智能体,并支撑了 Magenta OneBOT 等面向客户的助手。智能体定义语言(ADL)是一种新兴的开放标准,以结构化、可移植且与框架无关的方式描述 AI 智能体。

参考链接

标签: #enterprise AI, #agentic computing, #AI architecture, #platform engineering, #operational intelligence


Baseten 完成 130 亿美元 F 轮融资,推出推理工程大师课
Baseten Raises $13B Series F and Unveils Inference Engineering Masterclass
⭐️ 8.0/10

Baseten 刚刚完成 130 亿美元($13B)F 轮融资,现已成为推理工程领域的领先公司之一。同期发布了一期由 Philip Kiely 和 Ali Taha 主讲的推理工程大师课,涵盖自回归模型与扩散模型推理的关键技术。 这轮融资和大师课凸显了推理工程在 AI 基础设施中的核心地位,直接影响生成式 AI 模型在生产环境中的速度、成本和可靠性。对于 AI 系统工程师和基础设施团队而言,掌握这些技术正成为高效扩展 AI 服务的关键。 该大师课是 latent.space 播客节目的一期内容摘要,而非原创技术论文,重点讲述自回归模型与扩散模型的实用推理工程技巧。内容强调从 CUDA 内核到 Kubernetes 自动扩缩容的全栈优化,体现了 Baseten 在生产级推理服务方面的专业积累。

rss · Latent.Space · Aug 3, 21:44

背景: 推理工程是一个新兴领域,专注于在生产环境中高效地部署和提供生成式 AI 模型。它覆盖从底层 CUDA 内核到基于 Kubernetes 的自动扩缩容的完整技术栈,目标是让推理更快、更便宜、更稳定。自回归模型(如大型语言模型)逐 token 生成输出,而扩散模型通过迭代去噪生成样本,两者在生产服务中面临的优化挑战各不相同。

参考链接

标签: #inference, #AI infrastructure, #funding, #autoregressive, #diffusion


Cloudflare 发布@cloudflare/computer:为智能体提供动态运行时
Cloudflare Introduces @cloudflare/computer, a Dynamic Agent Runtime
⭐️ 8.0/10

Cloudflare 宣布推出@cloudflare/computer,这是一个新的智能体运行时,通过在快速的 isolates 与完整的 Linux 容器之间切换,为每个 AI 智能体动态分配计算环境。该公司表示,这能让每个智能体拥有‘自己的计算机’,而不仅仅是一个容器。 这一动向意义重大,因为 AI 智能体要实现有效扩展,往往不能只靠一个容器,而容器在简单任务上又可能过于笨重。通过轻量级 isolates 与完整容器之间的动态编排,Cloudflare 的运行时有望让智能体部署更具可扩展性和成本效益,并影响更广泛的智能体基础设施生态。 关键细节:Cloudflare isolates 是轻量级、内存隔离的上下文,可在现有进程内非常快速地启动,从而允许单个操作系统进程中运行成百上千个 isolates。@cloudflare/computer 会根据需要将每个智能体动态放置在 isolates 或完整 Linux 容器中;本次公告内容简短,尚未提供技术规格或发布时间表。

rss · The Cloudflare Blog · Aug 3, 13:15

背景: AI 智能体运行时是 AI 智能体运行和操作所依托的执行环境,为其提供处理输入、执行任务和实时交付输出的基础设施。Cloudflare 在 Workers 平台中已经采用的 isolate 模型,可在单个操作系统进程内运行大量轻量级、内存隔离的代码上下文,避免了为每个函数创建虚拟机或容器带来的开销。相比之下,容器封装了完整的 Linux 用户空间,但启动和管理成本更高。新的@cloudflare/computer 运行时旨在结合两者,为每个智能体提供量身定制、可扩展的计算环境。

参考链接

标签: #Cloudflare, #Agent Runtime, #Containers, #Infrastructure


Cloudflare Workers 现已支持入站 TCP 与 gRPC
Cloudflare Workers Now Support Inbound TCP and gRPC
⭐️ 8.0/10

Cloudflare 宣布 Workers 和 Containers 现在通过 Spectrum 支持入站 TCP 连接,从而能够运行全双工 gRPC 应用。开发者还可在 Workers 内直接使用 gRPC 到 gRPC-web 的自动转换。 这极大扩展了无服务器平台的能力,使实时和流式应用无需管理专用服务器即可实现有状态、双向、低延迟通信。自动的 gRPC-web 转换省去了单独代理的需求,降低了浏览器客户端的接入门槛。 入站 TCP 连接由 Cloudflare Spectrum 处理,并可转发到 Durable Objects 或 Containers。gRPC 到 gRPC-web 的转换是自动的,因此开发者无需配置 Envoy 或类似代理。

rss · The Cloudflare Blog · Aug 3, 13:00

背景: Cloudflare Spectrum 是一个 4 层代理,可为非 HTTP 流量提供 DDoS 防护。Durable Objects 是一种有状态的无服务器函数,结合了计算与存储,适用于实时和分布式系统。gRPC 是高性能 RPC 框架,而 gRPC-web 允许浏览器客户端与 gRPC 服务通信,通常需要通过 Envoy 等代理;这项新功能消除了这个额外环节。

参考链接

标签: #Cloudflare, #gRPC, #Serverless, #TCP, #Workers


Cloudflare 通过量化和完整性校验优化 Kimi 与 GLM 的模型服务
Cloudflare optimizes Kimi and GLM serving with quantization and integrity checks
⭐️ 8.0/10

Cloudflare 发布了一篇技术深度文章,详细介绍了其如何利用 KV 缓存量化、权重压缩和完整性校验来大规模服务 Kimi 和 GLM 模型,以降低 GPU 内存占用并提升速度与安全性。 这很重要,因为服务大型前沿模型受限于 GPU 内存,而这些优化能降低推理成本、提升速度并增强安全性。它展示了可广泛适用于 AI 基础设施生态系统的实用系统工程技巧。 该博客聚焦三项具体技术:对 KV 缓存进行量化以降低生成期间的内存占用、压缩模型权重以减小内存体积,以及添加完整性校验以检测篡改或错误。所提供的摘要中未提及具体数值结果,但这些技术针对的是大规模场景下的成本与安全挑战。

rss · The Cloudflare Blog · Aug 3, 13:00

背景: 大语言模型逐个生成 token,KV 缓存存储中间的关键张量(key/value)以避免重复计算,但该缓存会随序列长度增长并大量占用 GPU 内存。量化降低了这些值和模型权重的数值精度,从而以一定质量代价换取大量内存节省。机器学习服务中的完整性校验用于验证模型工件和推理输出未被篡改,这对于建立对 AI 系统的信任至关重要。

参考链接

标签: #model-serving, #quantization, #GPU-memory, #AI-infrastructure, #Cloudflare


Cloudflare Workers RPC 现可跨越 Python 与 JavaScript 调用
Cloudflare Workers RPC Now Bridges Python and JavaScript
⭐️ 8.0/10

Cloudflare 宣布 Workers RPC 现已支持在 Python 和 JavaScript Worker 之间进行跨语言方法调用。在运行时,这些 Worker 可以直接交换活动对象引用并调用其方法,而无需定义 API、schema 或序列化代码。 这消除了在多语言 Serverless 开发中的一大障碍,因为不再需要 API 定义、schema 和序列化样板代码。开发者现在可以自由混用 Python 和 JavaScript Worker,从而简化多服务架构并提升 Cloudflare 生态系统中的互操作性。 该功能构建在 Cloudflare 现有的 Workers RPC 系统之上,该系统最初是为 JavaScript Worker 和 Durable Objects 设计的,旨在让调用体验接近本地 JavaScript 函数调用。根据文档,RPC 调用通常需要在同一 Cloudflare 账户下的 Worker 之间声明绑定。

rss · The Cloudflare Blog · Aug 3, 13:00

背景: Cloudflare Workers 是一个在边缘运行 JavaScript 和 Python 代码的 Serverless 平台。Workers RPC 是一种运行时 API,允许一个 Worker 通过 service binding 调用另一个 Worker 或 Durable Object 上的公开方法。此前,跨语言通信通常需要显式的 API 定义、schema 和序列化逻辑。本次更新将现有 RPC 系统扩展为可跨 Python 和 JavaScript 工作,从而消除了这些额外负担。

参考链接

标签: #RPC, #Cloudflare Workers, #Python, #JavaScript, #Serverless


Databricks 将 Variant 数据类型正式全面可用
Databricks Makes Variant Data Type Generally Available
⭐️ 8.0/10

Databricks 宣布 Variant 数据类型正式全面可用,这是一种新的数据类型,用于更快速、更高效地摄取如 JSON 和 XML 等半结构化数据。该公告通过公司博客发布。 这意义重大,因为半结构化数据摄取传统上缓慢且资源密集,而 Variant 提供了一种原生解决方案,简化了解析并提高了性能。它将使在大型数据湖仓环境中工作的数据工程师受益。 根据 Databricks 文档,Variant 类型在 Databricks Runtime 15.3 及以上版本中得到支持。它可以与 Auto Loader、COPY INTO 和 Kafka 流式摄取一起使用,也可用于创建表和插入记录的 SQL 命令中。

rss · Databricks · Aug 3, 13:44

背景: 像 JSON 和 XML 这样的半结构化数据非常普遍,但处理它们通常需要复杂的模式推断和转换。数据湖仓架构结合了数据湖的灵活性和数据仓库的性能,而原生 Variant 类型通过提供高效的存储和查询能力帮助弥合了这一差距。这符合现代云数据平台简化数据摄取的大趋势。

参考链接

标签: #data engineering, #semi-structured data, #Databricks, #big data, #data lakehouse


Kimi K3 开源权重如何冲击 Anthropic 估值:专家深度解析
How Kimi K3's Open Weights Could Pressure Anthropic's Valuation
⭐️ 8.0/10

《晚点 LatePost》播客第 177 期邀请 RadixArk/SGLang 创始成员赵晨阳与华盛顿大学博士生曾致远,从推理与算法角度拆解月之暗面的 Kimi K3,涵盖 KDA 注意力架构、3T 开放权重、6.3 倍解码加速以及对 Anthropic 等闭源实验室的商业影响。节目指出,K3 只开源权重而未开源训练“流水线”,重新点燃了开源与开放权重之争。 Kimi K3 表明开源权重的前沿模型已能接近甚至对标闭源模型,直接挑战了 Anthropic 等公司依赖专有优势的估值逻辑。它同时迫使行业重新厘清 AI 领域“开源”的真实含义,这对可复现性、安全研究和开发者信任都有深远影响。 节目详细讨论了 K3 的混合注意力设计:KDA 与 MLA 结合,线性注意力与全局注意力并行;Quantile Balancing 让近千个专家保持负载均衡;Per-head Muon 优化器保障大规模训练稳定性;MoPD 后训练方案以及 on-policy 与 off-policy 蒸馏的区别。基础设施层面还涉及 Flash KDA、QAT、投机采样回退机制,以及 SGLang 等推理框架的前缀复用对实际部署成本和延迟的影响。

rss · 晚点聊 LateTalk · Aug 3, 22:45

背景: 像 K3 这样的开放权重模型会发布训练好的参数,但不会发布完整训练数据、代码和“流水线”,而这正是开放源代码促进会(OSI)对真正开源 AI 的要求。标准 Transformer 注意力随序列长度呈平方级增长,线性注意力变体旨在让超长上下文推理更便宜、更快。SGLang 是一个广泛使用的开源推理引擎,通过 RadixAttention 前缀缓存高效服务开源模型。

参考链接

标签: #Kimi K3, #open-source AI, #LLM analysis, #AI industry, #podcast


开源 Winnow 用 Claude 模型漏斗约 25 美元筛完 2.5 万张照片
Open-Source Winnow Culls 25k Photos with Claude Model Funnel for $25
⭐️ 8.0/10

开发者开源了 Winnow——一个面向 Immich 的 AI 照片筛选工具,它使用 Claude 三模型漏斗(Haiku 4.5 负责初筛、Sonnet 负责排序、Opus 负责终审),通过 Batch API 以约 25 美元处理了 2.5 万张照片。该项目以 MIT 许可证发布,并提供 Docker 镜像。 这展示了一种通过跨模型分层路由来大幅降低 AI 流水线成本的实用模式,将原本在 Mechanical Turk 上需花费 150–200 美元的任务压缩到约 25 美元。它还提供了一个可复用的开源参考,用于构建结合结构化输出和 Bradley-Terry 评分的筛选与排序流水线。 该漏斗采用最佳—最差缩放(Best-Worst Scaling):Sonnet 每次对 8 张照片选出最好和最差,每个回答可产生约 13 个两两比较用于 Bradley-Terry 拟合。Opus 终审会交换顺序判两次,不一致视为平局;Batch API 提供 5 折优惠,但结果需要数小时才能返回。

rss · r/ClaudeAI · Aug 3, 15:52

背景: 照片筛选(photo culling)是指在大规模照片库中剔除废片、挑出保留之作的任务。Immich 是一个流行的开源、自托管 Google Photos 替代品。Bradley-Terry 模型是一种经典统计方法,可从两两比较中估计物品的强度;最佳—最差缩放则要求从一组选项中选出最好和最差,以高效收集排序信息。Claude 的模型分层(Haiku、Sonnet、Opus)提供不同的价格/性能取舍,其中 Haiku 最便宜、最快,Opus 能力最强。

参考链接

标签: #AI, #Claude, #Self-hosted, #Photo culling, #Cost optimization


《纽约客》:中国在美方退却之际竞逐未来产业
New Yorker: China races to own future industries amid U.S. retreat
⭐️ 8.0/10

《纽约客》记者 Evan Osnos 的文章报道,中国在美国政策失误的助推下,正加速抢占未来产业高地,并可能在癌症疗法等突破上超越美国。 这篇文章指出,随着美国退却,中国的国家投资和产业政策正收获回报,可能不可逆转地改变人工智能、生物技术和机器人领域的权力平衡。 文章援引数据称,中国生产全球 70%的无人机、电动汽车、锂离子电池和太阳能电池,部署的工业机器人数量超过世界其他地区的总和,造船能力是美国的 200 倍。文章还描述了北京一场 AI 博览会上通过测量面部微表情来评估情绪的监控技术。

rss · Axios · Aug 3, 10:03

背景: 在特朗普时期贸易、移民和预算政策的背景下,中美在未来产业上的竞争日益激烈,中国凭借数十年的国家投资、产业政策和外交规划不断推进。Evan Osnos 曾在京居住八年,他此次重回中国报道其技术进步如何重塑国内社会与全球地位。

标签: #China, #industrial policy, #biotech, #US-China competition, #future industries


中国 MiniMax H3 成为首个登顶 AI 视频排名的开放权重模型
China's MiniMax H3 Becomes First Open-Weights Model to Top AI Video Ranking
⭐️ 8.0/10

MiniMax 发布了其 H3 视频生成模型的权重,使其成为首个登顶 AI 视频生成排名的开放权重模型。该模型支持文生视频和图生视频工作流。 这一里程碑表明,开放权重模型能够与专有模型在 AI 视频生成领域竞争甚至超越它们。它降低了研究人员和初创企业获取高质量视频生成技术的门槛。 H3 是一个多模态模型,将文本、图像、视频和音频整合到同一创作语境中,支持生成与编辑。据称它可以创建带音频的 2K 视频,显示出强大的生产级能力。

rss · The Decoder · Aug 3, 13:52

背景: 开放权重模型允许用户下载、检查和修改模型,从而促进透明度和创新。MiniMax 是一家以 Hailuo 视频生成器闻名的中国 AI 公司,其 H3 模型代表着在普及最先进视频生成技术方面的一大进步。

参考链接

标签: #AI video, #open model, #MiniMax, #video generation, #ranking


Qwen 3.8 Max:阿里巴巴百万级上下文旗舰大模型
Qwen 3.8 Max: Alibaba's Flagship LLM with 1M-Token Context
⭐️ 8.0/10

阿里巴巴发布了新款旗舰大语言模型 Qwen 3.8 Max,采用混合专家架构,总参数量达 2.4T、激活参数为 95B,支持百万级 token 上下文窗口和多模态输入。该模型定价为每百万输入 token 2 美元、每百万输出 token 6 美元,但独立基准验证仍待进行。 此次发布标志着阿里巴巴在前沿大模型竞赛中的强力推进,以有竞争力的价格提供超长上下文多模态模型。这可能对 DeepSeek、Kimi 等竞争对手形成压力,并为开发者提供更经济的超长上下文智能体与多模态工作负载方案。 该模型总参数量 2.4T、激活参数仅 95B,表明其采用稀疏混合专家架构以提升推理效率。百万 token 上下文和多模态输入是已确认的规格,但该指南强调,Qwen 在基准测试上的性能声明仍有待独立验证。

rss · Kingy AI · Aug 3, 02:54

背景: 混合专家(MoE)是一种机器学习技术,通过门控网络为每个输入激活部分专家子模型,从而使超大模型比稠密模型保持更低的推理成本。上下文窗口是大语言模型一次能处理的最大文本量,涵盖提示词、对话历史和生成输出。多模态模型能够同时处理文本、图像和视频等多种模态的信息。

参考链接

标签: #AI, #LLM, #Qwen, #Alibaba, #Benchmarks


DNA 设备漏洞威胁美国 30 年犯罪证据完整性
DNA Analysis Equipment Flaw Exposes 30 Years of Crime Evidence to Tampering
⭐️ 8.0/10

研究人员发现,美国大多数犯罪实验室使用的 DNA 分析设备存在安全漏洞,并利用 Anthropic 的 Claude 生成的 AI 代码,在约 45 分钟内篡改了 DNA 扫描数据且未触发警报。Thermo Fisher Scientific 已于 7 月私下承认该漏洞,上周五发布高危安全公告,并推出加入数字签名的软件更新。 该漏洞危及约 30 年来用于刑事侦查和起诉的 DNA 证据的完整性,可能影响在审及已结案件。由于全美 200 多家实验室缺乏统一监管,这一事件凸显了法医学与网络安全交叉领域的系统性风险。 研究人员修改文件的方式未触发常用分析软件的警报,首次成功修改耗时约 45 分钟。Thermo Fisher 正与美国网络安全和基础设施安全局(CISA)合作,目前尚无该漏洞被实际利用的报告。

telegram · zaihuapd · Aug 3, 05:15

背景: 法医 DNA 分型通常依赖短串联重复序列(STR)分析,即检查特定位置的重复 DNA 序列,并生成电泳图谱(electropherogram)——一种显示 DNA 片段峰值的图形,供分析人员和软件生成 DNA 图谱。由于这些图谱以数字文件形式存储,仪器或软件的漏洞可能让攻击者篡改证据。Thermo Fisher Scientific 是全球犯罪实验室使用的 DNA 测序和法医分析仪器的主要供应商。

参考链接

标签: #cybersecurity, #DNA forensics, #vulnerability, #AI, #law enforcement


美媒调查:至少 50 名警员滥用牌照摄像头窥探前任
WaPo Probe Finds 50+ US Police Abused License Plate Cameras to Spy on Exes
⭐️ 8.0/10

《华盛顿邮报》2026 年 8 月 2 日发布的调查发现,美国至少有 50 名执法人员因滥用自动车牌识别系统(包括 Flock 摄像头)进行私人监控而受到指控或起诉。其中 26 起案件涉及警员窥探妻子、女友、前任或心仪女性,46 起案件使用了 Flock 系统。 这些发现凸显了广泛部署的监控技术可能被用于个人滥用,引发了有关监督和隐私保护的紧迫问题。仅 Flock 一家就运营超过 12 万台摄像头,每月记录 200 亿次车牌扫描,法规未能防止滥用的事件影响到了全美的公民自由。 调查引用了佐治亚州警察局长 Michael Steffman 的案例,他涉嫌约 600 次搜索前女友 Bakely 及其女儿的车牌;他于 2025 年 11 月被捕,并在 2026 年 4 月开庭前自杀身亡。Flock 表示其可选的“审计辅助”功能可以标记可疑搜索,但批评者指出,目前只有 13 个州要求审计,至少 8 个州将此类滥用定为犯罪。

telegram · zaihuapd · Aug 3, 09:03

背景: 自动车牌识别系统(ALPR)是由人工智能驱动的摄像头,能够拍摄并分析过往车辆图像,存储位置、日期和时间数据。Flock Safety 是此类系统的主要私营供应商,拥有超过 12 万台摄像头,覆盖 6000 多个社区;其不断扩大的部署和额外的监控功能早已引发争议。该公司于 2026 年 4 月推出了“审计辅助”功能,用于标记可疑搜索,佐治亚州的一些警员也已在一场相关丑闻中被解雇并受到指控。

参考链接

标签: #privacy, #surveillance, #law enforcement, #license plate readers, #civil liberties


英国再次要求苹果为加密云备份开后门
UK renews demand for Apple backdoor into encrypted cloud backups
⭐️ 8.0/10

9 月初,英国内政部向苹果公司发出新的技术能力通知,要求其为加密云备份创建后门,但这次仅针对英国公民的数据。这重启了此前 1 月份提出、曾引发外交紧张的全球访问要求。 这一要求威胁到端到端加密的完整性,可能为其他政府要求后门开危险先例。如果苹果妥协,可能削弱全球用户的安全;而若拒绝,则可能进一步加剧美英在隐私与安全政策上的紧张关系。 新通知比 1 月份的范围更窄,仅针对英国公民的数据,而非所有用户。苹果在 2 月份已选择从英国撤回 iCloud 高级数据保护功能,而不是削弱其安全架构;隐私活动人士警告称,任何被迫削弱安全的尝试都可能危及全球用户的私人信息。

telegram · zaihuapd · Aug 3, 15:40

背景: 端到端加密确保只有用户自己持有访问数据的密钥,因此苹果本身也无法解密存储在 iCloud 中的内容。iCloud 高级数据保护功能将这种加密扩展到大多数 iCloud 数据,包括备份、照片和备忘录。英国根据《调查权力法》签发的技术能力通知,在法律上强制要求企业提供对加密数据的访问权限。苹果此前从英国撤回该功能,正是为了应对这类要求,而不是故意制造安全漏洞。

参考链接

标签: #Apple, #Security, #UK Government, #Privacy, #Backdoor



📊 运行统计 · 总耗时 21m 50s · AI 分析 4m 43s · Tokens 1.00 MCY (输入 0.60 / 输出 0.41 MCY)