微软解散 id Software 的 idTech 团队,引发开源呼声
Microsoft dissolves idTech team at id Software, sparking open-source calls ⭐️ 9.0/10
据报道,微软解雇了 id Software 整个 idTech 引擎团队,该团队负责开发了 id Tech 5、6、7 以及即将推出的 id Tech 8 等标志性游戏引擎。 此举可能标志着微软游戏开发战略的重大转变,可能放弃自有引擎开发,转而采用如 Unreal Engine 5 等授权引擎。这也引发了对技术专长流失以及 id Software 独特游戏引擎传统未来的担忧。 id Tech 引擎历史上一直是专有的,只有早期版本(直到 id Tech 4)以 GPL 协议开源。被解雇的团队负责开发了《毁灭战士:永恒》中使用的尖端 id Tech 7 以及即将推出的 id Tech 8。
hackernews · bauc · Jul 7, 15:33 · 社区讨论
背景: id Software 是一家著名的游戏开发商,以开创第一人称射击游戏和开发 id Tech 引擎系列而闻名。像 id Tech 这样的游戏引擎提供了渲染、物理和工具等核心技术,使游戏创作成为可能。许多 id Tech 引擎过去曾开源,但最近版本仍为专有。
社区讨论: 社区普遍对微软的决定持批评态度,许多评论者认为该公司为了短期成本节约而牺牲了技术专长。强烈呼吁微软应开源 id Tech 引擎以保护它,类似于 John Carmack 开源 Quake 3 引擎的做法。一些人认为这是一个企业失误,将垄断拱手让给了 Epic Games。
标签: #Microsoft, #idSoftware, #idTech, #game engines, #open source
Anthropic 发现 Claude 内部类似意识的“J-space”
Anthropic discovers 'J-space' in Claude resembling conscious thought ⭐️ 9.0/10
Anthropic 的研究人员在 Claude 语言模型内部发现了一个名为 J-space 的区域,它像一个内部工作空间,用于类似有意识的推理,并且是自发进化出来的,并非最初设计的一部分。 这是人工智能可解释性的突破,表明大语言模型可以发展出类似于人类意识处理的内部结构,使研究人员能够读取隐藏的推理并检测不诚实行为,这对 AI 安全和透明度具有深远影响。 J-space 占 Claude 总神经活动的不到 10%,一次只包含几十个概念;删除它会严重损害多步推理、总结和押韵能力。J-lens 技术允许编辑 J-space 中的向量来改变 Claude 的回答。
rss · 小互(@imxiaohu) · Jul 7, 03:41
背景: 神经科学中的全局工作空间理论认为,当信息进入一个能够向整个大脑广播的特殊工作空间时,它才变得有意识。Anthropic 基于雅可比矩阵的 J-lens 技术识别出 Claude 中即将影响输出的神经活动模式,类似于这个工作空间。该技术能够非侵入性地检查模型在输出语言之前的内在推理过程。
参考链接
标签: #Anthropic, #Claude, #AI Interpretability, #Consciousness, #Neural Networks
Lilian Weng:递归自我改进始于系统工程而非模型权重
Lilian Weng: RSI Begins with Harness Engineering, Not Model Weights ⭐️ 9.0/10
Lilian Weng 发表博客文章提出,AI 的递归式自我改进(RSI)短期内不会来自模型重写自身权重,而会来自改进“harness 系统”——即编排模型如何与工具、记忆和上下文交互的代码与基础设施。她概述了从提示工程到利用进化搜索和编码代理的元 harness 优化的演进路径。 这一观点将 AI 界的注意力重新聚焦到系统级工程上,而非仅关注模型权重的扩展,可能加速编码代理和自主系统中的实用 RSI。它还提供了一个结构化的框架,研究人员和工程师可直接用于构建自我改进的 AI 工具。 Weng 总结了三种核心 harness 设计模式:工作流自动化、文件系统作为持久记忆、以及子代理并行。她还介绍了从上下文工程到元 harness 的优化层次,并提供了实验结果,如 DGM 将 SWE-bench Verified 上的成绩从 20% 提升到 50%。
rss · meng shao(@shao__meng) · Jul 7, 06:49
背景: 递归式自我改进(RSI)是指 AI 系统自我提升能力的过程,可能引发智能爆炸。Harness engineering 指围绕基座模型设计的软件基础设施,包括工具使用、记忆和规划。最近的编码代理如 Claude Code 和 Codex 已证明 harness 与模型本身同等重要。
标签: #AI, #RSI, #Harness Engineering, #Lilian Weng, #Agent Systems
xAI SGLang 负责人详解 10 万 GPU 部署 Grok
xAI SGLang Lead Details Grok Deployment on 100k GPUs ⭐️ 9.0/10
在一段 23 分钟的讲解中,xAI 的 SGLang 负责人详细说明了他们如何在 10 万张 GPU 上部署 Grok,采用了拆分 Prefill 和 Decode 阶段、将 MoE 专家分片到不同 GPU、按专家路由 Token 以及将通信与计算重叠执行等技术。 这一部署表明,大规模的 MoE 模型可以高效服务,且成本足以与 DeepSeek API 等商业 API 竞争,这对 AI 基础设施和定价产生了重大影响。 该方法包括专家并行,每个 GPU 持有部分专家,以及将 Prefill(计算密集型)和 Decode(内存密集型)分离到不同硬件上以优化资源使用。
rss · AI Will(@FinanceYF5) · Jul 7, 07:04
背景: SGLang 是一个开源的高性能大语言模型和多模态模型服务框架。像 Grok 这样的大规模 MoE 模型需要复杂的并行策略——例如专家分片和 Prefill-Decode 分离——才能在数千张 GPU 上实现低延迟和高吞吐量。
参考链接
标签: #large-scale deployment, #MoE, #Grok, #xAI, #GPU
NVIDIA 联合结构搜索使 MoE 模型推理吞吐量翻倍
NVIDIA's Joint Structural Search Doubles MoE Inference Throughput ⭐️ 9.0/10
NVIDIA 提出了一种联合结构搜索方法,将混合 MoE 模型 Nemotron-3-Super 压缩为 Puzzle-75B-A9B,在保持质量的同时将交互式服务器吞吐量大约翻倍。 这一突破解决了以交互式延迟服务大型 MoE 模型的关键实际问题,使得在 B200 和 H100 等硬件上以更低成本部署并保持完整的智能体能力成为可能。 联合结构搜索在迭代流程中同时优化异构 MoE 剪枝、活跃参数预算和 Mamba 剪枝,该流程还包括蒸馏、强化学习、量化和多 token 预测头。
rss · elvis(@omarsar0) · Jul 7, 17:20
背景: 混合专家 (MoE) 模型使用多个专用子网络(专家)来实现每个活跃参数更高的质量,但由于其总参数数量庞大,以低延迟服务它们的成本仍然很高。剪枝和量化是常见的压缩技术,但通常独立应用。联合结构搜索旨在协同优化这些决策以获得更好的端到端结果。多 token 预测是一种同时预测多个未来 token 的训练目标,可提高样本效率。
标签: #NVIDIA, #MoE, #model compression, #inference optimization, #paper
Muse 图像在强化学习训练中展现出涌现式自我改进
Muse Image Shows Emergent Self-Refinement During RL Training ⭐️ 9.0/10
Meta 的 Muse 图像模型在强化学习训练过程中,在其思维链内展现出涌现式自我改进行为,能够自适应地执行局部编辑、完全重新生成或使用工具以优化图像质量。 这一突破表明,类似自我改进的复杂目标导向行为可以从强化学习训练中自然涌现,而无需显式编程,这可能改变 AI 图像生成模型的开发范式并提升输出质量。 Muse 图像作为一个智能体运行,而非直接的提示到图像模型,能够调用工具并改进输出。它与 Muse Spark 配对用于协作媒体生成,并受益于按比例增加的测试时计算。
rss · AI at Meta(@AIatMeta) · Jul 7, 20:14
背景: 传统的图像生成模型(如 Stable Diffusion)直接从文本提示生成图像,不进行迭代改进。强化学习训练模型以最大化奖励,但像自我改进这样的涌现行为通常并不常见。Meta 的 Muse 图像由 Meta 超级智能实验室开发,是该公司于 2026 年 7 月发布的首个图像生成模型。
参考链接
标签: #AI, #Machine Learning, #Image Generation, #Reinforcement Learning, #Emergent Behavior
NVIDIA 的 MOTIVE 改善视频动态训练
NVIDIA's MOTIVE improves video motion training ⭐️ 9.0/10
NVIDIA Research 提出 MOTIVE,一种运动归因框架,它将训练信号重新加权到运动区域,并根据每个片段对运动的影响进行评分,从而可以筛选出高影响力子集进行微调。该方法在 ICML 2026 上获得杰出论文荣誉提名。 MOTIVE 解决了视频模型训练中的一个关键低效问题:静态背景主导学习信号,浪费计算资源并限制时间动态。通过聚焦运动相关片段,它提升了 VBench 动态指标,并相比基础模型获得了 74.1%的人类偏好,推动了视频生成质量的发展。 MOTIVE 通过运动感知掩码计算梯度来归因运动影响,然后选择高影响力片段进行微调。它优于随机数据选择,并允许使用更少的片段进行训练,同时提升运动质量。
rss · NVIDIA AI(@NVIDIAAI) · Jul 7, 19:28
背景: 视频生成模型通常在大规模数据集上训练,其中许多片段包含静态背景,运动很少。标准训练对所有像素一视同仁,因此模型容量可能浪费在不相关的区域上。VBench 是一个评估视频生成质量(包括运动动态等维度)的基准。MOTIVE 引入了一种系统性的方法来优先选择运动丰富的训练数据。
参考链接
标签: #NVIDIA, #Research, #Video Motion, #ICML, #Training
Robbyant 开源 LingBot-Depth 2.0 与 LingBot-Vision
Robbyant Open-Sources LingBot-Depth 2.0 and LingBot-Vision ⭐️ 9.0/10
Robbyant 开源了 LingBot-Depth 2.0 与 LingBot-Vision,使用 1.5 亿数据训练,并首创边界结构预训练范式,在深度补全 16 项测评中取得了 12 项第一。 这一里程碑以亚像素级空间感知能力提升了机器人视觉水平,对具身智能和自主系统至关重要。开源发布降低了机器人学与计算机视觉领域的研究和部署门槛。 这两个模型基于 1.5 亿数据训练,并采用了创新的边界结构预训练方法。LingBot-Vision 充当密集空间感知骨干网络,而 LingBot-Depth 2.0 专注于深度补全任务。
rss · 魔搭ModelScope社区 · Jul 7, 09:50
背景: 深度补全是一项计算机视觉任务,旨在从稀疏的深度测量点(如 LiDAR)和对应的 RGB 图像中重建稠密的深度图。边界结构预训练是一种在预训练过程中注重保留物体边缘的新技术。亚像素级感知是指精度高于单个像素,从而实现更精确的空间理解。
参考链接
- alexklwong/awesome-state-of-depth-completion - GitHub
- [2304.13030] CompletionFormer: Depth Completion with ... Any to Full: Prompting Depth Anything for Depth Completion in ... DeepSmooth: Efficient and Smooth Depth Completion Zero-Shot Depth Completion with Vision Language Model GitHub - ant-research/DepthLab: Official implementation of ... TIP 2025 | 大连理工等提出PSD:巧借“深度基础模型”,终结分布外(OOD...
- [2605.14566] SpectraFlow: Unifying Structural Pretraining and ...
标签: #机器人视觉, #深度补全, #开源, #具身智能, #预训练
Node.js 26 发布:默认启用 Temporal API、V8 14.6
Node.js 26 Released with Temporal API, V8 14.6 ⭐️ 9.0/10
Node.js 26 已发布,默认启用 Temporal API,将 V8 引擎更新至 14.6 版本,并将 Undici HTTP 客户端升级至 8.0。还废弃了多个遗留 API。 此次发布标志着 Node.js 生态系统的重大进步,为开发者提供了无需配置即可使用的现代化日期/时间 API(Temporal),并通过最新的 V8 引擎和 Undici 客户端提升了性能和安全性。废弃的 API 表明旧版 API 正在被清理,鼓励迁移到新标准。 开发者需要注意 NODE_MODULE_VERSION 的变化,这可能需要重新编译原生模块。Temporal API 现在默认启用,取代了旧的 Date 对象进行日期/时间处理。Node.js 26 将在六个月内保持当前状态,然后进入长期支持(LTS)。
rss · InfoQ · Jul 7, 06:51
背景: Temporal API 是 JavaScript Date 对象的现代替代方案,提供了对时区、日历和日期/时间运算的更好支持。Undici 是为 Node.js 从头编写的高性能 HTTP/1.1 客户端,速度更快且更稳定。NODE_MODULE_VERSION 是 Node.js 原生插件的版本标识符,其变化可能导致预编译原生模块的兼容性问题。
参考链接
标签: #Node.js, #JavaScript, #Web Development, #Temporal API, #V8
Anthropic 的 Claude Fable 5:最重要的 AI 模型发布
Anthropic's Claude Fable 5: Most Significant AI Model Launch ⭐️ 9.0/10
Latent Space 发布了《Fable 实地指南》,称 Anthropic 的 Claude Fable 5 是迄今为止最重要的模型发布。 Claude Fable 5 在视觉和长期自主任务上达到了新的水平,可能改变开发者处理复杂编码和自动化工作流的方式。 Claude Fable 5 能从科学图表中提取精确数字,通过截图重建 Web 应用源代码,并能为大型编码项目自行编写测试。
rss · Latent.Space · Jul 7, 04:44
背景: Anthropic 于 2026 年 6 月 9 日发布了 Claude Fable 5,这是其在视觉和长期自主任务方面能力最强的模型。它属于 Claude 模型系列,与 Mythos 5 并列,后者具有相同能力但仅限于 Project Glasswing。此次发布延续了 Anthropic 对安全性和高级推理的专注。
参考链接
标签: #AI新闻, #模型发布, #Fable, #AI前沿, #重要发布
中国五年 2 万亿元建设全国算力网络
China Plans $295B National Computing Network Over 5 Years ⭐️ 9.0/10
中国宣布计划未来五年投入 2 万亿元(2950 亿美元),建设全国互联数据中心网络,由国有电信企业运营主要设施,并优先采用华为等本土供应商的 AI 芯片,减少对英伟达、AMD 等美企的依赖。 这项计划旨在减少对美国芯片制造商的依赖,并通过整合算力资源加速中国各行业的 AI 发展,可能从根本上重塑全球 AI 硬件市场和云计算格局。 该计划是北京“六网”基础设施战略的关键一环,中国电信、联通等运营商已推出 Token 套餐,将算力像移动数据一样打包销售,让企业和公众更易获得 AI 算力。
telegram · zaihuapd · Jul 7, 04:45
背景: 中国一直在推动“东数西算”工程以平衡区域算力资源。全国算力网是将通用计算、智能计算、超级计算等异构算力资源互联的数字基础设施。该计划将其提升为“十五五”规划国家级基础设施优先事项,旨在解决算力供需错配和成本高企问题。
标签: #infrastructure, #AI, #computing, #geopolitics, #cloud computing
KVM Januscape 漏洞实现虚拟机逃逸,潜伏 16 年
KVM Januscape Vulnerability Enables VM Escape After 16 Years ⭐️ 9.0/10
安全研究人员公开了 Januscape 漏洞(CVE-2026-53359),这是首个同时在 Intel 和 AMD 平台上生效的 KVM/x86 虚拟机逃逸漏洞。该漏洞是 shadow MMU 代码中的 use-after-free 缺陷,允许客户机破坏宿主机内核内存。 该漏洞对云服务提供商和多租户环境至关重要,恶意虚拟机可突破虚拟化隔离,访问宿主机乃至其他虚拟机。该缺陷已存在 16 年,影响大范围 Linux 内核,亟需广泛修补。 该漏洞存在于 shadow 页表处理函数 kvm_mmu_get_child_sp()中,该函数在 Intel VMX 和 AMD SVM 间共享。概念验证代码已发布,可触发宿主机内核 panic;在 RHEL 等发行版中,本地普通用户还可利用该缺陷提权至 root。
telegram · zaihuapd · Jul 7, 10:14
背景: KVM(基于内核的虚拟机)是 Linux 内核模块,使内核能够充当虚拟机监控器。Shadow MMU(内存管理单元)用于 KVM 的内存虚拟化,特别是在不使用或不支持硬件辅助虚拟化(EPT/NPT)时。use-after-free 漏洞指程序在内存被释放后仍继续使用该内存指针,可能导致任意代码执行。
参考链接
标签: #KVM, #vulnerability, #VM escape, #Linux kernel, #cloud security
使用 Kokoro 实现本地、CPU 友好的高质量文本转语音
Local CPU-Friendly High-Quality TTS with Kokoro ⭐️ 8.0/10
Kokoro 是一个拥有 8200 万个参数的开源 TTS 模型,无需 GPU 即可在 CPU 上直接进行高质量语音合成,并支持自定义 IPA 发音以提高准确性。 这使得没有昂贵 GPU 的用户也能使用高质量的 TTS,对辅助工具、内容创作和自动化流程更加友好。其 IPA 自定义功能解决了 TTS 中常见的同形异义词歧义问题。 Kokoro-82M 通过 mlx-audio 在苹果芯片上高效运行,也支持其他 CPU,并可通过 GitHub 上的 CLI 工具使用。它在长文本方面表现出色,但在单个单词发音上可能不够准确。
hackernews · speckx · Jul 7, 18:24 · 社区讨论
背景: 文本转语音(TTS)系统将书面文字转换为语音音频。许多高质量的 TTS 模型需要强大的 GPU,限制了可访问性。国际音标(IPA)提供了标准化的发音符号,允许用户纠正误读。Kokoro 利用 IPA 输入实现精确控制。
社区讨论: 用户称赞 Kokoro 的 CPU 效率和 IPA 支持,有人将其集成到无障碍产品中,还有人构建了将链接转换为播客的流水线。但也有人指出它对非常短的短语表现不佳,部分人希望增加分离语音和说话人识别等功能。
标签: #TTS, #Kokoro, #CPU, #Open Source, #Accessibility
欧盟聊天控制 1.0 与 2.0:隐私与儿童保护的较量
EU's Chat Control 1.0 & 2.0: Privacy vs. Child Protection ⭐️ 8.0/10
这些提案威胁端到端加密和大规模监控,可能损害所有欧盟公民的数字隐私,并为全球强制消息扫描树立先例。 聊天控制 1.0 于 2023 年 4 月到期,欧盟理事会在 90 天内迅速恢复推动,尽管存在法律警告;而聊天控制 2.0 旨在进行更广泛的扫描,包括在设备端进行客户端扫描(client-side scanning)。
hackernews · gasull · Jul 7, 14:23 · 社区讨论
背景: 聊天控制(Chat Control)指欧盟立法提案,要求通信平台扫描消息以查找 CSAM。客户端扫描(CSS)技术在加密前于用户设备上分析内容,批评者认为这破坏了端到端加密并允许大规模监控。欧盟理事会自己的法律服务机构警告称,当前提案违反了《欧盟基本权利宪章》第 7 条(隐私权)。
参考链接
社区讨论: 评论者普遍持怀疑态度:有人指出这是'授予我独裁权力以便行善'的举动;另有人强调推动此提案的政府也未能谴责知名施虐者。技术层面关注扫描如何与加密消息兼容,并提及苹果的设备端 CSAM 扫描器。
标签: #privacy, #surveillance, #encryption, #EU legislation, #CSAM
欧盟要求所有新车配备驾驶员监控摄像头
EU mandates driver monitoring cameras in all new cars ⭐️ 8.0/10
欧盟已强制要求所有在欧盟销售的新车必须配备驾驶员监控摄像头系统,以检测并减少分心驾驶。该规定适用于所有新车型,要求内置摄像头跟踪驾驶员的注意力状态。 该规定为欧洲汽车安全技术树立了重要先例,有望减少因驾驶员注意力不集中导致的事故。同时,它也引发了关于增强安全与个人隐私之间权衡的讨论,以及驾驶辅助功能可用性的争议。 该强制规定适用于所有在欧盟销售的新车,要求驾驶员监控系统使用摄像头观察眼球运动、头部位置等分心迹象。具体技术标准、数据隐私保护措施以及在特定条件下关闭系统的能力,是决定实际影响的关键细节。
hackernews · nickslaughter02 · Jul 7, 20:50 · 社区讨论
背景: 驾驶员监控系统利用摄像头和传感器检测分心或疲劳迹象,通常发出警报或进行干预。欧盟这一强制规定是更广泛安全包的一部分,其中包括其他高级驾驶辅助系统,旨在减少道路死亡事故。该规定基于研究显示分心驾驶是事故主要原因之一。
社区讨论: 社区评论反应不一:一些用户认为自适应巡航控制、车道辅助等新车技术烦人或不可靠,而另一些用户则支持其安全益处,并引用个人体验称分心检测非常准确。也有担忧涉及隐私和摄像头数据可能被滥用,有评论将其与更广泛的监控相类比。
标签: #EU regulation, #driver monitoring, #car safety, #privacy, #automotive technology
德国技术人才为何离开
Why Skilled Workers Leave Germany ⭐️ 8.0/10
文章探讨了高技能移民初到德国后为何常常离开,原因包括融入困难、官僚障碍以及职业发展受限。 这很重要,因为德国面临劳动力短缺并依赖技术移民,但难以留住人才,对于考虑移居德国的软件工程师和其他专业人士来说是一个警示。 个人轶事指出,文化保守阻碍职业晋升、铁路和高速公路等基础设施恶化、医疗过载、官僚机构缓慢、经济危机和住房短缺是离开的原因。
hackernews · theanonymousone · Jul 7, 10:42 · 社区讨论
背景: 德国长期以来吸引技术人才以填补劳动力缺口,但融入过程受到语言障碍、复杂的官僚制度以及保守的社会文化的阻碍。与美国等国家不同,移民往往难以获得归属感或被完全接纳为社会成员。
社区讨论: 评论者分享个人经历:一位南美女性即使成为德国公民也无法认同自己是德国人,这与她获得美国公民身份时的感受形成对比。其他人强调了外国人在高层职位上难以获得信任,以及公共服务恶化。总体情绪是文化和官僚障碍根深蒂固。
标签: #immigration, #skilled workers, #Germany, #integration, #tech community
sqlite-utils 4.0 引入数据库模式迁移
sqlite-utils 4.0 introduces schema migrations ⭐️ 8.0/10
sqlite-utils 4.0 于 2026 年 7 月 7 日发布,新增了数据库模式迁移、通过 db.atomic() 实现的嵌套事务以及对复合外键的支持。 模式迁移是生产级数据库管理的关键特性,能够实现安全、版本控制的模式变更。这使得 sqlite-utils 成为 Python 开发者构建基于 SQLite 应用的更完整工具。 迁移通过 Python 文件定义,使用 sqlite-utils 库的 Migrations 类和 table.transform() 方法,该方法实现了 SQLite 推荐的“创建新表并复制”模式。此版本还包含升级指南中详述的破坏性变更。
rss · Simon Willison · Jul 7, 19:32
背景: sqlite-utils 是一个用于操作 SQLite 数据库的 Python 库和命令行工具。模式迁移是一种随时间对数据库模式应用和跟踪变更的机制,对于在无数据丢失的情况下演进应用需求至关重要。
标签: #sqlite, #python, #database, #migrations, #tools
LongCat-2.0:1.6 万亿 MoE 模型使用 AI ASIC 训练
LongCat-2.0: 1.6T MoE Model Trained on AI ASICs ⭐️ 8.0/10
LongCat-2.0 是一个 1.6 万亿参数的混合专家(MoE)模型,完全使用 AI 专用 ASIC 进行训练,标志着定制硬件在大规模 AI 训练中的一个里程碑。 这表明 AI ASIC 可以扩展到训练极大的模型,可能减少对 GPU 的依赖,并降低前沿 AI 研究的成本。 该模型采用混合专家架构,参数量达 1.6 万亿,但目前尚未发布具体的性能基准或评估结果。
rss · Product Hunt - Daily Top · Jul 7, 06:27
背景: 混合专家(MoE)模型每次输入只激活部分参数,从而可以在与较小密集模型相似的计算成本下实现更大的模型规模。AI ASIC 是为 AI 工作负载设计的专用芯片,相比通用 GPU 具有潜在效率优势。仅用 ASIC 训练如此规模的模型是对定制芯片在 AI 领域可行性的概念验证。
标签: #AI, #Hardware, #MoE, #ASICs, #Training
如何在 Claude Fable 5 消失前蒸馏其大脑
How to Distill Claude Fable 5's Brain Before It Disappears ⭐️ 8.0/10
@EXM7777 发布了一个方法,通过可重做性测试和五个具体动作,在 Claude Fable 5 从订阅计划中消失前,将其判断力和思考方式提纯为可持久使用的资源。 这为 AI 用户提供了一种实用策略,当尖端模型不可用时仍能保留其独特价值,通过知识蒸馏和自动化工作流持续受益于其高级推理能力。 可重做性测试判断任务明天是否能用更便宜的模型完成;如果不能,则立即用 Fable 5 执行。五个动作包括:将 CLAUDE.md 重写为操作手册、进行顾问式审计、建立原子笔记的第二大脑、设置无人值守的目标驱动工作流,以及安装思维方式记录器。
rss · meng shao(@shao__meng) · Jul 7, 13:59
背景: 知识蒸馏是一种让较小模型模仿较大模型的技术,能以较低成本保留其能力。CLAUDE.md 是仓库中的配置文件,为 Claude 提供项目特定上下文,实现定制化行为。该帖引用了 Llama 时代的例子,用不到 500 美元从前沿模型中蒸馏出 5.2 万条答案。
参考链接
标签: #AI模型, #知识蒸馏, #持续价值, #实用技巧, #模型应用
Perplexity AI 与 NVIDIA 合作定制 Vera CPU 用于智能体运行时
Perplexity AI and NVIDIA Partner on Custom Vera CPUs for Agentic Runtime ⭐️ 8.0/10
Perplexity AI 宣布与 NVIDIA 合作,为其智能体运行时构建定制 Vera CPU,以改进支持 Perplexity Computer 的沙箱基础设施。 此次合作凸显了行业向针对智能体 AI 工作负载的专用硬件转变,有望显著提升顺序推理和工具使用任务的性能并降低延迟。 NVIDIA 的 Vera CPU 采用快速节能的 Olympus 核心和高带宽 LPDDR5X 内存,相比传统 CPU 基础设施,沙箱环境性能提升高达 80%。
rss · Aravind Srinivas(@AravSrinivas) · Jul 7, 22:18
背景: 智能体 AI 系统在 CPU 上顺序执行任务,每一步(推理、工具调用、代码执行)必须依次完成。CPU 性能缓慢会拖慢整个智能体循环并导致 GPU 利用率不足。NVIDIA Vera 是一款定制 CPU,旨在最大化大规模单线程性能,即使在全负载下也能保持智能体步骤快速执行。
标签: #agentic runtime, #NVIDIA, #Perplexity AI, #custom CPUs, #AI infrastructure
科技劳动力因 AI 分裂为两大阵营
Tech workforce splits over AI sentiment: empowered vs. threatened ⭐️ 8.0/10
2026 年的一项调查显示,科技劳动力已分化为两个群体:一半人感到被 AI 赋能,另一半则感到受威胁且不确定自身价值。一年内,显著倦怠率从 44.7%升至 55.7%,职业乐观度从 54.8%降至 48.7%。 这种两极分化对科技行业的人才保留、生产力和公司文化具有深远影响。理解这些动态对于领导者和政策制定者来说至关重要,以应对员工焦虑并利用 AI 潜力而不疏远员工。 调查发现,53%的科技工作者会建议新人避开自己从事的职业角色,即使他们本人对自身未来持乐观态度。最大的 AI 相关恐惧是被迫做更多工作,只有 22%的人担心失业。
rss · Lenny Rachitsky(@lennysan) · Jul 7, 15:45
背景: 科技行业正迅速采用 AI 工具,引发了对失业和工作量变化的担忧。一年前,同一项调查将员工描述为'精疲力竭但乐观'。2026 年的结果显示,员工情绪出现明显分歧,AI 成为影响职业前景的主导因素,其作用超过职位或资历。
标签: #AI impact, #tech workforce, #survey, #career trends
施耐德电气用 LangSmith 部署 60+AI 代理
Schneider Electric Deploys 60+ AI Agents with LangSmith ⭐️ 8.0/10
施耐德电气已在超过 100 个国家部署了 60 多个 AI 代理,全部通过自托管的 LangSmith 进行追踪,其 AI 助手为 16 万名员工提供服务。 这表明大型企业能够安全且可观测地在全球规模部署 AI 代理,为其他企业在 LLMOps 成熟度方面提供了参考。 该部署使用了自托管版本的 LangSmith 以实现完全可追溯性,仅 AI 助手就服务于 16 万名员工,表明日常使用量巨大。
rss · LangChain(@LangChainAI) · Jul 7, 19:00
背景: LangSmith 是由 LangChain 公司创建的 LLM 应用可观测性、评估和部署平台。LLMOps 指管理 LLM 全生命周期(包括监控和信任)的实践和工具。施耐德电气的案例体现了企业级 LLMOps。
标签: #AI agents, #LLMOps, #production deployment, #enterprise AI, #LangChain
维苏威挑战赛悬赏用 AI 读取古代卷轴
Vesuvius Challenge Offers Rewards for Reading Ancient Scrolls via AI ⭐️ 8.0/10
2023 年启动的维苏威挑战赛正悬赏数十万美元,奖励任何能用 AI 和 X 射线成像解读碳化的赫库兰尼姆卷轴的人。其中一个卷轴已被虚拟展开,揭示了超过一米长的斯多葛哲学文本。 成功可能解锁古代唯一完整存世图书馆中的数百份失传文本,有望重塑我们对希腊罗马哲学、文学和历史的认知。 这些卷轴在公元 79 年维苏威火山喷发中被碳化,无法物理展开而不碎裂。获胜方法利用同步加速器的高分辨率相位衬度 X 射线显微断层扫描和机器学习来检测墨水痕迹。
rss · The Rundown AI(@TheRundownAI) · Jul 7, 15:38
背景: 赫库兰尼姆纸莎草卷轴是 18 世纪在赫库兰尼姆的纸莎草别墅发现的 1800 多卷碳化卷轴。尝试物理展开会导致碎裂和文本丢失。计算机科学家 Brent Seales 开创了使用 3D X 射线扫描和 AI 的虚拟展开技术,维苏威挑战赛在此基础上扩大该技术的应用规模。
参考链接
标签: #AI, #Archaeology, #Machine Learning, #History, #Challenge
第三方服务商通过新技术栈将 DeepSeek 成本降至五分之一
Third-party serves DeepSeek at 1/5 cost via new tech stack ⭐️ 8.0/10
一家第三方服务商通过组合使用 SGLang、prefill-decode 解耦、专家并行和 AMD MI300 GPU,实现了仅 DeepSeek 官方 API 五分之一的推理成本。 这种显著的成本降低表明,创新的软硬件协同优化可以大幅降低 AI 推理费用,可能使小型组织和个人开发者更容易使用高性能模型。 该技术栈包括用于高效模型服务的 SGLang、分离 prefill 和 decode 以优化计算和内存密集型负载、针对混合专家模型(如 DeepSeek)的专家并行,以及采用 AMD MI300 加速器替代英伟达 GPU。
rss · AI Will(@FinanceYF5) · Jul 7, 07:04
背景: SGLang 是一个用于大模型高吞吐量服务的高性能开源框架。Prefill-decode 解耦将计算密集的 prefill 阶段和内存密集的 decode 阶段分离到不同设备。专家并行将混合专家模型中的专家分布到不同 GPU 以提高利用率。AMD MI300 是与英伟达产品竞争的高性能 AI GPU。
参考链接
标签: #DeepSeek, #AI inference, #cost optimization, #SGLang, #AMD MI300
Anthropic 与 Neuronpedia 发布开源权重模型交互演示
Anthropic & Neuronpedia Release Interactive Demo for Open-Weight Models ⭐️ 8.0/10
Anthropic 与 Neuronpedia 合作,为开源权重模型制作了交互式演示,用户可探索并调控模型内部机制,同时发布了关于 Transformer 电路的完整研究论文。 此次发布使机械可解释性更加普及,让更广泛的用户无需深厚专业知识即可理解和交互 AI 模型内部机制,弥合了前沿研究与实用工具之间的鸿沟。 该演示托管在 Neuronpedia 平台上,利用 Anthropic 的 Transformer 电路研究,为开源权重模型提供可视化和调控功能。随附的论文详细阐述了理论框架和实验结果。
rss · AI Will(@FinanceYF5) · Jul 7, 03:47
背景: 机械可解释性旨在逆向工程神经网络,以理解其内部计算。Anthropic 的 Transformer Circuits Thread 为此开发了数学框架,而 Neuronpedia 是一个用于探索和调控 AI 模型内部的开源平台。此次合作将他们的成果整合成一个易于使用的交互式演示。
标签: #anthropic, #neuronpedia, #interpretability, #transformer circuits, #open source
美国科技公司数据中心租赁承诺飙升至 8500 亿美元
US tech data center lease commitments surge to $850 billion ⭐️ 8.0/10
美国科技公司的数据中心租赁总承诺额达到 8500 亿美元,同比增长 204%,环比增长 31%。Meta 在一季度猛增 790 亿美元,总承诺额达到 1830 亿;甲骨文总承诺规模接近 2500 亿,主要用于兑现与 OpenAI 的合同。 这一巨额投资激增凸显了 AI 和云计算基础设施需求的急剧上升,对科技支出、能源消耗以及全球数据中心建设产生重大影响。 Meta 季度增量 790 亿美元,环比增长 76%。甲骨文的总承诺规模最大,部分由其与 OpenAI 的合同推动。
rss · AI Will(@FinanceYF5) · Jul 7, 02:10
背景: 数据中心租赁承诺是公司为预留数据中心容量而签署的长期合同,通常用于云服务和 AI 工作负载。随着 AI 模型规模不断扩大,对专用 GPU 集群和高带宽网络的需求激增,推动了这些创纪录的承诺。
标签: #data center, #AI infrastructure, #cloud computing, #Meta, #Oracle
无需训练的验证器:AI 扩展的新方向
Training-Free Verifier: New Scaling Axis for AI ⭐️ 8.0/10
斯坦福大学、英伟达和加州大学伯克利分校联合发表新论文,提出一种无需训练的验证器,通过读取评分令牌 logits 的连续校准分数来替代离散评分。该验证器在多个基准测试上取得高准确率,例如 Terminal-Bench V2 86.5%、SWE-Bench Verified 78.2%。 这项工作证实了验证是 AI 扩展的一个新维度,与预训练、后训练和测试时计算并列。无需训练的方法可在不微调的情况下实现可扩展的验证,有望加速 AI 代理可靠性和强化学习的进展。 该验证器通过三个调节旋钮——分数粒度、重复评估和标准分解——在无需微调的情况下提升准确率。它还可作为 SAC 和 GRPO 等强化学习算法的密集奖励信号,并通过 Claude Code 扩展作为任务进度信号。
rss · elvis(@omarsar0) · Jul 7, 18:10
背景: 在大语言模型中,验证器是评估模型输出正确性或安全性的系统。传统验证器需要单独训练或使用离散评分。本文提出一种无需训练的验证器,直接利用评分令牌的 logits 产生连续置信度分数,从而避免了对额外训练数据或微调的需求。
标签: #AI, #LLM, #verification, #scaling, #research
Google DeepMind 为托管智能体推出四项新功能
Google DeepMind Ships 4 New Managed Agent Capabilities ⭐️ 8.0/10
Google DeepMind 宣布为 Gemini API 中的托管智能体新增四项功能:长时后台执行、远程 MCP 服务器连接、自定义函数调用以及凭据刷新。这些功能使开发者能够异步运行智能体、连接私有端点、结合服务端与本地代码,并在不重置沙箱状态的情况下刷新 API 令牌。 这些功能将托管智能体从交互式聊天机器人转变为自主后台协作者,支持生产级的智能体工作流。开发者现在可以构建更可靠、可长时间运行的 AI 智能体,这些智能体能够安全地与内部系统集成,并在多轮对话中保持状态。 后台执行允许智能体在服务器上异步运行,无需保持 HTTP 连接。远程 MCP 服务器可直接连接私有数据库和 API,无需代理中间件。自定义函数调用结合了服务端代码执行与本地工具,凭据刷新可在不丢失文件系统状态的情况下在会话中轮换 API 密钥。
rss · Philipp Schmid(@_philschmid) · Jul 7, 16:40
背景: Gemini API 中的托管智能体提供了一个可配置的智能体框架,包含一个 Linux 沙箱,智能体可以在其中自主推理、执行代码、管理文件和浏览网页。MCP(模型上下文协议)是一种用于将 LLM 连接到工具和数据源的协议。这些新功能扩展了在 Google I/O 2026 上宣布的现有托管智能体基础设施。
参考链接
标签: #Gemini API, #Managed Agents, #AI Agents, #Google DeepMind, #Function Calling
Yann LeCun 讨论 JEPA、世界模型与防塌陷方法
Yann LeCun discusses JEPA, world models, and anti-collapse methods ⭐️ 8.0/10
Yann LeCun 分享了一场深入讨论,涵盖世界模型、联合嵌入预测架构(JEPA)与生成式架构的对比、JEPA 自监督学习的防塌陷方法,以及对 SIGReg、LeJEPA 和 LeWM 的解释。 这场讨论提供了来自顶尖 AI 研究者的关于先进自监督学习技术的宝贵见解,可能影响表征学习和世界模型的研究方向。 关键主题包括防塌陷方法,例如对比、蒸馏和信息最大化方法,以及 SIGReg(草图各向同性高斯正则化),它有助于防止 JEPA 中的表征塌陷。
rss · Yann LeCun(@ylecun) · Jul 7, 14:24
背景: 联合嵌入预测架构(JEPA)是 Meta AI 提出的一种非生成式自监督学习方法,它从上下文块预测目标块的嵌入,无需手工设计的数据增强。世界模型是 AI 系统用于预测未来状态的内部模型,对规划和推理至关重要。防塌陷方法可防止模型学习到平凡或退化的表征,这是自监督学习中的常见挑战。
参考链接
标签: #AI, #world models, #JEPA, #self-supervised learning, #Yann LeCun
deepagents:开源模型无关的智能体工具架发布
deepagents: Open Source Model-Agnostic Agent Harness Announced ⭐️ 8.0/10
Harrison Chase 宣布了 deepagents,这是一个新的开源、模型无关的智能体工具架项目,同时推出了 LangChain Academy 的配套课程。 作为 LangChain 的创建者,Harrison Chase 对智能体工具架的关注标志着可靠 AI 智能体的编排基础设施日益重要,可能为智能体开发树立新标准。 该项目是模型无关且开源的,配套课程涵盖工具架概念、四个核心能力,以及与 LangSmith 的集成以实现追踪和部署。
rss · Harrison Chase(@hwchase17) · Jul 7, 17:35
背景: 智能体工具架是包裹 AI 模型的基础设施,用于管理生命周期、上下文、工具访问、验证和安全性。它将模型的每次推理转换为持续、使用工具、错误恢复的行为。该项目来自 Harrison Chase,他是流行的 LLM 应用框架 LangChain 的创建者。
参考链接
社区讨论: 根据有限的片段,社区讨论很少,但推文有 5 条回复、11 次转发和 89 个赞,表明初步兴趣。
标签: #open source, #AI agents, #LangChain, #model agnostic
中国从开源转向限制 AI 模型
China shifts from open-source to restricting AI models ⭐️ 8.0/10
中国过去通过开源 Qwen、DeepSeek 和 GLM 等 AI 模型来推动模型层商品化的战略正在转变,据报道北京正在首次讨论限制其最先进 AI 模型的海外访问。 这一转变可能极大地改变全球 AI 格局——目前美国公司每周超过 30%的 AI token 通过中国模型路由。如果中国限制访问,可能迫使美国公司更多地依赖本土模型,从而可能增加成本并减缓创新。 中国模型目前仅落后美国前沿约 6 到 9 个月,而非数年;美国对中国模型的使用率在一年内从 11%增长到超过 30%。这种转变的逻辑是:当你落后时,通过开源来商品化模型层;当你认为自己即将领先时,则进行限制。
rss · Aadit Sheth(@aaditsh) · Jul 7, 19:04
背景: 开源 AI 模型是指其权重和有时训练代码公开发布的模型,允许任何人使用、修改和分发。中国的策略是发布强大的开源权重模型,以使 AI 更易获取并阻止美国公司收取高价。这种做法帮助中国模型在全球迅速普及。现在,随着中国接近与美国前沿模型持平,它正在考虑限制访问以维持竞争优势。
标签: #AI, #Open Source, #China, #Technology Strategy, #Geopolitics
Cohere 推出开源阿拉伯语语音识别模型
Cohere Transcribe Arabic: Open-Source ASR Model ⭐️ 8.0/10
Cohere 发布了 Cohere Transcribe Arabic,一个基于 Apache 2.0 许可证的开源自动语音识别模型,声称其是阿拉伯语领域最准确的模型。 该模型解决了高质量开源阿拉伯语语音识别系统稀缺的问题,此类系统因方言多样性和语码转换而落后于英语。它有望为超过 3.7 亿阿拉伯语使用者提供更优质的语音转文本应用。 该模型是一个 20 亿参数的专用音频输入文本输出 ASR 模型,针对阿拉伯语和英语进行了优化,重点关注阿拉伯语方言和阿拉伯语-英语双语语音。模型已在 Hugging Face 上发布。
rss · Cohere(@cohere) · Jul 7, 14:24
背景: 自动语音识别(ASR)将语音转换为文本。阿拉伯语因其众多方言以及尤其在商务场景中频繁与英语混合使用而面临独特挑战。Cohere 此前发布了一个支持 14 种语言的多语言 ASR 模型,此次针对阿拉伯语的模型正是在此基础上构建的。
参考链接
标签: #Arabic speech recognition, #open-source, #Cohere, #ASR, #NLP
HubSpot 将语义搜索扩展至 200 亿向量
HubSpot Scales Semantic Search to 20 Billion Vectors ⭐️ 8.0/10
HubSpot 描述了其语义搜索平台如何从概念验证发展为一项内部服务,管理超过 200 亿个向量,覆盖 38 多个团队,现已支持智能体、RAG 和联系人去重应用。 这一案例研究为在生产环境中扩展向量搜索的从业者提供了宝贵经验,尤其是随着智能体使用的增加,检索质量和延迟变得更为关键。 该系统目前管理超过 200 亿个向量,覆盖 38 多个团队,支持智能体、RAG 和联系人去重。公司指出,智能体使用的增加使得检索质量和延迟变得比以往更加重要。
rss · InfoQ · Jul 7, 08:00
背景: 语义搜索利用向量嵌入将文本表示为高维数值数组,实现基于相似度的检索而非关键词匹配。检索增强生成(RAG)通过在生成响应前从外部知识源检索相关信息来增强大语言模型。将向量搜索扩展到数十亿向量需要高效的索引和存储方案,以保持低延迟和高准确性。
标签: #semantic search, #vector search, #HubSpot, #scaling, #RAG
通过机器 DPAPI 恢复活动 ADFS 签名密钥
Recovering Active ADFS Signing Keys via Machine DPAPI ⭐️ 8.0/10
Mandiant 研究人员发现了一种新技术,通过利用禁用 AutoCertificateRollover 且手动轮换证书的环境中的配置漂移,恢复活动的 ADFS 令牌签名密钥,使得活动密钥暴露在 Windows Machine DPAPI 中。 该技术使攻击者能够为任何用户伪造 SAML 令牌,绕过 MFA 和条件访问,从而未经授权访问所有 SAML 联合应用程序,包括 Microsoft 365 和 Entra ID。它规避了对 LSASS 和 ADFS 服务的监控,比传统方法更隐蔽。 该技术避免与通常被严密监控的 LSASS 和实时 ADFS 服务进程直接交互。攻击仅在禁用 AutoCertificateRollover 并手动轮换证书时成功,这是企业环境中的常见配置。
rss · Cloud Blog · Jul 7, 14:00
背景: Golden SAML 是一种攻击技术,攻击者窃取 ADFS 令牌签名证书的私钥来伪造 SAML 断言,从而冒充任何用户。通常,这些密钥存储在 ADFS 配置数据库中,并使用分布式密钥管理器 (DKM) 加密。但是,当手动轮换证书时,旧密钥可能仍保留在数据库中但变为非活动状态,而活动密钥受 Windows Machine DPAPI 保护,Mandiant 发现可以提取该密钥。
参考链接
标签: #Security, #ADFS, #DPAPI, #Golden SAML, #Threat Intelligence
基准测试的意义差距
The Benchmark Meaning Gap ⭐️ 8.0/10
JetBrains 的研究人员认为,像 HumanEval 这样的单一数字编码基准测试过度简化了 AI 模型的能力,可能会歪曲代码生成方面的实际进展。 这一批评可能会重塑 AI 社区衡量编码能力的方式,推动开发更精细的基准测试,以反映真实的软件工程任务。 博客文章指出,HumanEval 等基准测试只测试孤立的函数生成,而 SWE-bench 要求理解真实代码库并生成补丁,这揭示了评估复杂性的显著差异。
rss · The JetBrains Blog · Jul 7, 13:10
背景: 编码基准测试是用于评估人工智能模型生成代码能力的标准化测试。例如,HumanEval 包含 164 个 Python 函数生成问题,模型必须根据文档字符串编写正确的代码,并通过单元测试进行验证。SWE-bench 是一个更复杂的基准测试,要求模型理解大型真实代码库、阅读问题报告并生成通过现有测试的补丁。这些基准测试广泛用于排行榜,以比较模型性能。
参考链接
标签: #AI benchmarks, #model evaluation, #coding ability, #AI research
Databricks Omnigent: 使用会话状态的上下文策略
Databricks Omnigent: Contextual Policies with Session State ⭐️ 8.0/10
Databricks 推出了 Omnigent,这是一个开源元框架,利用会话状态实现上下文策略,以更有效地治理 AI 智能体。 这解决了对 AI 智能体进行动态、上下文感知治理的关键需求,通过根据会话内累积的风险调整策略,实现更安全、更可用的智能体交互。 上下文策略允许根据会话状态有条件地应用规则,仅在智能体行为累积足够风险时阻止操作,而不是施加静态限制。
rss · Databricks · Jul 7, 17:42
背景: AI 智能体的治理通常涉及静态策略,这些策略可能过于严格或安全性不足。Omnigent 作为元框架位于现有智能体框架之上,为组合和治理智能体提供统一层。会话状态跟踪单个会话内智能体操作的历史和上下文,从而实现动态策略执行。
参考链接
标签: #AI agents, #governance, #session state, #open source, #Databricks
2026 年 7 月 8 日 Hacker News 热门故事
Top Hacker News Stories for July 8, 2026 ⭐️ 8.0/10
这是一份精选的十大 Hacker News 热门故事列表,涵盖了开源硬件(OpenWrt One)、新的开源 AI 模型(GLM 5.2)、隐私争议(Chat Control)、id Software 裁员以及其他技术发展。 这份摘要突出了开源硬件和 AI 民主化的关键趋势,同时引起了人们对紧迫的隐私问题和影响开发者和消费者的行业变化的关注。 值得注意的故事包括以 MIT 许可证发布的 GLM 5.2 模型(支持 100 万 token 上下文)、可能允许扫描私人通讯的欧盟 Chat Control 法规,以及微软解雇 idTech 引擎团队的事件。
rss · HackerNews每日摘要 on SuperTechFans · Jul 7, 23:00
背景: Hacker News 是一个专注于计算机科学和创业的社会新闻网站,社区在此发布并投票文章。像这样的精选摘要聚合了当天评分最高的故事,为读者提供技术界热门话题的快照。
社区讨论: Hacker News 社区对像 OpenWrt One 这样的开源硬件和像 CoMaps 这样注重隐私的应用表示强烈支持,同时对 Chat Control 提案以及 id Software 裁员对游戏引擎多样性的影响表示担忧。
标签: #Hacker News, #tech news, #open source, #AI, #privacy
Fable 5 检测到恶意软件后自我审查
Fable 5 catches malware, then self-censors ⭐️ 8.0/10
一位用户报告称,Anthropic 的 AI 模型 Fable 5 在其电脑上检测并成功清除了实际恶意软件,但随后其安全过滤器因执行网络安全工作而惩罚了此次交互,将会话降级到能力较弱的 Opus 4.8 模型。 这一事件凸显了 AI 安全机制中的关键缺陷:旨在防止滥用的过滤器可能无意中压制了像清除恶意软件这样的有益行为,引发了对过度谨慎的护栏阻碍合法用例的担忧。 恶意软件是一个隐藏的 PowerShell 持久化条目,会在登录时下载远程脚本;Fable 5 主动提供帮助,用户指示其删除注册表键,它成功执行。清理后,系统将该对话标记为'网络安全工作',并强制降级到 Opus 4.8。
rss · r/ClaudeAI · Jul 7, 12:48
背景: Fable 5 是 Anthropic 发布的高能力 AI 模型,配备了增强的安全分类器,用于检测网络安全和生物学等敏感领域中的潜在滥用。当查询被标记时,系统会自动将其路由到较旧、能力较弱的 Opus 4.8 模型,以防止高级模型被用于有害目的。这种设计旨在降低风险,但可能产生误报,阻止合法任务。
参考链接
标签: #AI safety, #malware detection, #AI filters, #cybersecurity, #LLM
DeepReason:基于波普尔认识论的 LLM 推理框架
DeepReason: LLM Reasoning Harness Based on Popper's Epistemology ⭐️ 8.0/10
一位开发者构建了 DeepReason,这是一个开源框架,它使用卡尔·波普尔的猜想与反驳认识论,强制 LLM 与自己辩论,生成可审计的推理轨迹。该项目包含一个紧凑的 900 行版本 MiniReason,运行一次完整推理只需几分钱。 DeepReason 代表了 AI 推理的一种新方法,它通过应用形式化的哲学方法来提高 LLM 输出的可靠性和透明度。如果成功,这可能会带来更值得信赖的 AI 系统,这些系统能够解释其推理步骤并接受一致性审计。 该框架以仅追加日志的方式运行,记录每一次推理,使每个声明都可重新推导和质疑。它衡量模型是否仍在探索新想法还是固守熟悉的观点,并在模型停滞时停止。
rss · r/ClaudeAI · Jul 7, 10:23
背景: 卡尔·波普尔的认识论强调科学理论必须通过大胆猜想和严格批判来证伪。该项目使用波普尔的四段式图式(问题→尝试理论→消除错误→新问题)作为 LLM 推理的结构化过程。AI 中的“框架”(harness)指的是约束和引导 LLM 输出的结构,以提高其相对于原始模型响应的可靠性。
标签: #LLM, #Reasoning, #Epistemology, #Open Source, #AI Research
埃隆·马斯克解散 xAI,以 SpaceXAI 品牌并入 SpaceX
Elon Musk dissolves xAI, rebrands as SpaceXAI under SpaceX ⭐️ 8.0/10
埃隆·马斯克宣布 xAI 将解散独立公司身份,更名为 SpaceXAI,并将其技术整合到 SpaceX 中。此举是在 SpaceX 以全股票交易收购 xAI(估值 2500 亿美元)之后进行的。 此次重组将马斯克的 AI 工作统一到 SpaceX 品牌下,可能加速用于太空探索及其他 SpaceX 项目的 AI 技术开发。这也标志着 xAI 作为独立实体的终结,该公司曾推出 Grok 聊天机器人。 该公告通过社交媒体发布,xAI 已在与 Anthropic 的计算合作公告中开始使用 SpaceXAI 名称。此次收购对 SpaceX 估值 1 万亿美元,对 xAI 估值 2500 亿美元,合并后的实体价值 1.25 万亿美元。
telegram · zaihuapd · Jul 7, 02:30
背景: xAI 是由埃隆·马斯克于 2023 年创立的美国人工智能公司,以开发 Grok 聊天机器人而闻名。2026 年 2 月,SpaceX 以全股票交易收购 xAI,使其成为全资子公司。更名为 SpaceXAI 标志着其更深层次地融入 SpaceX 的业务。
标签: #AI, #Elon Musk, #xAI, #SpaceX, #technology acquisition
Windows 11 漏洞吞噬高达 513GB 磁盘空间
Windows 11 Bug Eats Up to 513GB of Disk Space ⭐️ 8.0/10
微软确认了 Windows 11 中的一个漏洞,Capability Access Manager 服务使用的 CapabilityAccessManager.db-wal 文件可能膨胀至 500GB 以上。微软已在 2026 年 6 月发布了可选更新 KB5095093 以缓解问题,计划在 2026 年 7 月补丁星期二中推出永久修复。 该漏洞会悄然消耗大量磁盘空间,导致存储不足并影响系统性能。对于 SSD 容量有限的系统或依赖隐私敏感应用权限的用户而言尤为关键。 文件 CapabilityAccessManager.db-wal 是用于记录应用权限访问的 SQLite 数据库的预写日志(WAL)。该漏洞阻止 WAL 正确检查点(合并)回主数据库,导致其无限增长。部分用户报告该文件最大达到 513 GB。
telegram · zaihuapd · Jul 7, 06:34
背景: Windows 11 中的 Capability Access Manager(camsvc)管理 UWP 应用对摄像头、麦克风、位置等隐私敏感资源的权限。它使用 SQLite 数据库并采用预写日志(WAL)以提升性能和崩溃恢复能力。正常情况下,WAL 文件会定期压缩合并,但由于 Windows 11 的一个漏洞,压缩失败,导致 WAL 文件无限增长。该问题最初由用户在社区论坛中提出,随后微软予以确认。
参考链接
标签: #Windows 11, #bug, #storage, #system update, #disk space
Anthropic 发布 Claude Sonnet 5,增强代理能力
Anthropic releases Claude Sonnet 5 with stronger agentic capabilities ⭐️ 8.0/10
Anthropic 发布了 Claude Sonnet 5,声称这是迄今代理能力最强的 Sonnet 模型,能够规划、使用浏览器和终端等工具并自主运行。它在推理、工具使用、编码和知识工作上优于 Sonnet 4.6,性能接近 Opus 4.8,但价格更低。 此次发布是使先进 AI 模型更擅长自主执行任务的重要一步,可能降低高质量 AI 助手的成本。开发者和企业将从更低的定价和更好的性能中受益。 Claude Sonnet 5 即日起面向所有套餐开放,并成为 Free 和 Pro 的默认模型。在 Claude 平台上,限时定价为每百万输入 token 2 美元,每百万输出 token 8 美元,有效期至 2026 年 8 月 31 日。
telegram · zaihuapd · Jul 7, 09:02
背景: Claude 是 Anthropic 开发的一系列大型语言模型,其中 Sonnet 是平衡性能和成本的中端模型,Opus 是高端模型。代理能力指的是模型能够自主执行操作,如使用工具或浏览互联网,而不仅仅是生成文本。
标签: #AI, #Anthropic, #Claude, #Large Language Model, #Agent
DeepSeek 自研 AI 芯片以减少对英伟达和华为的依赖
DeepSeek develops its own AI chips to reduce reliance on Nvidia and Huawei ⭐️ 8.0/10
中国 AI 公司 DeepSeek 正在自研专注于推理阶段的 AI 芯片,旨在减少对英伟达 H800 和华为昇腾芯片的依赖。该计划始于约一年前,目前仍处于早期阶段,DeepSeek 已开始招募芯片设计工程师并与芯片设计、代工和存储公司接洽。 此举标志着 AI 行业的战略转变,可能在美国出口管制背景下减少中国对外国和国内芯片供应商的依赖。如果成功,可能重塑 AI 芯片供应链并加剧中美科技竞争。 该芯片专用于推理阶段(即训练好的模型生成答案的环节),而非模型训练。DeepSeek 此前依赖英伟达 H800 GPU 和华为昇腾芯片,这些芯片受到美国出口管制的影响。
telegram · zaihuapd · Jul 7, 11:08
背景: AI 推理是训练好的模型处理新数据并产生输出(如文本或分类)的过程。AI 训练是之前从数据中学习模式的阶段。美国出口管制限制了中国公司获取英伟达 H800 等先进芯片,促使企业开发国产替代方案。
标签: #AI芯片, #DeepSeek, #自研芯片, #半导体, #出口管制
中国拟限制顶尖 AI 模型出口
China Plans to Restrict Export of Top AI Models ⭐️ 8.0/10
中国商务部已召集阿里巴巴、字节跳动和智谱等公司开会,讨论限制海外访问国内最先进 AI 模型(包括未发布模型)。该提案还可能限制外资对国内 AI 初创企业的投资。 此举可能显著改变全球 AI 格局,限制中国 AI 模型(最具竞争力的模型之一)的可用性,并可能加剧中国与西方国家的技术紧张关系,影响国际合作与 AI 发展。 限制范围仍在商讨中,可能仅适用于未来发布的模型。该提案最终是否落地尚不确定。会议还考虑将 AI 核心技术泄露或窃取纳入国家安全法治罪。
telegram · zaihuapd · Jul 7, 11:42
背景: AI 技术出口管制是各国保护战略技术的更广泛地缘政治趋势的一部分。中国在 AI 领域投入巨大,已生产出与美国模型相媲美的模型。拟议的限制措施类似于美国对中国的出口禁令,例如对先进芯片的出口限制。
标签: #AI, #Export Control, #China, #Regulation, #Technology Policy
📊 运行统计 · 总耗时
16m 55s· AI 分析3m 41s· Tokens0.75 MCY(输入0.52/ 输出0.23MCY)