Debian 强制所有软件包可重现构建 ⭐️ 9.0/10

Debian 宣布其下一个版本中的所有软件包都必须可重现构建,目前 amd64 架构上已有超过 97% 的软件包满足要求。 这是软件供应链安全的一个重要里程碑,确保二进制文件与源代码匹配,防止针对二进制文件的篡改攻击。 截至公告,forky 版本的 amd64 架构上有 97.02% 的软件包是可重现的,其他架构的统计数据可在 reproduce.debian.net 查看。

hackernews · robalni · May 10, 05:26 · 社区讨论

背景: 可重现构建(也称为确定性编译)确保相同的源代码产生完全相同的二进制文件。这建立了从源代码到二进制文件的可验证信任链,减轻了在不修改源代码的情况下二进制文件可能被篡改的供应链攻击风险。Debian 多年来一直致力于这项工作,实现接近完全的可重现性是一项重大的技术成就。

参考链接

社区讨论: 社区对这一成就表示庆祝,tofflos 提供了精确的统计数据。uecker 回忆说,2007 年这个想法曾被斥为浪费时间,但现在它被视为一项巨大成就。Zopieux 祝贺 Debian 在当前时代坚持高标准。

标签: #reproducible builds, #Debian, #software supply chain, #security, #open source


DeepSeek V4 论文:FP4 量化训练与稳定性技巧 ⭐️ 9.0/10

DeepSeek 发布了完整的 V4 论文,详细介绍了针对 MoE 模型的 FP4 量化感知训练(QAT),相比 V3.2 实现了高达 90%的 FLOPs 减少和 93%的 KV 缓存减少,并提出了两项训练稳定性机制:预期路由和 SwiGLU 裁剪。 这一突破大幅降低了万亿参数 MoE 模型的推理成本,改变了大规模 AI 部署的经济性,使多智能体工作负载更加可行。稳定性修复解决了长期阻碍规模扩展的训练发散问题。 FP4 QAT 应用于 MoE 专家权重和 CSA 索引器中的 QK 激活,实现了 QK 选择器 2 倍加速和 99.7%召回率。预期路由使路由器更新不同步(20%开销,仅在尖峰时激活),SwiGLU 裁剪限制激活值在±10 以内。

reddit · r/MachineLearning · Dramatic_Spirit_8436 · May 9, 08:10

背景: 量化感知训练(QAT)在训练过程中模拟低精度运算,使模型权重适应低精度,从而实现高效推理。混合专家模型(MoE)每层使用多个专用子网络,但在大规模训练时容易出现损失尖峰和不稳定性。FP4 是一种 4 位浮点格式,平衡了范围和精度。DeepSeek V3.2 作为本工作的基线。

参考链接

社区讨论: 评论者称赞 FP4 QAT 是推理经济学的'游戏规则改变者',特别对多智能体工作负载而言,并指出预期路由是一个巧妙的工程修复。他们还强调了长上下文服务中 KV 缓存的惊人减少。

标签: #DeepSeek, #FP4 quantization, #MoE, #training stability, #efficiency


Bun 实验性 Rust 重写实现 99.8% 测试兼容性 ⭐️ 8.0/10

Bun(原本基于 Zig 构建的 JavaScript 运行时)通过实验性的 Rust 重写,在 Linux x64 glibc 上实现了 99.8% 的测试兼容性,并借助 LLM 辅助代码移植快速完成。 这一里程碑展示了 LLM 大幅加速大规模软件重写的潜力,并可能影响 Bun 的未来可靠性及性能——从 Zig 迁移到以内存安全著称的 Rust。 该重写仍处于实验阶段,一位 Bun 开发者指出这些代码可能被完全丢弃。99.8% 的测试兼容性仅适用于 Linux x64 glibc,且 Rust 版本可能仍包含 unsafe 代码,可能影响安全性保障。

hackernews · heldrida · May 9, 10:12 · 社区讨论

背景: Bun 是一个高性能 JavaScript 运行时,可捆绑、转译并运行 JavaScript 和 TypeScript。glibc 是 GNU C 库,为 Linux 系统提供基础运行时函数。LLM 辅助移植利用大语言模型在编程语言间翻译代码,因减少人工投入而受到关注。

参考链接

社区讨论: 一位 Bun 开发者强调重写仍是实验性的,可能被抛弃,并称社区反应过度。其他人对速度(6 天)和 LLM 的作用表示印象深刻,而有些人则对 Bun 的方向表示不信任,并指出基于 Zig 的 Bun 存在内存错误,Rust 可能有助于缓解。

标签: #Bun, #Rust, #JavaScript runtime, #software engineering, #LLM-assisted porting


互联网档案馆瑞士分部成立独立数字保存组织 ⭐️ 8.0/10

互联网档案馆瑞士分部作为一个独立组织成立,与互联网档案馆、互联网档案馆加拿大分部和互联网档案馆欧洲分部一起,形成一个由使命一致的数字图书馆组成的分布式网络。 此举使数字保存去中心化,增强了对 DMCA 下架等法律威胁的抵御能力,并促进了全球合作以保护数字知识。 新组织在技术上独立,但共享 Brewster Kahle 和 Caslon 等董事;然而,早期报告指出其网站上存在占位文本,表明仍处于开发阶段。

hackernews · hggh · May 9, 12:00 · 社区讨论

背景: 分布式图书馆是一个由多个独立节点提供数字资料的集合,减少了对单点故障的依赖。去中心化的数字保存将内容分散到不同组织,以抵御法律、政治或技术威胁。互联网档案馆瑞士分部体现了这一模式,加强了全球保存基础设施。

参考链接

社区讨论: 社区评论建议互联网档案馆采用类似 Usenet 的模式,即独立组织之间进行对等连接和内容复制,但没有转发 DMCA 下架请求的技术能力。一些评论者对瑞士分部的真正独立性提出质疑,指出共享的董事会成员和基础设施。其他人观察到网站上的占位内容,表明这是一个正在建设中的项目。

标签: #digital preservation, #internet archive, #decentralization, #online censorship, #open access


数学家测试 ChatGPT 5.5 Pro 推理能力 ⭐️ 8.0/10

菲尔兹奖得主蒂姆·高尔斯分享了他使用 ChatGPT 5.5 Pro 的体验,指出其推理能力相比之前版本有显著提升。 如果大语言模型能够可靠地解决初学者研究的“温和问题”,可能会改变博士生的培养方式以及数学领域原创研究的定义。 高尔斯观察到 ChatGPT 5.5 Pro 仍然会犯很多错误,但比其他模型更能追踪自己的推理并自我纠正;然而,其每 token 的成本很高。

hackernews · alternator · May 9, 02:41 · 社区讨论

背景: ChatGPT 5.5 Pro 是 OpenAI 开发的高级大语言模型,旨在提升推理和问题解决能力,尤其在数学等技术领域。该版本尚未广泛开放,且比之前版本更昂贵。

社区讨论: 评论者普遍认同高尔斯的评价,指出模型自我纠正能力提升但成本高。一位物理学教授分享称 Gemini 也能帮助发现错误但会犯概念性错误。另一位评论者强调了关于思想价值和自动化的哲学含义。

标签: #AI, #LLM, #ChatGPT, #research impact


FreeBSD execve() 本地提权漏洞 ⭐️ 8.0/10

FreeBSD 发布了安全公告 SA-26:13.exec,修复了 execve() 系统调用中的一个本地提权漏洞,CVSS 评分为 8.0。 该漏洞允许本地攻击者获取 root 权限,对 FreeBSD 系统构成严重威胁,并凸显了操作系统内核中代码正确性的关键作用。 该漏洞由 execve() 实现中的运算符优先级错误引起,缺少括号导致计算错误,从而允许内存损坏。已在 FreeBSD 15.0R-p7 和 14.2R-p13 中修复。

hackernews · Deeg9rie9usi · May 9, 20:31 · 社区讨论

背景: execve() 系统调用用于执行新程序,替换当前进程映像。它是类 Unix 操作系统中进程创建的基础。此类核心函数中的本地提权漏洞可能允许非特权用户以内核权限执行任意代码。

参考链接

社区讨论: 社区指出运算符优先级错误是常见陷阱,有评论者建议禁止混合运算符表达式。Calif 的研究人员发布了详细的技术文章和 AI 生成的漏洞利用,其他用户强调该问题已于 4 月 28 日修复。

标签: #FreeBSD, #security, #privilege escalation, #CVE, #vulnerability


Let-go:用 Go 实现的类 Clojure 语言,7 毫秒启动 ⭐️ 8.0/10

Let-go 发布,这是一种用纯 Go 编写的类 Clojure 语言,冷启动时间约为 7 毫秒,与 JVM Clojure 兼容性约 90%。它包含一个 nREPL 服务器,并且可以嵌入到 Go 程序中。 这很重要,因为它比 JVM Clojure 快 50 倍,比 Babashka 快 3 倍,非常适合对快速启动要求高的命令行工具和脚本。它还使得类 Clojure 语法可用于系统编程和嵌入式应用。 Let-go 以约 10MB 的静态二进制文件发布,包含自定义编译器和栈虚拟机,支持 AOT 编译,并能与 Go 函数、结构体和通道无缝互操作。但无法加载 JAR 文件或提供完整的 Java API 兼容性,因此现有 Clojure 项目可能需要修改才能运行。

hackernews · marcingas · May 9, 17:52 · 社区讨论

背景: Clojure 是一种 Lisp 方言,传统上运行在 JVM 上,由于 JVM 初始化而启动较慢。Babashka 利用 GraalVM 原生镜像实现了 Clojure 脚本的快速启动。Let-go 则采用不同方法,从零开始在 Go 中实现类 Clojure 语言,完全避免使用 JVM。nREPL 是一种网络 REPL 协议,被 Calva 和 CIDER 等 Clojure 开发工具使用。

参考链接

社区讨论: 评论普遍积极,用户称赞快速启动和小二进制体积。一些人讨论了 Joker 和 Janet 等替代项目,还有用户注意到 README 中存在微小不一致(7ms vs 6ms)。还提到了与 Glojure/Gloat 生态系统的合作。

标签: #Clojure, #Go, #programming language, #performance, #nREPL


用 HTML 代替 Markdown,让 Claude 输出更丰富 ⭐️ 8.0/10

Anthropic Claude Code 团队成员 Thariq Shihipar 主张在 Claude 的输出中使用 HTML 而非 Markdown,从而生成包含 SVG 图表、交互式小组件和页面内导航的更丰富、更结构化的结果。 这一方法挑战了长期以来将 Markdown 作为 LLM 输出默认格式的做法,有望提升解释的清晰度和交互性,有助于开发者审查代码、理解漏洞或学习复杂概念。 历史上,由于上下文窗口限制,Markdown 的令牌效率更受青睐,但 GPT-5.5 和 Claude 等现代模型可以处理 HTML 的冗长以生成更丰富的输出;例如,为 PR 审查和安全漏洞解释生成 HTML 制品。

rss · Simon Willison · May 8, 21:00

背景: Claude Code 是 Anthropic 推出的基于 Claude 大语言模型的 AI 工具,用于软件开发和内容营销,采用宪法 AI 进行对齐。Markdown 因其简洁性和令牌效率而成为 LLM 的常见输出格式,但 HTML 为复杂信息提供了更多格式化选项。

参考链接

标签: #prompt engineering, #llm, #html, #markdown, #anthropic


NVIDIA 发布 Star Elastic 检查点,支持动态模型缩放 ⭐️ 8.0/10

NVIDIA 发布了 Star Elastic,这是一个单一的检查点,其中嵌套了 30B、23B 和 12B 推理模型,可通过零样本切片提取而无需额外训练。 这种方法实现了 LLM 的动态计算缩放,通过跨模型大小共享单个检查点来减少存储和内存开销,并允许在推理速度和准确性之间灵活权衡。 Star Elastic 检查点支持 BF16、FP8 和 NVFP4 格式,并在子模型之间使用共享 KV 缓存以避免重新计算;对于 NVFP4,简短的量化感知蒸馏阶段可恢复 97.79% 的 BF16 精度。

reddit · r/LocalLLaMA · phazei · May 10, 00:48

背景: 传统的 LLM 部署需要为不同的模型大小使用单独的检查点,增加了存储和内存成本。Star Elastic 引入了一种嵌套架构,将较小的子模型嵌入到较大的父模型中,并通过可学习的路由器为推理选择合适的子模型。这类似于可伸缩视频编码,单个文件中包含多个质量层。

参考链接

社区讨论: 社区评论对嵌套子模型相对于传统 MoE 的优势表示困惑,一些人指出与 Qwen 等模型相比结果并不突破。然而,对共享 KV 缓存功能兴趣浓厚,因为它可以减少动态缩放的 VRAM 开销。总体而言,这种方法被视为巧妙,但与现有技术相比,直接的实用优势有限。

标签: #NVIDIA, #LLM, #efficient inference, #model compression, #MoE


BeeLlama.cpp:使用 DFlash 和 TurboQuant 在 3090 上实现 Qwen 27B 推理速度提升 2-3 倍 ⭐️ 8.0/10

一款名为 BeeLlama.cpp 的新 llama.cpp 分支发布,集成了 DFlash 推测解码和 TurboQuant KV-cache 压缩技术,使 Qwen 3.6 27B Q5 模型能够在单张 RTX 3090 上以 200k 上下文运行,推理速度相比基准 llama.cpp 提升 2-3 倍,峰值达到 135 tokens/s。 这项优化显著降低了本地运行大语言模型的硬件门槛,使得消费级 GPU 就能运行具备长上下文和视觉能力的高质量 27B 模型。社区验证表明这些技术有望合并到主线,惠及整个本地 LLM 生态。 DFlash 是一种基于块扩散的推测解码方法,每步生成多个草稿令牌以加速推理;TurboQuant 则以近乎无损的质量压缩 KV-cache。该分支还包括自适应草稿控制、推理循环保护和完整多模态支持,并为 Qwen 3.6 27B 提供了一键配置。

reddit · r/LocalLLaMA · Anbeeld · May 9, 16:05

背景: llama.cpp 是一个流行的 C++实现,用于在消费级硬件上高效运行量化大语言模型。推测解码使用一个小型草稿模型生成候选令牌,再由大型目标模型验证,从而降低延迟。GGUF 量化减小模型体积和内存占用,Q5 在质量与性能之间取得良好平衡。DFlash 和 TurboQuant 是近期研究成果,可进一步提升吞吐量和内存效率。

参考链接

社区讨论: 社区评论总体积极,有用户报告在 5090 上达到 200 tps,且性能优于主线的 MTP PR。但也有用户对该项目在开发过程中大量使用 AI 表示担忧,并质疑又一个分支的可持续性,有人称之为“层层叠叠的垃圾”。另一些用户则希望这些优化能被合并到 llama.cpp 主线。

标签: #llama.cpp, #inference optimization, #quantization, #speculative decoding, #local LLM


在 12GB 显存上以 80 tok/s 和 128K 上下文运行 Qwen3.6 35B A3B ⭐️ 8.0/10

一位 Reddit 用户分享了一种配置,在 12GB 显存的 GPU(RTX 4070 Super)上,使用 Qwen3.6 35B A3B 混合专家模型配合 llama.cpp 的多令牌预测(MTP)推测解码,实现了超过 80 tok/s 的生成速度和 128K 的上下文长度。 这表明总参数量 35B(活跃参数量 3B)的大型语言模型可以在仅有 12GB 显存的消费级 GPU 上高效运行,使更多个人用户和研究人员能够使用先进的 AI 能力。采用推测解码技术无需额外硬件即可大幅提升吞吐量。 该配置使用了 GGUF 量化模型(Q4_K_XL)和特定的 llama.cpp 命令行参数,例如--no-mmap、--mlock 以及--spec-type mtp 配合--spec-draft-n-max 2。系统运行在 CachyOS 上,配备 AMD Ryzen 7 9700X 和 48GB 内存,草稿接受率超过 80%。

reddit · r/LocalLLaMA · janvitos · May 9, 11:57

背景: Qwen3.6-35B-A3B 是一个混合专家(MoE)模型,总参数量为 350 亿,但每个 token 仅激活 30 亿参数,使其推理更高效。llama.cpp 是一个流行的开源 C++库,用于本地运行 LLM,它通过多令牌预测(MTP)支持推测解码,即草稿模型提前预测多个令牌,再由主模型验证,从而加速生成。

参考链接

社区讨论: 社区评论积极且参与度高。用户分享了额外基准测试,例如一位用户在 8GB GTX 1070 上使用 Q2 量化版本在 125K 上下文下取得了 13.6 t/s 的速度。其他人表示有兴趣在不同硬件(如 AMD GPU 或 RTX 3080 Ti)上复现结果,并指出-fitt 等特定参数对长上下文工作流的重要性。

标签: #LLM inference, #llama.cpp, #Qwen, #speculative decoding, #GPU optimization