AI 研究员田渊栋创立 Recursive,估值 46.5 亿美元的超智能公司
AI Researcher Tian Yuandong Launches Recursive, a $4.65B Superintelligence Startup
⭐️ 9.0/10

前 Meta FAIR 总监田渊栋以联合创始人身份正式宣布成立新公司 Recursive(Recursive Superintelligence),获得超 6.5 亿美元融资,估值约 46.5 亿美元,旨在构建递归自改进超智能。 这代表了向能够自我改进的自主 AI 的范式转变,可能加速科学发现和技术进步。高知名度的团队和巨额融资表明业界对此方法充满信心。 公司全称为 Recursive Superintelligence,CEO 为 Richard Socher,联合创始人包括 Tim Rocktäschel、Jeff Clune、Alexey Dosovitskiy、Caiming Xiong、Josh Tobin 和 Tim Shi 等。核心思路是,既然 AI 即代码,而 AI 现在又能写代码,就能闭合自改进循环。

rss · meng shao(@shao__meng) · May 14, 00:56

背景: 递归自改进(RSI)是指 AI 系统能够重写自身代码以增强能力,可能引发智能爆炸。这一概念在 AI 安全和 AGI 理论中已被讨论数十年。Recursive 团队旨在将这一理论概念转化为实际系统,基于近期在编程智能体和自动化研究循环方面的进展。

参考链接

标签: #AI, #AGI, #Startup, #Deep Learning, #Funding


谷歌报告首个已知 AI 制作零日漏洞实例
Google reports first known real-world AI-crafted zero-day exploit
⭐️ 9.0/10

Google reports the first known instance of an AI being used to craft a zero-day exploit in the wild.

rss · Hacker News: Newest · May 14, 02:05

标签: #AI, #zero-day exploit, #cybersecurity, #threat intelligence, #Google


Android 集成设备端 MCP,让 Gemini 实现代理操作
Android integrates on-device MCP for Gemini agentic actions
⭐️ 9.0/10

谷歌在 Android Show 上宣布,Android 将在操作系统中原生集成模型上下文协议 (MCP),应用可通过 @AppFunction 注解暴露功能,让 Gemini 等代理在设备端本地执行跨应用操作。 这消除了移动设备上代理式 AI 操作对云的依赖,带来更快、更私密且支持离线的 AI 体验,可能彻底改变用户通过 AI 代理与应用交互的方式。 该系统工作方式类似 MCP,但完全在设备端运行,无需服务器或网络往返,适用于 Android 16+,并设有早期访问计划供测试。

rss · Philipp Schmid(@_philschmid) · May 13, 13:00

背景: 模型上下文协议 (MCP) 是由 Anthropic 推出的开放标准,用于规范 AI 系统与外部工具和数据的集成。谷歌将 MCP 原生嵌入 Android,允许任何应用将其功能声明为 AI 代理的工具,从而实现无缝的跨应用自动化。

参考链接

标签: #Android, #Gemini, #MCP, #on-device AI, #agents


小米发布 OneVL:一步式潜空间推理自动驾驶框架
Xiaomi Unveils OneVL: One-Step Latent Reasoning for Autonomous Driving
⭐️ 9.0/10

小米发布了 OneVL,这是一个一步式潜空间推理框架,首次在自动驾驶领域将视觉-语言-动作模型(VLA)与世界模型统一,在多个基准上达到最先进水平,并全面开源。 OneVL 通过在单一潜空间中将 VLA 与世界模型推理相结合,实现了自动驾驶的突破,推理延迟降至 0.24 秒(仅为自回归 VLA 的 5.4%),同时超越了显式思维链方法。这可能加速智能驾驶系统的实时部署。 OneVL 使用潜令牌编码物理因果结构和驾驶意图,训练时通过双辅助解码器预测未来画面和可读思维链,推理时移除这些解码器,实现一步并行生成。在 NAVSIM 上取得了 88.84 的 PDM 得分,成为首个超越显式思维链(88.29)的潜思维链方法。

telegram · zaihuapd · May 13, 10:33

背景: 视觉-语言-动作模型(VLA)结合了视觉理解、语言推理和动作预测用于自动驾驶,而世界模型则模拟未来状态。传统的思维链(CoT)推理生成中间文本,速度慢且丢失时空结构。潜空间推理将推理过程压缩为紧凑的向量表示,在保留丰富结构的同时实现更快的推理。

参考链接

标签: #autonomous driving, #VLA, #world model, #latent space reasoning, #open source


AI 让个人软件制作像定制 Emacs 一样简单
AI Makes Personal Software as Easy as Customizing Emacs
⭐️ 8.0/10

一篇新文章指出,AI(尤其是大型语言模型)使得构建个人软件变得像定制 Emacs 一样简单,从而开启了高度个性化工具的新时代。 这一转变使个人能够根据自己的需求创建定制软件,减少对预打包专业应用的依赖,并实现了软件开发的民主化。 文章列出了几个应用类别——如播客应用、订阅阅读器和笔记工具——在这些领域 AI 可以产生超越替代品级别的结果,尽管不一定达到全球最佳水平。

hackernews · rdslw · May 13, 07:06 · 社区讨论

背景: Emacs 是一款高度可扩展的文本编辑器,拥有超过 10000 条内置命令和 Lisp 扩展语言,允许用户自定义几乎每一个方面。“Emacs 化”这个比喻用来描述让软件变得像 Emacs 一样可定制。文章用这个比喻来说明 AI 如何使任何人都能打造个人软件解决方案。

参考链接

社区讨论: Hacker News 用户 tptacek 和 dang 强烈赞同,tptacek 列出了 AI 已经擅长的类别,dang 则创造了“dot emacs”这一说法。shaokind 分享了一段混合体验,指出 Emacs 设置在不同平台上不够稳定,而 SoftTalker 则将这一概念与家庭计算的原始愿景联系起来。

标签: #AI, #software development, #personalization, #LLMs, #Emacs


普林斯顿结束 133 年荣誉制度,改为监考考试
Princeton Ends 133-Year Honor Code, Mandates Proctored Exams
⭐️ 8.0/10

普林斯顿大学在 133 年来首次强制要求线下考试配备监考人员,结束了允许无人监考考试的长久荣誉制度。该决定由教师于 2026 年 5 月通过,源于对 AI 作弊的担忧。 这一转变反映了社会从高信任向低信任机构的广泛转变,尤其是在学术界,因为 ChatGPT 等 AI 工具使作弊更容易且更难检测。这可能会促使其他大学重新考虑其荣誉制度和监考政策。 在旧荣誉制度下,学生考试时无监考人员,并要求自己报告违规行为。新政策引入了主动监考,并可能在考试期间没收设备,以应对近 30%学生承认作弊的担忧。

hackernews · bookofjoe · May 13, 20:12 · 社区讨论

背景: 荣誉制度是一套依赖学生自觉维护学术诚信而无外部监控的规则。普林斯顿的荣誉制度始于 1893 年,是美国最古老的制度之一,允许无人监考考试,违规行为由学生自治机构处理。生成式 AI 的兴起使考试和作业作弊更加容易,挑战了基于信任的系统的有效性。

社区讨论: 评论反应不一:一些校友怀念荣誉制度,而另一些人则认为在 AI 时代有必要进行监考。批评者感叹社会从高信任转向低信任,并指出旧制度下 30%的学生承认作弊。还有讨论指出依靠学生举报同伴是不切实际的。

标签: #education, #AI cheating, #academic integrity, #proctoring, #honor code


开发者从 GitHub 迁移到 Forgejo
Developer Migrates from GitHub to Forgejo
⭐️ 8.0/10

一位开发者记录了从 GitHub 迁移到 Forgejo 的过程,理由是追求去中心化以及对仓库和数据的更大控制。 这突显了开发者日益增长的从 GitHub 等中心化平台迁移到自托管或联合替代方案的趋势,原因是对 AI 抓取、企业控制以及 Git 去中心化设计精神的担忧。 Forgejo 是一个开源的自托管 Gitforge,是 Gitea 的一个分支,支持 bug 跟踪、代码审查和持续集成等功能。作者的迁移可能涉及失去社交图谱和协作历史,但 GitSocial 等工具可以提供帮助。

hackernews · jorijn · May 13, 12:54 · 社区讨论

背景: Git 被设计为分布式版本控制系统,但 GitHub 成为了提供便利和功能的中心化平台。Forgejo 是一个开源 forge,支持自托管和联盟,符合 Git 最初的去中心化精神。它是 Gitea 的社区驱动分支,托管在 Codeberg 上。

参考链接

社区讨论: 评论讨论了联盟对去中心化 Git 托管的重要性,对 AI 抓取的担忧,以及 GitSocial 等工具用于跨 forge 协作。一些用户指出,如果不维护,GitHub 上的镜像可能会消亡。整体情绪支持去中心化。

标签: #Git, #Forgejo, #GitHub, #Self-hosting, #Open Source


Anthropic 限制 Claude 订阅的程序化调用,新增独立额度
Anthropic caps programmatic usage in Claude plans, adds separate credits
⭐️ 8.0/10

自 6 月 15 日起,Anthropic 将取消 Claude Pro 和 Max 订阅中无限制的程序化调用,改为提供少量固定月度额度用于 SDK 调用,包括 Claude Agent SDK、claude -p 以及 OpenClaw 等第三方工具。Pro 用户仅获得 20 美元额度,Max 20x 用户获得 200 美元,恰好等于其订阅费用。 这一变化消除了重度 Claude Code 用户通过在固定订阅费下运行高频 agent 工作流所享有的成本优势,迫使他们转向按量付费的 API 定价。同时,它也冲击了依赖共享订阅额度的 OpenClaw、Conductor 等第三方工具。 这些额度涵盖 Claude Agent SDK、claude -p、Claude Code GitHub Actions 以及基于 Agent SDK 的第三方应用,但不包括终端/IDE 中的交互式 Claude Code 或网页/移动端聊天。Pro: 20 美元,Max 5x: 100 美元,Max 20x: 200 美元,Team 标准: 20 美元/席位,Team 高级: 100 美元/席位。超出部分按 API 价格计费。

rss · 宝玉(@dotey) · May 13, 20:47

背景: Claude 订阅(Pro、Max、Team)为用户提供每月配额,用于交互式聊天和 Claude Code(在速率限制内)。程序化调用指通过 API、SDK 或命令行工具的自动化请求。许多开发者使用共享订阅凭证运行高强度的自动化工作流(例如通过 OpenClaw 和 Conductor 等第三方工具),从而获得远超订阅成本的价值。Anthropic 的新政策将程序化调用与交互式使用分开,并对前者设置上限。

参考链接

标签: #Claude, #Anthropic, #Subscription, #API, #Pricing


LandingAI 推出解析前页面分类 API
LandingAI's Pre-Parse Page Classification API
⭐️ 8.0/10

LandingAI 推出了 ADE Classify API,它在昂贵的文档解析之前对 PDF 进行逐页分类,为每页分配标签和推理说明。 这种方法通过只将相关页面分流到下游管线,减少算力浪费和抽取幻觉,解决了企业文档处理中的核心低效问题。 该 API 接受带有语义描述的自定义 JSON 类别列表,并发评估每一页,返回带有推理字符串的标签,并将未知页面标记为带有建议类别。

rss · meng shao(@shao__meng) · May 13, 14:31

背景: 企业文档管线经常接收到包含各种文档类型(如发票、银行流水和身份证件)的混合 PDF。传统处理方式将整个文档送入 OCR、解析和 LLM 提取,在无关页面上浪费资源,并导致抽取代理在遇到意外内容时产生错误。

参考链接

标签: #AI, #文档处理, #PDF, #API, #企业应用


警告:冒充 X 官方安全提醒的钓鱼邮件
Warning: Phishing Email Posing as X Security Alert
⭐️ 8.0/10

有用户报告收到一封冒充 X(原 Twitter)官方安全提醒的钓鱼邮件,并强烈建议不要点击任何链接。 这种钓鱼攻击可能通过诱骗用户在虚假登录页面输入凭证,导致 X 账号被劫持,进而造成账户被盗和数据泄露等严重后果。 该邮件号称来自 X 官方安全提醒,但其本身就是一封钓鱼邮件。提醒强调绝对不要点击邮件中的任何链接。

rss · meng shao(@shao__meng) · May 13, 10:30

背景: 钓鱼是一种社会工程学攻击,攻击者通过冒充可信实体来诱骗个人泄露密码等敏感信息。这些攻击已变得越来越复杂,常常模仿官方通信。此案例专门针对 X 用户,利用平台的安全提醒格式来显得合法。

参考链接

标签: #phishing, #security, #X, #Twitter, #social engineering


a16z:现有企业押注数据层,转向无头代理
a16z: Incumbents Bet on Data Layer with Headless Agents
⭐️ 8.0/10

a16z 合伙人 Seema Amble 发布分析指出,当传统系统记录(SOR)的现有企业采用无头代理时,它们押注数据层仍是价值的主要来源,而创业公司可以在专有数据、行动层所有权和真实世界执行等方面竞争。 这一观点揭示了 AI 代理架构中的根本战略分歧:现有企业保护其数据护城河,而创业公司必须在行动和执行上创新以差异化。这影响了下一代企业软件的构建方式以及谁将捕获价值。 分析将“无头代理”定义为没有用户界面、基于预定义业务信号运行的 AI 代理。它还指出,下一代系统记录将具备代理能力,捕获上下文、启动工作并记录数据副产物。

rss · a16z(@a16z) · May 13, 22:09

背景: 系统记录(SOR)是关键业务数据的权威来源,例如 CRM 存储客户数据。无头代理是一种没有图形界面的 AI 代理,通过 API 接收输入并触发行动。Salesforce 或 SAP 等现有企业拥有庞大的数据存储,而创业公司可以构建执行实际任务的代理。

参考链接

标签: #headless agents, #system of record, #data layer, #startups, #AI agents


Salesforce 无头化:数据层成为防御优势
Salesforce Headless Bet: Data Layer Defensibility
⭐️ 8.0/10

Salesforce 宣布将开放 API 并推出无头产品,押注其价值在于数据层而非用户界面。a16z 的 Seema Amble 发表分析,探讨在代理时代中防御性转向何处。 这标志着软件架构的重大转变:当 AI 代理通过 API 交互时,用户界面变得不那么重要,数据所有权成为主要护城河。企业可能需要重新思考产品策略,聚焦于数据防御优势。 无头架构将前端与后端解耦,通过 API 暴露核心服务。Salesforce 此举是更广泛行业趋势的一部分,Shopify 和 Kontent.ai 等公司也提供无头解决方案。

rss · a16z(@a16z) · May 13, 15:45

背景: 无头架构将表示层与后端分离,允许通过 API 跨多个渠道交付内容和数据。代理时代指的是 AI 代理的兴起,它们自主执行任务,通常通过 API 而非图形界面与软件交互。在这种背景下,传统以 UI 为中心的软件价值下降,而底层数据成为关键竞争优势。

参考链接

标签: #API, #Headless, #Agentic Era, #Salesforce, #Data Defensibility


Notion 发布开发者平台:CLI、Workers、Agent SDK
Notion Launches Developer Platform with CLI, Workers, Agents SDK
⭐️ 8.0/10

Notion 推出了开发者平台,包括名为 ntn 的 CLI 工具、无服务器 Workers、数据库同步、Webhooks、Agent 工具、外部 Agent API 以及 Notion Agents SDK。 这标志着 Notion 从生产力工具向构建自定义工作流和集成的完整平台的重大扩展,使开发者和 AI Agent 能够深度扩展 Notion 的功能。 该平台包括用于终端交互的 Notion CLI(ntn)、在 Notion 基础设施上运行代码的 Workers,以及用于将 Notion Agent 集成到外部应用的 Notion Agents SDK。数据库同步支持与任何数据源的双向数据同步,而 Webhooks 和外部 Agent API 则实现了事件驱动的自动化。

rss · Notion(@NotionHQ) · May 13, 18:09

背景: Notion 是一个集笔记、数据库和协作于一体的流行工作空间。此前,其 API 仅限于基本的 CRUD 操作。新的开发者平台引入了无服务器计算(Workers)、CLI 以及高级 Agent 能力,使 Notion 成为工作流自动化和 AI 集成的竞争性平台。

参考链接

标签: #Notion, #Developer Platform, #API, #Automation, #Agent Tools


Sam Altman 谈 AI 模型权衡:价格/速度 与 价格/智能
Sam Altman on AI Model Tradeoffs: Price/Speed vs Price/Intelligence
⭐️ 8.0/10

Sam Altman 发推文谈到不使用最智能 AI 模型时的焦虑,指出有时他并不介意响应慢,并建议更多关注价格/速度的权衡,而非价格/智能的权衡。 来自 OpenAI CEO 的这一见解突显了业界关于在 LLM 部署中平衡成本、速度和智能的日益激烈的讨论,可能影响开发者如何为实际应用选择模型。 该推文获得 1,614 条回复和 4,186 个赞,表明社区高度关注。Altman 特别对比了“价格/速度权衡”与“价格/智能权衡”,暗示在某些使用场景下,速度可能比原始智能更有价值。

rss · Sam Altman(@sama) · May 13, 18:17

背景: 大型语言模型(LLM),如 OpenAI 的 GPT 系列,在成本、速度和智能方面各不相同。更快的模型通常更便宜但能力较弱,而更智能的模型更贵且更慢。开发者必须根据应用需求在这些权衡中做出选择。

参考链接

标签: #AI, #LLM, #cost efficiency, #model selection, #Sam Altman


LangChain 发布 SmithDB:专为智能体可观测性设计的分布式数据库
LangChain Unveils SmithDB: Distributed DB for Agent Observability
⭐️ 8.0/10

在 Interrupt! 大会上,LangChain 宣布了 SmithDB,一个专为智能体可观测性构建的分布式数据库,声称性能提升高达 12 倍,且具备完全可移植性。 随着 AI 智能体追踪数据呈指数级增长,传统数据库在可扩展性和查询性能上遭遇瓶颈;SmithDB 解决了这一关键问题,加速了复杂智能体系统的调试与监控。 SmithDB 是 LangSmith 平台的一部分,相比现有方案性能提升高达 12 倍,并支持跨环境的完全数据可移植性。

rss · LangChain(@LangChainAI) · May 13, 20:22

背景: LangChain 是一个流行的框架,用于构建基于大语言模型(LLM)的应用程序。智能体可观测性是指监控和追踪 AI 智能体的输入、输出及内部步骤的能力,这对调试和优化至关重要。传统数据库并非为现代智能体产生的高频、多步骤追踪数据而设计,因此需要专门的存储方案。

参考链接

标签: #LangChain, #SmithDB, #Agent Observability, #Distributed Database


Inth 推出 c15t:不损害 Core Web Vitals 的 Cookie 横幅
Inth Launches c15t: Cookie Banners That Don't Hurt Core Web Vitals
⭐️ 8.0/10

Inth 发布了 c15t,这是一个开源、无头的 Cookie 横幅同意标准,旨在不影响 Core Web Vitals。它提供原生 SDK、国际化支持(i18n),并可完全定制以匹配任何网站的 UI。 Cookie 横幅常因导致布局偏移和延迟页面加载而损害 Web 性能,进而影响 Core Web Vitals 得分。c15t 提供了一个开发者友好的解决方案,在保持合规的同时不损害用户体验,对关注性能的网站很有价值。 c15t 是一个无头同意引擎,可通过 npx @c15t/cli 快速集成,并完全定制以匹配网站的品牌。它在 MIT 许可下开源,并可在 GitHub 上供社区贡献。

rss · Y Combinator(@ycombinator) · May 13, 18:00

背景: Core Web Vitals 是 Google 衡量用户体验的一组指标,包括最大内容绘制(LCP)、首次输入延迟(FID)和累积布局偏移(CLS)。许多第三方 Cookie 横幅通过引入异步脚本和布局偏移来损害 CLS。c15t 通过轻量化并直接捆绑到网站代码中来解决这个问题,从而最小化性能影响。

参考链接

社区讨论: 社区反应积极,Vercel 论坛上的开发者称 c15t 是‘我们的 Cookie 横幅祈祷得到了回应’。Y Combinator 的推文获得了大量互动,表明网络开发者对此兴趣浓厚。

标签: #web performance, #cookie banners, #open source, #Core Web Vitals, #launch


Paul Graham 谈硅谷与创业中心建设
Paul Graham on Silicon Valley and Building Startup Hubs
⭐️ 8.0/10

Paul Graham 于 2026 年 4 月 29 日在 Y Combinator 斯德哥尔摩活动上发表演讲,讨论创始人为何应迁往硅谷以及如何在其他地方建设成功的创业中心。 这些见解指导创始人理解地理集中对创业成功的重要性,并为在全球建设充满活力的创业生态系统提供了可操作的建议。 演讲包含时间戳,涵盖偶遇、硅谷投资者的速度、Dropbox 的故事以及硅谷的互助文化等话题。Graham 还探讨了斯德哥尔摩能否成为欧洲的硅谷。

rss · Y Combinator(@ycombinator) · May 13, 14:32

背景: 硅谷历来是首屈一指的创业中心,得益于其密集的投资者网络、人才以及互助文化。Paul Graham 是顶尖创业加速器 Y Combinator 的联合创始人,因此他的观点在创业界具有影响力。这场演讲是 YC 全球推广活动的一部分,旨在在硅谷之外培育创业生态系统。

标签: #startups, #silicon valley, #y combinator, #startup hubs, #paul graham


Figure 直播 F.03 人形机器人 8 小时分拣包裹
Figure Live Streams 8-Hour Shift of F.03 Robots Sorting Packages
⭐️ 8.0/10

Figure AI 正在直播其 F.03 人形机器人连续 8 小时分拣包裹,展示了在物流场景中的实际、持续自动化能力。 这一实际演示突显了人形机器人在长时间执行重复任务方面的进展,有望通过可靠的自动化改变仓库和物流运营。 直播显示多台 F.03 机器人在整个班次中分拣包裹,没有出现故障或人工干预。F.03 是 Figure 的第三代通用人形机器人,由 Helix AI 模型控制。

rss · The Rundown AI(@TheRundownAI) · May 13, 17:57

背景: Figure AI 成立于 2022 年,开发由人工智能驱动的类人机器人。F.03 是其最新一代产品,前代包括 F.01 和 F.02。该公司还开发了 Helix 视觉-语言-动作模型,可同时控制多达两台机器人。此次演示展示了在物流领域实现商业可行性的进展。

参考链接

标签: #Robotics, #Humanoid Robots, #Automation, #Logistics, #AI


Anthropic 在企业 AI 支出上超越 OpenAI
Anthropic surpasses OpenAI in enterprise AI spending
⭐️ 8.0/10

2024 年 4 月,根据 Ramp 的 AI Index 数据,Anthropic 在美国企业 AI 支出中超越 OpenAI,市场份额为 34.4%,而 OpenAI 为 32.3%。 这标志着企业 AI 领域的重大转变,表明企业越来越多地采用 Anthropic 的 Claude 模型而非 OpenAI 的 GPT 模型,并暗示注重安全的 AI 产品可能正获得更多青睐。 在过去一年中,Anthropic 的企业采用率翻了两番,而 OpenAI 仅增长了 0.3%。该数据来自企业支出管理平台 Ramp,追踪美国企业的付费 AI 订阅情况。

rss · The Rundown AI(@TheRundownAI) · May 13, 15:45

背景: Anthropic 是一家由前 OpenAI 员工创立的 AI 安全公司,以其 Claude 系列大型语言模型闻名。Ramp AI Index 通过分析其平台上的支出数据来衡量美国企业的人工智能采用情况,提供企业在哪些 AI 工具上付费的洞察。

参考链接

标签: #AI, #Enterprise, #Market Share, #Anthropic, #OpenAI


Vercel AI Gateway 揭示生产级 AI 使用趋势
Vercel AI Gateway Reveals Production AI Usage Trends
⭐️ 8.0/10

Vercel 的 AI Gateway 数据显示,Google 在生产级 AI 规模上领先,Anthropic 在编码和支出方面占主导地位,自 GPT-4o 发布以来 OpenAI 快速增长,开源模型也在逐步崛起。 这提供了罕见的生产级 AI 采用情况透明度,帮助开发者和企业就生产工作负载应使用哪些模型做出战略决策。 AI Gateway 目前处于 Beta 阶段,提供单一端点以访问多个提供商的模型,具有更高的可用性且无锁定,但 Vercel 指出其尚未准备好用于生产环境或迁移现有项目。

rss · Guillermo Rauch(@rauchg) · May 13, 21:15

背景: Vercel 是一个面向前端开发者的云平台,其 AI Gateway 是一个代理层,可将请求路由到多个 AI 提供商,提供可观测性和分析功能。CEO Guillermo Rauch 分享的数据反映了使用该网关的开发者的总体使用模式,提供了 AI 模型部署竞争格局的快照。

参考链接

标签: #AI, #Vercel, #Production AI, #AI Agents, #Industry Trends


RubricEM:基于评分引导的元强化学习策略分解
RubricEM: Meta-RL with Rubric-Guided Policy Decomposition
⭐️ 8.0/10

RubricEM 提出了一种基于评分引导的元强化学习框架,将智能体策略分解为规划、研究、审查和回答等阶段,通过分阶段策略分解和基于反思的元策略演进,实现了超越可验证奖励的学习。 该方法解决了可验证奖励在长周期任务(如研究报告生成)中的局限性——这类任务的最终答案难以直接评分——通过评分提供密集的信用分配和结构化指导。 RubricEM 将智能体策略分解为四个阶段:规划、研究、审查和回答,每个阶段由评分(rubric)引导。它还融入了基于反思的元策略演进,以在多个回合中迭代改进策略。

rss · AK(@_akhaliq) · May 13, 12:53

背景: 元强化学习旨在让智能体学会学习,从而快速适应新任务。可验证奖励适用于答案明确的场景(如数学问题),但在开放式任务(如撰写报告)中失效。评分(rubric)提供一组结构化标准来评估部分进展并引导学习,因此对复杂的长周期任务很有用。

参考链接

标签: #meta-RL, #reinforcement learning, #AI research, #policy decomposition, #machine learning


LangChain 推出 LangSmith Engine 自动分析追踪
LangChain Launches LangSmith Engine for Automated Trace Analysis
⭐️ 8.0/10

LangChain 首席执行官 Harrison Chase 宣布推出 LangSmith Engine,它是一个位于 LangSmith 追踪之上的 AI 智能体,能够自动识别问题并主动建议可执行的代码更改或添加评估器。 它通过自动化 LLM 应用的调试和评估过程,减少了人工定位根因的工作量,提升了应用可靠性,从而提高了开发效率。这使 LangSmith 在 LLM 监控领域成为更具主动性的可观测性工具。 LangSmith Engine 在后台持续运行,能够基于追踪分析提出具体的代码更改建议和新的评估器。用户可通过 smith.langchain.com 使用,且可能集成到现有的 LangSmith 工作流中。

rss · Harrison Chase(@hwchase17) · May 13, 20:17

背景: LangSmith 是一个用于构建、测试和监控 LLM 应用的平台,提供追踪、评估和调试等功能。追踪(traces)是请求在 AI 系统中流动的端到端记录,由代表各个步骤的跨度(spans)组成。此前,开发者需要手动审查追踪来发现问题;LangSmith Engine 将此分析过程自动化。

参考链接

标签: #LangSmith, #AI, #LLM, #tooling, #monitoring


企业对采用 OpenAI Codex 热情高涨
Enterprise excitement surges for OpenAI Codex adoption
⭐️ 8.0/10

OpenAI 总裁 Greg Brockman 报告称,企业对采用 Codex 表现出极大热情,引用 OpenAI 开发者发布后三小时内就有 2000 名开发者联系。 这标志着企业对 AI 驱动的编程工具需求强劲,验证了 Codex 作为自动化软件开发任务的关键平台,并可能加速企业 AI 的采用。 OpenAI 开发者指出,3 小时内就有 2000 名开发者联系,而 Brockman 的推文特别强调了企业的兴趣。到 2026 年 3 月,Codex 已拥有超过 200 万周活跃用户。

rss · Greg Brockman(@gdb) · May 13, 23:47

背景: OpenAI Codex 是一个 AI 驱动的编码智能体,可自动化软件工程任务,如功能构建、重构和迁移。截至 2026 年 3 月,它拥有超过 200 万周活跃用户,并被定位为超越编码的企业智能体平台。

参考链接

标签: #OpenAI, #Codex, #enterprise AI, #AI coding


Perplexity AI 推出具有硬件隔离沙箱的安全计算机
Perplexity AI Announces Secure Computer with Hardware-Isolated Sandboxes
⭐️ 8.0/10

Perplexity AI 宣布了一种新的计算机架构,其中每个任务都在硬件隔离的沙箱中运行,并具有 VPC 级别的存储和计算分离,代理使用短期代理令牌而非原始 API 密钥进行身份验证。 这种方法通过防止跨任务污染和降低 API 密钥泄露风险,显著增强了安全性,可能为 AI 代理平台的安全执行环境树立新标准。 沙箱使用微 VM 技术(例如 Firecracker)提供硬件级隔离,VPC 级别分离意味着每个任务的存储和计算在虚拟网络层面隔离,类似于云 VPC。

rss · Perplexity(@perplexity_ai) · May 13, 17:05

背景: 传统的沙箱依赖容器或进程,它们共享主机内核,隔离性较弱。硬件隔离沙箱(如微 VM)为每个任务启动单独的内核,提供更强的安全性。VPC 级别的分离在云计算中常用于为不同客户创建隔离的网络环境。

参考链接

标签: #security, #sandboxing, #VPC, #authentication, #Perplexity AI


Grafana Pyroscope 2.0:大规模持续性能分析
Grafana Pyroscope 2.0: Continuous Profiling at Scale
⭐️ 8.0/10

Grafana Labs 发布了 Pyroscope 2.0,这是一个重新架构的开源持续性能分析数据库,具有单一写入路径、无状态查询处理以及对 OpenTelemetry 协议 (OTLP) 的原生支持。 此版本通过降低存储成本和查询延迟,使大规模持续性能分析变得实用,并与行业向原生 OpenTelemetry 可观测性发展的趋势保持一致。 关键架构改进包括:所有分析类型的统一写入路径、降低操作复杂性的无状态查询处理,以及完整的 OTLP 数据接入,从而实现与现有 OpenTelemetry 管道的无缝集成。

rss · InfoQ · May 13, 08:00

背景: 持续性能分析是一种实时捕获应用程序性能数据(如 CPU 使用率、内存分配)的方法,不同于传统的临时分析。OpenTelemetry 协议 (OTLP) 是一种与供应商无关的标准,用于在组件之间传输遥测数据(追踪、指标、日志)。Pyroscope 2.0 基于这些概念,提供了可扩展且经济高效的分析解决方案。

参考链接

标签: #continuous profiling, #observability, #open source, #Grafana, #Pyroscope


反思 AI 中微调时代的终结
Reflecting on the End of Finetuning in AI
⭐️ 8.0/10

Latent Space 的一篇反思文章探讨了微调作为 AI 主导范式是否正在变得过时。 这一讨论挑战了对微调的传统依赖,可能会影响未来研究人员和从业者进行模型适配的方式。 文章利用一个平静的日子反思微调的发展轨迹,但摘要中并未提供具体的技术细节。

rss · Latent.Space · May 13, 02:47

背景: 微调是深度学习中的常见技术,即在特定任务上对预训练模型进行进一步训练以提高性能。最近像提示工程和检索增强生成等趋势提供了替代方案,导致一些人质疑微调的长期主导地位。

标签: #AI, #finetuning, #machine learning, #deep learning


Anthropic 与 SpaceX 合作提升 Claude AI 算力
Anthropic and SpaceX Partner to Boost Claude AI Compute Capacity
⭐️ 8.0/10

Anthropic 已签署协议,租用 SpaceX 的 Colossus 1 数据中心全部算力,获得超过 22 万块 Nvidia GPU 和 300 兆瓦以上的电力。为此,Anthropic 将 Claude Code 各付费方案的 5 小时速率限制翻倍,并取消了 Pro 和 Max 用户的高峰期限制,同时大幅提高了 Claude Opus 的 API 速率限制。 此次合作大幅扩展了 Anthropic 的算力容量,使得 Claude AI 服务能够更快扩展,并可能加速先进 AI 模型的开发。同时,这也凸显了由 SpaceX 等实体控制的大规模 GPU 集群日益增长的战略重要性。 Colossus 1 是位于田纳西州孟菲斯市的 AI 数据中心,由 SpaceX 建造,用于支持 Elon Musk 的多个企业,包括 X 和 SpaceX 本身。该协议使 Anthropic 独占整个设施的访问权,该设施包含超过 22 万块 Nvidia GPU 和超过 300 兆瓦的电力容量。

telegram · zaihuapd · May 14, 00:57

背景: Anthropic 是 Claude 系列 AI 模型的开发者,与 OpenAI 和 Google 竞争。Claude Code 是一个开发者工具,在终端中充当 AI 程序员,能够理解整个代码库并协助编码、修改和重构。与 SpaceX 的合作使 Anthropic 获得了训练和运行大语言模型所需的大幅增加的算力资源。

参考链接

标签: #Anthropic, #Claude, #算力合作, #AI, #SpaceX