2026.07.31 · AI 日报
今天最扎眼的一条,是 Anthropic 的 Claude 用 60 小时半自主研究,找到了 NIST 后量子签名候选算法 HAWK 的一处结构漏洞,直接让它被撤出标准化进程——AI 做安全研究的战斗力第一次这么直观地摆在台面上。但同一天 DeepMind 的论文泼了盆冷水:大模型能一步步推导出广义相对论,却复现不出爱因斯坦式「从矛盾里造出新理论」的那种创造力,能力强不等于能突破。另一条暗线是 OpenAI 承认此前评测框架丢了模型的推理链,修一个 API 设置就让 GPT-5.6 Sol 的 ARC-AGI-3 分数翻了近三倍——也提醒我们,现在很多「能力差距」未必是模型的锅。国内这边,字节把飞书并入豆包正面迎战腾讯 WorkBuddy,办公赛道的贴身战已经开打。今天先看这三条:Claude 破解 HAWK、DeepMind 的相对论论文、字节整合飞书豆包。
今日热点
TOP 10Gemini Robotics ER 2发布:视频理解+任务编排+多机器人协作
DeepMind发布Gemini Robotics ER 2,提升机器人视频理解、任务编排与多机器人协作能力。
AI 解读
DeepMind 发布机器人专用模型 Gemini Robotics ER 2,主打让机器人“看懂视频、会拆任务、能协作”,是具身智能从单机操作走向多机协同的一次能力跃迁。
- 核心是视频理解能力升级,机器人能从连续视觉输入中推理场景变化和物理因果,而不只是逐帧识别物体
- 新增任务编排(task orchestration)能力,支持把一个复杂指令拆解为可执行的子步骤序列
- 首次强调多机器人协作,多个机器人可基于共享的场景理解分工完成任务
- 定位是“赋能”而非“替代”,面向机器人应用开发者提供推理底座,而非终端产品
- 看点:具身智能的瓶颈一直是感知—决策—协作的闭环,ER 2 把三者打包进一个模型,若真能稳定落地,工业分拣、仓储协同等多机场景会明显受益。
本内容由 AI 生成,仅供参考,请注意甄别
Thinking Machines官方发布Inkling-Small
Thinking Machines发布Inkling-Small,276B总参12B激活,以四分之一体量达到Inkling同等性能,权重开放
AI 解读
Thinking Machines(前OpenAI首席科学家Mira Murati创办)发布Inkling-Small,用四分之一参数量复现了旗舰模型Inkling的性能,是「小模型逼近大模型」路线的又一验证。
- Inkling-Small总参数276B,激活参数仅12B,官方称性能与规模大得多的Inkling基本持平,说明在架构或训练方法上做了针对性优化而非单纯堆参数
- 官宣即开放完整模型权重,延续了该团队此前对开源社区相对友好的姿态
- 即刻可在其Tinker平台上进行微调,也可以在Tinker Playground里以文本、图像、音频多模态形式直接对话体验,说明该模型具备多模态能力
- 「Small」定位更贴近实际部署场景,四分之一参数量意味着推理成本和显存占用大幅降低,更适合企业私有化微调和低延迟场景
- 看点是Thinking Machines作为新兴实验室,正在用「高性价比小模型+开放微调工具链」的组合打法建立差异化,与其Tinker平台形成的开发者生态值得持续跟踪。
本内容由 AI 生成,仅供参考,请注意甄别
OpenAI 修复评测程序漏洞,GPT-5.6 Sol 在 ARC-AGI-3 分数暴涨近三倍
OpenAI发现评测程序此前丢弃模型私有推理链并截断上下文,仅调整两个API设置后GPT-5.6 Sol在ARC-AGI-3上的分数从13.3%涨到38.3%,且token消耗大幅降低。
AI 解读
OpenAI 复盘发现自家 GPT-5.6 Sol 模型在 ARC-AGI-3 上的低分很大程度是评测工具的锅:只调整两个 API 设置,同一模型的分数就从 13.3% 暴涨到 38.3%,暴露出评测框架(harness)设计缺陷可能长期低估模型真实能力。
- 问题根源是此前的评测程序会丢弃模型的私有推理链并截断上下文,导致模型在多轮交互中“失忆”,无法延续之前的推理成果
- 修复后模型在“高”档设置下即可达到旧版“最高”档的分数,说明此前的分数很大程度是被评测方式而非模型能力压低的
- 修复同时带来效率红利:最高档每局输出 token 从 290 万降至 49 万,token 消耗相差约 12 倍
- OpenAI 主动公开复盘细节,反映出评测方法本身正成为衡量模型能力时不可忽视的变量
- 影响:这一发现提醒行业在解读跑分榜单时要警惕评测工具本身引入的系统性偏差,同一模型换一套评测框架分数可能差出近三倍,横向比较模型能力时需格外谨慎。
本内容由 AI 生成,仅供参考,请注意甄别
微软对Anthropic投资获利32亿美元,OpenAI投资减记6亿
微软财报披露对Anthropic投资单季获利32亿美元,对OpenAI投资则减记6亿美元。
AI 解读
微软最新财报罕见披露了对两大AI巨头投资的季度回报,数字对比鲜明——押注Anthropic这一季就赚了32亿美元,对OpenAI的投资却被减记6亿美元。
- 微软2025年11月向Anthropic投资50亿美元,同时Anthropic承诺采购300亿美元Azure云服务;本季度这笔投资带来32亿美元收益,规模已接近微软对OpenAI投资全年的收益体量
- 微软对OpenAI的投资本季度被下调约6亿美元账面价值,拖累每股收益约7美分;但拉长到整个2026财年看,OpenAI投资仍带来50亿美元收益,全年每股收益因此增厚67美分
- 微软目前持有OpenAI约27%股份,双方还有营收分成安排,但具体分成金额未披露
- 微软整体盘子很大,单季营收900亿美元、净利润358亿美元,两笔AI投资的波动对集团财务影响有限,更多是风向标意义
- 这组数字侧面印证了资本市场对Anthropic当期表现势头强于OpenAI,值得关注后续几个季度这一收益差是否持续,以及是否影响微软在两家之间的资源倾斜。
本内容由 AI 生成,仅供参考,请注意甄别
Anthropic:Claude发现HAWK致命缺陷,60小时攻破NIST后量子签名候选算法
Anthropic 称 Claude Mythos Preview 用 60 小时半自主研究找到 NIST 后量子签名候选算法 HAWK 的格结构对称性漏洞,密钥恢复计算成本从 2^64 降至 2^38,该算法次日被开发者从标准化进程撤回。
AI 解读
Anthropic 披露 Claude 最新预览模型在密码学攻防上取得突破性进展:一次攻破直接让 NIST 后量子签名候选算法 HAWK 被撤回标准化流程,同时大幅提速了对简化版 AES-128 的攻击,标志着大模型开始具备独立发现密码学漏洞的实战能力。
- 针对 HAWK-256 的密钥恢复攻击,Claude 用约 60 小时半自主工作找到格结构中此前未被发现的对称性,把计算成本从 2⁶⁴降到 2³⁸,直接把有效密钥强度砍半
- 该发现提交 NIST 论坛一小时内即被官方密码学家确认有效,次日 HAWK 开发者主动撤回该算法
- 针对 7 轮简化版 AES-128,Claude 独立提出名为“Möbius Bridge”的新指纹技术,把攻击速度提升 200-800 倍,不过仍需约 2¹⁰⁵次选择明文,尚不具备现实威胁
- 两项攻击均不影响任何在产系统,且模型一度拒绝尝试 AES 攻击,靠研究人员反复引导才突破,过程消耗约 10 万美元 API 成本
- Anthropic 同步公布多个密码算法的初步攻击成果,并联合高校推出 CryptanalysisBench 基准,推动学界系统评估大模型的密码分析能力
- 影响:这不只是一次模型能力秀,而是给整个后量子密码标准化进程敲响警钟——AI 辅助密码分析可能比人工评审更快找到设计缺陷,未来标准候选算法或需把“抗 AI 攻击”纳入评审项。
本内容由 AI 生成,仅供参考,请注意甄别
DeepMind 论文:大语言模型能推导广义相对论,但无法发明它
DeepMind论文指出大模型能演绎推导广义相对论,但缺乏爱因斯坦式概念冲突驱动的溯因创新能力。
AI 解读
DeepMind这篇立场论文给“AI能否做科学发现”泼了盆冷水:大模型能沿着已知理论把公式推到底,却造不出爱因斯坦式的概念跃迁。
- 科学发现被拆成归纳、演绎、溯因三步,论文认为当前大语言模型只擅长前两步——从数据里找规律、把规律往前推演
- 以广义相对论为例:牛顿引力体系本身几乎不产生“预测出错”的经验误差信号,单纯靠压缩数据、拟合误差驱动的模型很难自然长出指向广义相对论的梯度
- 真正把爱因斯坦推向新理论的,是概念框架内部的矛盾(比如引力与狭义相对论不兼容)和思想实验,而不是数据拟合得不够好
- 这意味着“更大模型+更多数据就能自动发现新物理”的乐观预期缺乏依据,溯因推理(在没有明确误差信号时提出全新假设)可能是当前范式的结构性短板
- 对判断AI科研能力的边界很关键——它提醒行业,评测大模型“像不像科学家”不能只看它能不能复现已知结论,还要看它能不能在无明确纠错信号时主动提出新框架。
本内容由 AI 生成,仅供参考,请注意甄别
智能体 AI 助力神经退行性疾病的规模化诊断与照护
论文探讨用智能体 AI 系统扩大神经退行性疾病的诊断与照护规模。
AI 解读
这篇发表于 Nature Aging 子刊的研究探讨如何用智能体式 AI(Agentic AI)解决神经退行性疾病(如阿尔茨海默病、帕金森病)诊断与照护难以规模化的痛点,把 AI 从单点辅助诊断工具升级为可自主执行多步骤任务的照护系统。
- 聚焦神经退行性疾病诊断链条长、依赖专科医生资源稀缺的现实瓶颈,智能体架构被用来串联问诊、检测、随访等多环节
- 智能体式设计的核心优势在于能自主规划和执行一系列诊疗相关任务,而非像传统 AI 工具那样只完成单一预测或分类
- 论文视角面向“规模化”,即如何让诊断与照护能力覆盖更多基层和资源匮乏地区,而非仅停留在旗舰医院的示范项目
- 属于交叉学科前沿探索,反映医疗 AI 正从辅助诊断向自主执行的智能体范式迁移
- 看点:如果智能体式诊疗真能在真实医疗系统中验证有效,将为老龄化社会应对认知类疾病的照护资源缺口提供一条可复制路径,值得关注后续落地案例和监管态度。
本内容由 AI 生成,仅供参考,请注意甄别
苹果发布 MoMo:用时空动作分词实现机器人操作模式切换
苹果发布MoMo框架,让机器人通过时空动作分词学习可复用的动作模式,实现跨任务操作方式切换。
AI 解读
苹果研究团队发布 MoMo,尝试解决机器人操作里一个常被忽略的问题:同一个任务在不同场景下该用什么样的“动作节奏”去执行,这种执行层面的变化能不能像技能一样被复用。
- MoMo 是两阶段模仿学习框架,先用时空动作分词器把动作切成可复用的片段,再用行为克隆 Transformer 学习执行
- 模型输入除了任务描述,还多了一个连续的“动作模式”条件变量,用来调节动作的节奏与风格
- 在六个真实机器人操作任务上验证,调节该条件能让同一策略稳定切换出不同的执行方式
- 核心思路是把“怎么做”和“做什么”解耦,让动作风格成为跨任务共享的独立因子
- 看点:比起堆更多任务数据,这种把执行模式抽出来单独建模的路子,可能是让机器人策略更泛化、更好迁移的一条捷径。
本内容由 AI 生成,仅供参考,请注意甄别
Gemini Robotics 2发布,机器人可推理协作完成复杂任务
谷歌发布Gemini Robotics 2,机器人可对每步动作推理规划,完成系鞋结等复杂协作任务
AI 解读
谷歌DeepMind发布Gemini Robotics 2系列模型,核心突破是让机器人具备「推理式动作规划」能力,能完成打精细绳结这类此前难以实现的复杂任务,并支持多机器人协作。
- 定位为「一个大脑,适配任意机器人本体」的通用具身智能方案,面向人形机器人提供全身智能、精细操作、多机协同等能力
- 关键能力是让机器人在执行每一个动作前先做推理规划,而不是依赖固定动作库或简单的视觉-动作映射,因此能应对打结这类需要多步骤精细协调的任务
- 新增「多机器人协同解决复杂工作流」能力,意味着任务可以被拆解到多个机器人之间分工完成,而非单机独立作业
- DeepMind CEO Demis Hassabis亲自发文祝贺机器人团队,显示这是公司在具身智能方向的重点投入成果
- 看点是具身智能正从「感知+简单抓取」向「长程任务推理+多智能体协作」演进,谷歌若能把Gemini的推理能力真正下沉到物理世界,将对人形机器人商业化进程形成实质推动。
本内容由 AI 生成,仅供参考,请注意甄别
降维遇上网络科学:在 UMAP 的 kNN 图上做数据洞察
研究提出挖掘 UMAP 内部构建的 kNN 图(而非仅看降维结果),用 PageRank、k-核分解等图算法辅助数据洞察。
AI 解读
这篇研究提醒大家:大家常用 UMAP 只看它输出的二维可视化图,却忽略了它内部真正建的那张高维 kNN(k近邻)图——这张图才是数据结构的原始记录,没被降维压扁变形,拿它跑经典图算法能挖出可视化图看不到的洞察。
- UMAP 在做降维投影前,会先在原始高维空间构建一张 kNN 图来描述数据流形,这一步历来被当作「中间产物」直接丢弃
- 用 PageRank 跑这张 kNN 图,可以找出数据集里最具代表性的样本点
- 用 k-core 分解可以揭示数据中密度不同的核心区域,帮助定位「核心簇」与边缘噪声
- 研究整体在提示:标准图算法搬到 UMAP 的内部图上,是一条被低估的数据探索路径
- 对做数据分析、聚类或异常检测的团队来说,这是一个几乎零成本的补充手段——不用换工具,只是把 UMAP 已经算好但一直没用上的中间图拿出来再挖一次。
本内容由 AI 生成,仅供参考,请注意甄别
模型发布/更新
MODEL RELEASES8 篇Gemini Robotics ER 2发布:视频理解+任务编排+多机器人协作
DeepMind发布Gemini Robotics ER 2,提升机器人视频理解、任务编排与多机器人协作能力。
AI 解读
DeepMind 发布机器人专用模型 Gemini Robotics ER 2,主打让机器人“看懂视频、会拆任务、能协作”,是具身智能从单机操作走向多机协同的一次能力跃迁。
- 核心是视频理解能力升级,机器人能从连续视觉输入中推理场景变化和物理因果,而不只是逐帧识别物体
- 新增任务编排(task orchestration)能力,支持把一个复杂指令拆解为可执行的子步骤序列
- 首次强调多机器人协作,多个机器人可基于共享的场景理解分工完成任务
- 定位是“赋能”而非“替代”,面向机器人应用开发者提供推理底座,而非终端产品
- 看点:具身智能的瓶颈一直是感知—决策—协作的闭环,ER 2 把三者打包进一个模型,若真能稳定落地,工业分拣、仓储协同等多机场景会明显受益。
本内容由 AI 生成,仅供参考,请注意甄别
Thinking Machines官方发布Inkling-Small
Thinking Machines发布Inkling-Small,276B总参12B激活,以四分之一体量达到Inkling同等性能,权重开放
AI 解读
Thinking Machines(前OpenAI首席科学家Mira Murati创办)发布Inkling-Small,用四分之一参数量复现了旗舰模型Inkling的性能,是「小模型逼近大模型」路线的又一验证。
- Inkling-Small总参数276B,激活参数仅12B,官方称性能与规模大得多的Inkling基本持平,说明在架构或训练方法上做了针对性优化而非单纯堆参数
- 官宣即开放完整模型权重,延续了该团队此前对开源社区相对友好的姿态
- 即刻可在其Tinker平台上进行微调,也可以在Tinker Playground里以文本、图像、音频多模态形式直接对话体验,说明该模型具备多模态能力
- 「Small」定位更贴近实际部署场景,四分之一参数量意味着推理成本和显存占用大幅降低,更适合企业私有化微调和低延迟场景
- 看点是Thinking Machines作为新兴实验室,正在用「高性价比小模型+开放微调工具链」的组合打法建立差异化,与其Tinker平台形成的开发者生态值得持续跟踪。
本内容由 AI 生成,仅供参考,请注意甄别
OpenAI 发布 GPT-5.6,推动性价比前沿再进一步
OpenAI 推出 GPT-5.6,以更低价格和更高效率面向企业级 AI 工作流部署。
AI 解读
OpenAI 把 GPT-5.6 的推理效率提升直接兑现成降价和提速,这次调整不是模型能力升级,而是同一批模型「变得更便宜更快」,对已经在跑 AI 应用的企业是实打实的成本利好。
- 面向高并发场景的 Luna 直接降价 80%,面向日常工作的 Terra 降价 20%,两者在 Codex 与 ChatGPT Work 的订阅计费口径里同步生效
- Luna 定位「极致性价比」,号称达到一年前顶尖模型的水平,但单任务成本只要约 6 美分,速度快近 9 倍,支持工具调用和多步骤流程
- API 新增 Fast mode 取代原来的 Priority Processing,GPT-5.6 Sol 用 Fast mode 最高提速 2.5 倍、价格翻倍,智力不变,且向后兼容(原 priority 标记自动切换)
- 官方点名对比:在 Agents' Last Exam 专业任务测试中,Luna 的单任务成本比 Fable 5 低近 99%
- 这类调价本质是把「同等质量、更低单价」变成默认选项,企业该做的是重新跑一遍成本-质量评估,把工作流里能降级到 Luna/Fast mode 的环节切下去,而不是继续为不必要的算力买单。
本内容由 AI 生成,仅供参考,请注意甄别
Gemini Robotics 2发布,机器人可推理协作完成复杂任务
谷歌发布Gemini Robotics 2,机器人可对每步动作推理规划,完成系鞋结等复杂协作任务
AI 解读
谷歌DeepMind发布Gemini Robotics 2系列模型,核心突破是让机器人具备「推理式动作规划」能力,能完成打精细绳结这类此前难以实现的复杂任务,并支持多机器人协作。
- 定位为「一个大脑,适配任意机器人本体」的通用具身智能方案,面向人形机器人提供全身智能、精细操作、多机协同等能力
- 关键能力是让机器人在执行每一个动作前先做推理规划,而不是依赖固定动作库或简单的视觉-动作映射,因此能应对打结这类需要多步骤精细协调的任务
- 新增「多机器人协同解决复杂工作流」能力,意味着任务可以被拆解到多个机器人之间分工完成,而非单机独立作业
- DeepMind CEO Demis Hassabis亲自发文祝贺机器人团队,显示这是公司在具身智能方向的重点投入成果
- 看点是具身智能正从「感知+简单抓取」向「长程任务推理+多智能体协作」演进,谷歌若能把Gemini的推理能力真正下沉到物理世界,将对人形机器人商业化进程形成实质推动。
本内容由 AI 生成,仅供参考,请注意甄别
Inkling-Small开源:276B总参12B激活,性能持平四倍大模型
Thinking Machines开源Inkling-Small,276B总参12B激活,性能持平四倍规模的Inkling
AI 解读
Thinking Machines 开源了 Inkling-Small,总参数 276B、实际激活仅 12B,却在只有 Inkling 四分之一规模的情况下做到了性能相当,权重已完全开放,并且可以直接在 Tinker 平台微调或试用。
- 采用稀疏激活架构,276B 总参数中只有 12B 参与实际计算,大幅降低推理成本
- 官方给出的对比是“四分之一规模,性能持平”原版 Inkling 模型
- 完整权重开源,不是仅开放推理接口,便于社区二次训练和研究
- 即日起可在 Tinker 平台上直接微调,或在 Tinker Playground 中以文本、图像、音频多模态方式体验
- 属于 Thinking Machines(Mira Murati 创立的实验室)持续推进开放权重模型的又一步
- 用四分之一参数规模做到相近效果,对成本敏感、想要私有化部署或微调的团队是个有吸引力的选择,也进一步说明“稀疏激活+知识蒸馏”路线在中大型模型上的性价比优势正在被验证。
本内容由 AI 生成,仅供参考,请注意甄别
微软 MAI-Cyber-1-Flash 以更低成本刷新安全评测榜首
微软AI CEO称其MAI-Cyber-1-Flash模型在Cyberbench安全评测中以Mythos一半的成本夺得第一,领先第二名12个百分点。
AI 解读
微软 AI 负责人 Mustafa Suleyman 公布的这条消息,聚焦的是网络安全垂直评测榜单上的一次“低成本反超”,反映出 MAI 系列模型在效率而非单纯堆算力上的差异化打法。
- MAI-Cyber-1-Flash 模型在网络安全评测基准 Cyberbench 上拿下第一名
- 领先第二名(此前榜首模型 Mythos)达 12 个百分点,优势幅度不小
- 更值得关注的是成本,该模型只用了 Mythos 一半的成本就实现了这一成绩
- 消息由微软 AI CEO 本人直接在社交平台公布,属于官方主动释放的竞争力信号
- 看点:在网络安全这类专业垂直场景,“更便宜但更强”正成为新的竞争维度,如果 MAI-Cyber-1-Flash 的性价比表现能持续验证,可能会给企业级安全 AI 工具的采购逻辑带来新的比价标准。
本内容由 AI 生成,仅供参考,请注意甄别
英伟达 Cosmos3 蒸馏版登顶开源文生图/视频榜首
英伟达Cosmos3-Super-4Step蒸馏模型将推理步数降至4步,登顶开源图生视频榜首
AI 解读
英伟达发布的 Cosmos3-Super-4Step 蒸馏模型登顶开源文生图/文生视频排行榜,用「压步数」的方式把推理成本砍掉一大截,值得关注的是这次提速没有明显牺牲生成质量。
- 该模型把文生图所需的推理步数从 50 步压缩到 4 步,图生视频从 35 步压缩到 4 步,压缩比接近 10 倍。
- 同时去除了「无分类器引导」(classifier-free guidance)机制,进一步减少每步计算开销,是推理侧的双重优化而非单纯裁剪参数。
- 榜单成绩显示该蒸馏版在图生视频任务上排名第一、文生图任务上排名第三,属于开源权重模型中的第一梯队。
- 蒸馏技术路线延续了英伟达 Cosmos 系列面向具身智能和世界模型的定位,推理提速直接决定了它能否用于实时或大规模生成场景。
- 看点:对做本地部署或私有化生成服务的团队而言,4 步出图/出视频意味着显存和延迟成本大幅下降,是开源生成模型「实用化」的又一个信号。
本内容由 AI 生成,仅供参考,请注意甄别
xAI发布最强语音模型Grok Voice Think Fast 2.0
马斯克旗下发布语音模型Grok Voice Think Fast 2.0,主打语音推理与工具调用能力升级。
AI 解读
马斯克旗下 xAI 发布语音对语音模型 Grok Voice Think Fast 2.0,官方称其为迄今最强语音模型,主打推理与转录能力同步提升,并计划 8 月 5 日全面升级现有语音服务,值得关注语音交互赛道的最新竞争动态。
- 定价为每分钟音频 0.08 美元(约合人民币 0.54 元),8 月 5 日起 grok-voice-latest 模型将从 1.0 版本升级至 2.0 版本。
- 模型主打语音推理、转录准确性、对话能力与工具调用可靠性的综合提升;据 Artificial Analysis 基准测试,语音到语音质量指数从 75.7% 提升至 82.9%,提高 7.2 个百分点。
- xAI 强调模型可以边说话边完成推理,不需要额外增加延迟来换取推理能力,同时减少每次回复所需的推理 token 数量,工具调用往往在智能体说完第一句话前就已完成。
- 在覆盖数千条短语、24 种语言的内部评测中,转录表现较 Deepgram Nova 3、ElevenLabs Scribe v2 提升 1.5~2 倍,较自家 1.0 版本提升 1.4 倍;在背景噪声和电话压缩场景下,与专用语音转文字模型的差距最高可拉开约 10 倍。
- 看点:语音交互正从「能听懂」向「低延迟、强推理、强鲁棒性」的实用化阶段推进,xAI 用低延迟推理+低价定价组合发力,可能加剧语音助手赛道在成本和体验两端的竞争。
本内容由 AI 生成,仅供参考,请注意甄别
产品发布/更新
PRODUCT LAUNCHES8 篇Sam Altman官宣GPT-5.6大幅降价,Luna降幅达80%
Sam Altman宣布GPT-5.6全系大幅降价,Luna降80%,Terra降20%,Sol新增2.5倍速Fast模式
AI 解读
OpenAI CEO Sam Altman宣布GPT-5.6系列大幅降价,其中面向轻量场景的Luna版本降幅高达80%,反映出大模型价格战正在向纵深推进。
- GPT-5.6 Luna(推测为轻量/低成本档位)降价80%,降至每百万输入token 0.20美元、每百万输出token 1.20美元,已逼近行业最低价区间
- GPT-5.6 Terra(推测为中间档位)降价20%,输入输出价格分别降至2美元和12美元每百万token
- GPT-5.6 Sol(推测为高智能档位)在API中新增Fast模式,推理速度提升至2.5倍,但价格同步翻倍,智能水平保持不变——即用更高单价换取低延迟场景的可用性
- 三档差异化调价(降价走量的Luna、性价比的Terra、高速高价的Sol Fast)显示OpenAI在用价格杠杆精细划分应用场景,而非一刀切降价
- 看点是Luna 80%的降幅力度罕见,大概率是对Gemini、DeepSeek等低价竞品的正面回应,中小开发者和高并发应用的调用成本门槛将进一步降低,值得评估迁移收益。
本内容由 AI 生成,仅供参考,请注意甄别
Gemini Robotics ER 2 发布,专为物理AI设计
谷歌发布具身推理模型Gemini Robotics ER 2,可接入Live API实时指挥机器人动作、跟踪进度并检测执行故障。
AI 解读
谷歌发布 Gemini Robotics ER 2,专为“具身推理”打造,定位是机器人的高级大脑,值得关注它把语言模型的推理能力真正接到了物理动作层。
- 直连 Gemini Live API,可持续处理视频流,而不是单帧静态识别
- 能实时跟踪任务进度、按需调用工具、联网搜索,再指挥底层动作模型执行
- 面向开发者新增“执行中故障检测”,机器人做错动作时能被及时发现
- 支持多机器人协作调度,不再局限于单机作业
- 强化了安全指令遵循,降低失控风险
- 看点:这标志着谷歌把 Gemini 的“大脑”与机器人的“身体”做了更紧密的实时闭环,是具身智能从演示走向可控部署的重要一步。
本内容由 AI 生成,仅供参考,请注意甄别
MCP协议迎最大更新:无状态化扫清企业落地障碍
MCP协议发布史上最大更新,核心改为无状态化,不再依赖单实例会话,扫清企业级扩展的主要障碍。
AI 解读
AI 系统对接外部工具和数据的开放标准 MCP(Model Context Protocol)迎来自发布以来最大一次更新,核心变化是协议底层转为无状态化,直接针对性解决了此前企业级落地中最大的规模化障碍。
- 此前 MCP 请求依赖绑定在具体服务器实例上的会话状态,导致难以做负载均衡和弹性扩容,这次更新把协议核心改为无状态
- 无状态化后,请求不再依赖特定服务器实例,理论上可以像普通无状态 API 一样水平扩展,更贴近企业生产环境的部署习惯
- 该规范由 MCP 主要维护者、均任职于 Anthropic 的 David Soria Parra 和 Den Delimarsky 联合撰写博文宣布
- 这是 MCP 从“工具生态起步阶段的协议”向“可支撑企业级规模部署的标准”迈出的关键一步
- 影响:MCP 已成为连接 AI 与外部工具的事实标准之一,此次无状态化改造扫清了此前企业采用时最主要的架构顾虑,预计会加速更多企业级 Agent 平台基于 MCP 做规模化部署。
本内容由 AI 生成,仅供参考,请注意甄别
GitHub Copilot App 支持堆叠会话与关联 PR 工作流
GitHub Copilot App 新增堆叠会话功能,支持同仓库多个任务串联执行并关联 PR 工作流。
AI 解读
GitHub 用一个真实案例讲清了 Copilot App 新增的「堆叠会话」(stacked sessions)和关联 PR 工作流是什么:同一仓库里一连串互相承接的任务会话,前一个的产出是后一个的起点,让 AI 接手那种「一次做不完但又非常琐碎」的大型改造工作成为可能。
- 案例是作者一个 2014 年老项目,前端还停留在 React 15 + Less + 老版 react-bootstrap,过去自己动手重构评估要花几周,权衡下来一直搁置
- 用 GitHub Copilot App 尝试一次性(one-shot)完成现代化改造未成功,于是转为 Plan 模式,先让 AI 生成迁移方案(Tailwind/纯 CSS 选型、去 Less、可访问性与响应式清理)
- 关键设计是「堆叠会话」:把大任务拆成多个先后承接的会话,每个会话在上一个的产出基础上继续推进,而不是一个巨型会话硬扛到底
- 配合关联 PR 工作流,每个阶段性会话可以对应独立可审查的 PR,方便分阶段合并和回滚
- 对长期维护老旧代码库、又没有团队人力做大重构的个人开发者来说,这种「拆解+承接」的会话模式,比指望 AI 一次性搞定复杂改造更现实,也更符合渐进式重构的工程直觉。
本内容由 AI 生成,仅供参考,请注意甄别
llm-chat-completions-server 0.1a0 发布
llm-chat-completions-server发布0.1a0版本,支持OpenAI风格的多轮对话请求接口。
AI 解读
Simon Willison 放出 llm-chat-completions-server 0.1a0,是给他自己的 llm 命令行工具配的一个小插件,核心是把本地已安装的所有模型统一包装成 OpenAI Chat Completions 兼容接口。
- 起因是 llm 0.32rc1 引入了内容寻址日志,消息按哈希去重存储,天然适合处理“越聊越长”的多轮对话
- 插件启动后会在本地开一个端口,把 llm 装的所有模型插件都暴露成标准 Chat Completions 接口
- 用 curl 就能像调用 OpenAI API 一样调用本地任意模型,兼容现有生态工具链
- 作者提到整个插件是让 GPT-5.6 Sol 写出来的,因为它对该 API 格式非常熟悉
- 看点:小工具但很实用,相当于给本地多模型环境加了一层标准化“翻译层”,方便接入原本只认 OpenAI 接口的第三方工具。
本内容由 AI 生成,仅供参考,请注意甄别
llm 0.32rc1 发布,支持内容寻址消息与对话分叉
llm 0.32rc1发布,引入内容寻址消息存储,支持去重及对话分叉树结构。
AI 解读
llm 0.32rc1 是 Simon Willison 的命令行 LLM 工具的一次重要架构升级,收尾了从 0.32a0 就开始的存储层重构,核心是换了一套更彻底的对话记录方案。
- 最大变化是消息存储改用内容寻址的哈希 ID,同样内容的消息片段在数据库里只存一份
- 这套设计天然支持“对话分叉”,可以把多轮对话表示成树状结构而不是线性记录
- 涉及较大的表结构变更,官方特别提醒升级前先用 llm logs backup 备份现有 logs.db
- 顺带新增了对 gpt-5.6-sol、gpt-5.6-terra、gpt-5.6-luna 三个新模型的支持
- 看点:对话分叉+去重存储,解决的是长期用命令行工具管理大量模型对话时数据库膨胀、无法复用分支的实际痛点,是给重度用户的基础设施升级。
本内容由 AI 生成,仅供参考,请注意甄别
新加坡 Agnes AI 发布低价推理模型 Agnes 2.5 Pro Alpha
新加坡Agnes AI发布低价推理模型Agnes 2.5 Pro Alpha,支持文本图像视频输入,Intelligence Index得分39,定价为同智能水平专有模型中最低之一。
AI 解读
新加坡 AI 实验室 Agnes AI 发布低价推理模型 Agnes 2.5 Pro Alpha,主打“智能与价格的性价比”,在 Artificial Analysis Intelligence Index 上拿到 39 分的同时,把价格压到同智能水平专有模型中的最低区间之一。
- 模型支持文本、图像、视频三种输入模态,定位是一款多模态推理模型而非纯文本模型
- 定价为每百万输入 token 0.45 美元、每百万输出 token 0.90 美元,显著低于同智能档位的主流闭源模型
- 官方给出的 Intelligence Index 得分为 39,意味着在权威第三方评测体系下具备可对标的中上游推理能力
- 新加坡作为发布地,反映出东南亚 AI 实验室开始在“高性价比推理模型”这一细分赛道主动参与全球竞争
- 影响:随着更多区域性实验室加入低价推理模型的价格战,开发者在中等智能需求场景下的模型选择成本将进一步下降,也会给头部厂商的定价策略带来新压力。
本内容由 AI 生成,仅供参考,请注意甄别
Google Earth 接入 Nano Banana 2 图像生成功能
Google Earth网页版接入Nano Banana 2图像生成,可用文本提示重现历史或想象未来场景
AI 解读
Google Earth 网页版接入了 Nano Banana 2 图像生成能力,用户现在可以直接用文字提示词,把卫星影像和 3D 场景结合起来“改写”地球上任意地点的样貌,这个功能已经面向所有用户开放。
- 用户输入提示词,系统会基于当地的卫星与 3D 影像生成对应的想象画面
- 官方给出的示例包括“还原百年前某座城市的街景”“在社区里想象一个新篮球场建成后的样子”
- 功能定位偏娱乐和创意可视化,而非精确的历史复原或城市规划工具
- 面向 Google Earth 网页版全体用户直接开放,不需要额外申请或付费
- 这是生成式图像模型和地理信息产品结合的一个直观案例,把 Nano Banana 2 的图像生成能力嫁接到用户熟悉的真实地理场景里,降低了“用 AI 想象未来/过去”的使用门槛,也为地图类产品增加了新的内容消费场景。
本内容由 AI 生成,仅供参考,请注意甄别
行业动态
INDUSTRY8 篇Anthropic:Claude发现HAWK致命缺陷,60小时攻破NIST后量子签名候选算法
Anthropic 称 Claude Mythos Preview 用 60 小时半自主研究找到 NIST 后量子签名候选算法 HAWK 的格结构对称性漏洞,密钥恢复计算成本从 2^64 降至 2^38,该算法次日被开发者从标准化进程撤回。
AI 解读
Anthropic 披露 Claude 最新预览模型在密码学攻防上取得突破性进展:一次攻破直接让 NIST 后量子签名候选算法 HAWK 被撤回标准化流程,同时大幅提速了对简化版 AES-128 的攻击,标志着大模型开始具备独立发现密码学漏洞的实战能力。
- 针对 HAWK-256 的密钥恢复攻击,Claude 用约 60 小时半自主工作找到格结构中此前未被发现的对称性,把计算成本从 2⁶⁴降到 2³⁸,直接把有效密钥强度砍半
- 该发现提交 NIST 论坛一小时内即被官方密码学家确认有效,次日 HAWK 开发者主动撤回该算法
- 针对 7 轮简化版 AES-128,Claude 独立提出名为“Möbius Bridge”的新指纹技术,把攻击速度提升 200-800 倍,不过仍需约 2¹⁰⁵次选择明文,尚不具备现实威胁
- 两项攻击均不影响任何在产系统,且模型一度拒绝尝试 AES 攻击,靠研究人员反复引导才突破,过程消耗约 10 万美元 API 成本
- Anthropic 同步公布多个密码算法的初步攻击成果,并联合高校推出 CryptanalysisBench 基准,推动学界系统评估大模型的密码分析能力
- 影响:这不只是一次模型能力秀,而是给整个后量子密码标准化进程敲响警钟——AI 辅助密码分析可能比人工评审更快找到设计缺陷,未来标准候选算法或需把“抗 AI 攻击”纳入评审项。
本内容由 AI 生成,仅供参考,请注意甄别
摩根士丹利牵头,谷歌担保,为 Anthropic 数据中心筹措150亿美元债务融资
摩根士丹利牵头银行团,为Anthropic在得州的数据中心项目筹集150亿美元债务融资,谷歌提供担保。
AI 解读
摩根士丹利牵头银团,正在为Anthropic在得克萨斯州的一个数据中心项目筹措高达150亿美元的债务融资,谷歌为该笔债务提供担保,显示AI基础设施的资本运作正从股权融资转向更大规模的杠杆化债务工具。
- 融资规模达150亿美元且以债务形式而非股权稀释完成,说明Anthropic在保持股权结构相对稳定的同时,借助合作伙伴信用为算力扩张融资
- 谷歌作为担保方(backstop)承担信用背书角色,这与谷歌本身是Anthropic重要股东和云服务供应商的双重身份高度绑定,谷歌实质上在用自身资产负债表为Anthropic的算力扩张兜底
- 项目落地在得州,延续了近年AI巨头把数据中心向电力和土地成本更低的美国中南部州转移的趋势
- 摩根士丹利领衔银团意味着传统华尔街投行正深度介入AI基础设施的债务融资市场,这类交易的复杂度和规模已接近传统能源、电信基建项目
- 看点是「云厂商担保AI实验室借债建数据中心」的模式若成为行业惯例,意味着谷歌、微软等云巨头正把自身信用杠杆化投入AI军备竞赛,这类隐性负债敞口值得持续关注。
本内容由 AI 生成,仅供参考,请注意甄别
OpenAI 修复评测程序漏洞,GPT-5.6 Sol 在 ARC-AGI-3 分数暴涨近三倍
OpenAI发现评测程序此前丢弃模型私有推理链并截断上下文,仅调整两个API设置后GPT-5.6 Sol在ARC-AGI-3上的分数从13.3%涨到38.3%,且token消耗大幅降低。
AI 解读
OpenAI 复盘发现自家 GPT-5.6 Sol 模型在 ARC-AGI-3 上的低分很大程度是评测工具的锅:只调整两个 API 设置,同一模型的分数就从 13.3% 暴涨到 38.3%,暴露出评测框架(harness)设计缺陷可能长期低估模型真实能力。
- 问题根源是此前的评测程序会丢弃模型的私有推理链并截断上下文,导致模型在多轮交互中“失忆”,无法延续之前的推理成果
- 修复后模型在“高”档设置下即可达到旧版“最高”档的分数,说明此前的分数很大程度是被评测方式而非模型能力压低的
- 修复同时带来效率红利:最高档每局输出 token 从 290 万降至 49 万,token 消耗相差约 12 倍
- OpenAI 主动公开复盘细节,反映出评测方法本身正成为衡量模型能力时不可忽视的变量
- 影响:这一发现提醒行业在解读跑分榜单时要警惕评测工具本身引入的系统性偏差,同一模型换一套评测框架分数可能差出近三倍,横向比较模型能力时需格外谨慎。
本内容由 AI 生成,仅供参考,请注意甄别
微软对Anthropic投资获利32亿美元,OpenAI投资减记6亿
微软财报披露对Anthropic投资单季获利32亿美元,对OpenAI投资则减记6亿美元。
AI 解读
微软最新财报罕见披露了对两大AI巨头投资的季度回报,数字对比鲜明——押注Anthropic这一季就赚了32亿美元,对OpenAI的投资却被减记6亿美元。
- 微软2025年11月向Anthropic投资50亿美元,同时Anthropic承诺采购300亿美元Azure云服务;本季度这笔投资带来32亿美元收益,规模已接近微软对OpenAI投资全年的收益体量
- 微软对OpenAI的投资本季度被下调约6亿美元账面价值,拖累每股收益约7美分;但拉长到整个2026财年看,OpenAI投资仍带来50亿美元收益,全年每股收益因此增厚67美分
- 微软目前持有OpenAI约27%股份,双方还有营收分成安排,但具体分成金额未披露
- 微软整体盘子很大,单季营收900亿美元、净利润358亿美元,两笔AI投资的波动对集团财务影响有限,更多是风向标意义
- 这组数字侧面印证了资本市场对Anthropic当期表现势头强于OpenAI,值得关注后续几个季度这一收益差是否持续,以及是否影响微软在两家之间的资源倾斜。
本内容由 AI 生成,仅供参考,请注意甄别
OpenAI启动ChatGPT学术研究计划,免费向10万科学家开放Pro版功能
OpenAI启动学术研究计划,向10万名科研人员免费开放ChatGPT高级功能。
AI 解读
OpenAI推出一项新计划,向全球10万名科学家免费提供ChatGPT Pro版功能,旨在推动学术研究。
- 计划名为“ChatGPT for Academic Researchers”,通过官网申请加入。
- 初期面向部分高校1万名用户开放,未来逐步吸纳9万名研究人员。
- 参与者获得更高使用限制和更大上下文窗口的版本,相当于调用Pro版GPT-5.6 Sol模型。
- 研究人员可邀请同一机构的4位同事,共享相同功能。
- 还将提供扩展版的深度研究功能,可定向从科学期刊等特定资源收集信息。
- 影响/看点:大幅降低顶尖AI工具的使用门槛,加速科学发现,但也可能引发学术界对数据隐私和依赖的讨论。
本内容由 AI 生成,仅供参考,请注意甄别
字节跳动整合飞书与豆包团队,成立新豆包产品线
字节跳动将飞书产品团队并入豆包产品团队,由豆包负责人赵祺统管、飞书负责人谢欣向其汇报,外界解读为应对腾讯Workbuddy竞争压力。
AI 解读
字节跳动宣布将飞书产品团队并入豆包产品团队,组建统一的新豆包产品线,由豆包负责人赵祺统领、飞书负责人谢欣向其汇报,这一组织调整被普遍解读为对腾讯 Workbuddy 竞争压力的直接回应。
- 整合后飞书不再作为独立产品团队运作,而是并入豆包体系,组织架构上体现出字节对 AI 原生办公工具的优先级重新排序
- 汇报关系上飞书负责人谢欣向豆包负责人赵祺汇报,意味着豆包在字节内部的战略地位进一步提升
- 外界普遍将此举与腾讯近期发布的 AI 办公产品 Workbuddy 联系起来,视为字节对办公赛道竞争加剧的主动调整
- 反映出大厂正在把 AI 能力与传统协同办公产品深度捆绑,而非并行运营两条产品线
- 影响:办公协同赛道正从“工具竞争”转向“谁的 AI 更深度嵌入工作流”的竞争,字节这次组织重组释放出把飞书全面 AI 化改造的信号,后续豆包如何重塑飞书的产品形态值得持续关注。
本内容由 AI 生成,仅供参考,请注意甄别
Meta披露2790亿美元未来AI数据中心租赁承诺
Meta披露2790亿美元未反映在资产负债表上的未来数据中心租赁承诺,主要用于AI基建。
AI 解读
彭博披露Meta有2790亿美元的未来数据中心租赁承诺尚未计入资产负债表,规模之大再次凸显AI基础设施投入已进入“表外杠杆”阶段。
- 这笔近2790亿美元的租赁承诺主要与AI数据中心建设相关
- 关键在于“表外”——这些长期租约目前没有体现在Meta的资产负债表上,意味着实际AI资本开支和长期负债压力比财报数字看起来更大
- 这是行业性趋势的缩影:头部厂商越来越多用长期租赁而非直接自建持有的方式扩张算力,既能加快落地速度,也能在会计处理上留出腾挪空间
- 对观察AI军备竞赛的资金强度是个重要信号——当“表外承诺”体量开始逼近甚至超过账面资本开支,意味着算力扩张的真实成本和风险,需要投资者用更细的口径去核算。
本内容由 AI 生成,仅供参考,请注意甄别
欧盟拨款100亿欧元建7座AI数据中心追赶中美
欧盟拟拨款100亿欧元公共资金,招标建设最多7座AI数据中心以减少对外部技术依赖。
AI 解读
欧盟拿出100亿欧元真金白银公开招标,要在境内建最多7座AI数据中心,意图很直接——降低对美中两国算力和云服务的依赖。
- 这是欧盟“技术主权”战略的最新落地动作,用公共资金直接补贴基础设施建设,而不只是出台监管规则
- 招标面向企业,最多支持7座数据中心项目,规模在欧洲以往AI基建投入中属于大手笔
- 大背景是欧盟在AI算力、云基础设施上长期依赖美国云厂商、部分依赖中国供应链,监管(如AI法案)之外,欧盟正尝试用产业政策补上算力自主这一课
- 相比美中动辄数千亿美元级别的私营资本开支,100亿欧元体量仍偏小,更多是撬动作用而非追平差距
- 值得持续跟踪具体中标企业和落地进度,这将是判断欧盟能否在算力自主上从“喊口号”走到“能落地”的关键试金石。
本内容由 AI 生成,仅供参考,请注意甄别
论文研究
RESEARCH8 篇DeepMind 论文:大语言模型能推导广义相对论,但无法发明它
DeepMind论文指出大模型能演绎推导广义相对论,但缺乏爱因斯坦式概念冲突驱动的溯因创新能力。
AI 解读
DeepMind这篇立场论文给“AI能否做科学发现”泼了盆冷水:大模型能沿着已知理论把公式推到底,却造不出爱因斯坦式的概念跃迁。
- 科学发现被拆成归纳、演绎、溯因三步,论文认为当前大语言模型只擅长前两步——从数据里找规律、把规律往前推演
- 以广义相对论为例:牛顿引力体系本身几乎不产生“预测出错”的经验误差信号,单纯靠压缩数据、拟合误差驱动的模型很难自然长出指向广义相对论的梯度
- 真正把爱因斯坦推向新理论的,是概念框架内部的矛盾(比如引力与狭义相对论不兼容)和思想实验,而不是数据拟合得不够好
- 这意味着“更大模型+更多数据就能自动发现新物理”的乐观预期缺乏依据,溯因推理(在没有明确误差信号时提出全新假设)可能是当前范式的结构性短板
- 对判断AI科研能力的边界很关键——它提醒行业,评测大模型“像不像科学家”不能只看它能不能复现已知结论,还要看它能不能在无明确纠错信号时主动提出新框架。
本内容由 AI 生成,仅供参考,请注意甄别
智能体 AI 助力神经退行性疾病的规模化诊断与照护
论文探讨用智能体 AI 系统扩大神经退行性疾病的诊断与照护规模。
AI 解读
这篇发表于 Nature Aging 子刊的研究探讨如何用智能体式 AI(Agentic AI)解决神经退行性疾病(如阿尔茨海默病、帕金森病)诊断与照护难以规模化的痛点,把 AI 从单点辅助诊断工具升级为可自主执行多步骤任务的照护系统。
- 聚焦神经退行性疾病诊断链条长、依赖专科医生资源稀缺的现实瓶颈,智能体架构被用来串联问诊、检测、随访等多环节
- 智能体式设计的核心优势在于能自主规划和执行一系列诊疗相关任务,而非像传统 AI 工具那样只完成单一预测或分类
- 论文视角面向“规模化”,即如何让诊断与照护能力覆盖更多基层和资源匮乏地区,而非仅停留在旗舰医院的示范项目
- 属于交叉学科前沿探索,反映医疗 AI 正从辅助诊断向自主执行的智能体范式迁移
- 看点:如果智能体式诊疗真能在真实医疗系统中验证有效,将为老龄化社会应对认知类疾病的照护资源缺口提供一条可复制路径,值得关注后续落地案例和监管态度。
本内容由 AI 生成,仅供参考,请注意甄别
苹果发布 MoMo:用时空动作分词实现机器人操作模式切换
苹果发布MoMo框架,让机器人通过时空动作分词学习可复用的动作模式,实现跨任务操作方式切换。
AI 解读
苹果研究团队发布 MoMo,尝试解决机器人操作里一个常被忽略的问题:同一个任务在不同场景下该用什么样的“动作节奏”去执行,这种执行层面的变化能不能像技能一样被复用。
- MoMo 是两阶段模仿学习框架,先用时空动作分词器把动作切成可复用的片段,再用行为克隆 Transformer 学习执行
- 模型输入除了任务描述,还多了一个连续的“动作模式”条件变量,用来调节动作的节奏与风格
- 在六个真实机器人操作任务上验证,调节该条件能让同一策略稳定切换出不同的执行方式
- 核心思路是把“怎么做”和“做什么”解耦,让动作风格成为跨任务共享的独立因子
- 看点:比起堆更多任务数据,这种把执行模式抽出来单独建模的路子,可能是让机器人策略更泛化、更好迁移的一条捷径。
本内容由 AI 生成,仅供参考,请注意甄别
降维遇上网络科学:在 UMAP 的 kNN 图上做数据洞察
研究提出挖掘 UMAP 内部构建的 kNN 图(而非仅看降维结果),用 PageRank、k-核分解等图算法辅助数据洞察。
AI 解读
这篇研究提醒大家:大家常用 UMAP 只看它输出的二维可视化图,却忽略了它内部真正建的那张高维 kNN(k近邻)图——这张图才是数据结构的原始记录,没被降维压扁变形,拿它跑经典图算法能挖出可视化图看不到的洞察。
- UMAP 在做降维投影前,会先在原始高维空间构建一张 kNN 图来描述数据流形,这一步历来被当作「中间产物」直接丢弃
- 用 PageRank 跑这张 kNN 图,可以找出数据集里最具代表性的样本点
- 用 k-core 分解可以揭示数据中密度不同的核心区域,帮助定位「核心簇」与边缘噪声
- 研究整体在提示:标准图算法搬到 UMAP 的内部图上,是一条被低估的数据探索路径
- 对做数据分析、聚类或异常检测的团队来说,这是一个几乎零成本的补充手段——不用换工具,只是把 UMAP 已经算好但一直没用上的中间图拿出来再挖一次。
本内容由 AI 生成,仅供参考,请注意甄别
腾讯开源AngelSpec:面向混元模型的统一投机解码训练框架
腾讯开源AngelSpec投机解码训练框架,针对混元模型真实流量的异构性定制草稿模型而非用单一通用模型。
AI 解读
腾讯开源的AngelSpec把“投机解码要不要用一个草稿模型打天下”这个问题正面回应:不同任务里token的可预测性差异巨大,与其找一个平均分最高的万能草稿模型,不如按场景配两套。
- 投机解码的原理是用一个轻量“草稿模型”提前猜后续几个token,再让大模型一次性并行验证,猜中越多、单轮往返越短,加速比越高
- 开放式对话场景可接受的续写很多,草稿越长命中率掉得越快,适合用自回归多token预测(MTP)方式提议较短候选序列
- 代码和数学推理场景语法、变量名、公式步骤高度约束了后续token,可预测片段更长,适合用block-parallel块并行方式批量提议
- AngelSpec因此没有做折中,而是训练两套互补草稿模型:一套用多样对话数据强化MTP,一套用代码、数学数据强化块并行模型;还针对原始模型MTP层训练与推理递归复用不匹配、深层预测命中率骤降的问题,引入共享参数、多深度自回归展开的训练方案
- 该框架已开源并配套训练代码,为国产大模型在真实生产流量下压低推理延迟提供了可复用方案,也说明推理加速正从“一套草稿模型打天下”转向按负载特征分层设计。
本内容由 AI 生成,仅供参考,请注意甄别
腾讯混元Hyra研究智能体破解50年数学难题
腾讯混元用研究智能体 Hyra 及 Hy3 模型构造出整数集,将|A+A|与|A-A|指数比精确证明为2,解决1969年提出的极值数学难题。
AI 解读
腾讯混元推出的研究智能体 Hyra 联合 Hy3 模型,解决了一个悬而未决超过 50 年的加法组合数学难题——给定有限整数集 A,|A+A| 相比 |A-A| 最快能快多少,首次给出精确指数为 2 的显式构造,并附带形式化证明。
- 该问题 1969 年就有理论上界指出指数不超过 2,但过去五十多年最好的构造方案指数仅勉强超过 1.1,差距一直没被填平
- Hyra 借助 Hy3 模型找到了一个显式构造,证明最优指数恰好等于 2,论文与 GitHub 上的形式化证明均已公开
- 业内讨论关注这类突破中“AI 引导”成分的占比,例如是否可以脱离外部裁判模型、仅靠自身模型完成
- 更广泛的评论认为,AI 在数学研究中的角色更可能是帮数学家探索人力难以覆盖的搜索空间,而非直接取代数学家
- 影响:这是国产大模型研究智能体在纯数学基础问题上拿下的一个标志性成果,说明 AI 辅助数学证明已从“辅助计算”走向“独立贡献新构造”,后续类似“智能体解开陈年难题”的案例值得持续跟踪。
本内容由 AI 生成,仅供参考,请注意甄别
DeepMind研究员:语言模型无法引发科学革命,世界模型或许可以
DeepMind研究员发文称语言模型缺乏产生原创科学突破的认知机制,认为世界模型才更有可能引发科学革命。
AI 解读
DeepMind 研究员 Tom Zahavy 在一篇题为“LLMs can't jump”的立场论文中提出,语言模型缺乏引发科学革命所需的核心认知机制,真正有潜力实现范式突破的是世界模型(world models),这为当前“AI 加速科学发现”的乐观叙事泼了一盆冷水。
- 论文核心论点是语言模型本质上在已有知识分布内做插值和重组,缺乏创造真正“全新”事物所需的机制
- 作者用“can't jump”作比喻,强调科学革命往往需要跳出既有框架的跃迁式突破,而非渐进式优化
- 与之相对,作者认为具备物理世界建模与因果推理能力的世界模型,更可能具备产生突破性洞见的潜力
- 该观点出自 DeepMind 内部研究员,而非唱衰 AI 的外部批评者,增加了讨论的分量
- 看点:这篇立场论文与同期 Claude 攻破密码学难题、Hyra 破解数学难题等新闻形成有趣对照——AI 到底是在做增量式的“高效搜索”,还是真能引发范式跃迁,业内路线之争仍未有定论,值得持续关注后续针对性反驳或实证研究。
本内容由 AI 生成,仅供参考,请注意甄别
清华NLP组提出悲观验证方法,提升LLM数学证明验证准确性
清华NLP组提出悲观验证法校验LLM数学证明,准确率提升且成本降至约四分之一,助Gemini 3 Pro在IMO 2025得分翻倍。
AI 解读
清华大学 NLP 组(OpenBMB 团队)提出了一种叫“悲观验证”的方法,专门解决大模型自己写的数学证明“对不对”这件事一直难判断的问题,思路简单但效果显著。
- 核心做法是并行跑多次同一份证明的验证,只要有一次运行报错就直接判定为不通过,宁可错杀不放过
- 这种“悲观”策略明显提升了真负率(TNR)和平衡 F1 分数,即更善于揪出错误证明
- 团队还给出了渐进式变体,在保持同等准确率的前提下,token 消耗、运行时间和成本都只需约四分之一
- 在 IMO 2025 真实赛题上实测,把 Gemini 3 Pro 的得分从 13 分直接拉高到 22 分
- 方法本身不依赖特定模型,理论上可以套用到其他做数学证明生成的大模型上
- 看点:验证环节的可靠性一直是 LLM 数学能力落地的短板,这项工作用低成本方式补上了这块拼图,对提升模型数学竞赛表现有直接帮助。
本内容由 AI 生成,仅供参考,请注意甄别
技巧与观点
TIPS & OPINIONS8 篇如何用谷歌微基准工具评估TPU性能
谷歌开源TPU微基准测试套件,分维度测网络/算力/显存等指标,帮开发者定位瓶颈并针对性优化。
AI 解读
谷歌开源了一套 TPU 微基准测试工具,目的是让开发者能精确判断自己的模型训练到底卡在哪里,而不是凭感觉调优,这对做大规模训练的团队很实用。
- 覆盖网络、算力、HBM 显存、主机传输、Attention 等多个硬件维度的细粒度指标
- 用这些基准数据可以搭建 Roofline 模型,直观判断工作负载是算力瓶颈、显存瓶颈还是网络瓶颈
- 有了这层“实测基线”,后续优化才能对症下药,而不是盲目调参
- 可指导内核调优、mesh 分片策略、重计算(rematerialization)等具体优化手段
- 目标是在大规模部署场景中把硬件利用率尽可能榨干
- 看点:对做 TPU 训练/推理优化的工程师来说,这是一套可落地的诊断方法论,能省下大量“猜瓶颈”的试错成本。
本内容由 AI 生成,仅供参考,请注意甄别
NVIDIA谈如何在AI基础设施上榨出全部性能
英伟达指出同型号硬件集群训练吞吐可差8%-12%,根源多在内核、并行切分等配置选择,给出优化思路。
AI 解读
英伟达分享了一份关于如何在 AI 基础设施上“榨干”全部性能的经验总结,核心发现是:硬件相同不代表性能相同,配置细节才是决定训练吞吐量的关键变量。
- 即便是完全相同型号的 H100、GB200 NVL72 或 GB300 NVL72 集群,不同部署之间的训练吞吐量也可能明显不同
- 英伟达观察到,合作伙伴部署与官方参考架构在同模型、同批次大小下,吞吐量差距常规就有 8% 到 12%
- 差距的根源往往不是硬件本身,而是内核层面、调度策略等一系列配置选择的累积效应
- 文章强调需要对照官方参考架构逐项排查配置,而不是简单堆硬件规格
- 看点:对正在自建或托管大规模 AI 集群的团队而言,这提醒了一个容易被忽视的事实——花大价钱买同款硬件不等于拿到同等算力,配置调优本身就是一笔隐藏的性能红利。
本内容由 AI 生成,仅供参考,请注意甄别
用HTML/CSS做AI生成PPT:好看但易出隐形Bug
实测发现用HTML/CSS做AI生成PPT虽美观但易出隐形Bug,12页成本超0.5美元/页且4页出严重问题
AI 解读
围绕“AI 生成 PPT 该用什么中间格式”这个话题,有开发者实测了 HTML/CSS 方案,发现虽然版式好看且 AI 最擅长写 HTML,但实际生成过程成本不低,还容易出现肉眼难发现的排版事故。
- 有观点认为 HTML 是 AI 生成 PPT 的最佳中间格式,兼顾美观度和后期可编辑性,而且大模型对 HTML 语法最熟悉
- 实测一份 12 页麦肯锡风格 PPT,生成成本约 0.5 美元/页,耗时超过 11 分钟
- 12 页里有 4 页出现严重问题,比如文字在页面上直接“消失”
- 根因是 CSS 的层叠继承像“幽灵般远程作用”,一个选择器因为 class 层级写错,导致浅色文字叠在浅色背景上完全看不见
- 光是定位这一个隐形 bug,就花了将近一分钟人工排查
- 这个案例提醒依赖 AI 生成网页/PPT 类内容的团队:格式选择对美观度友好不代表对调试友好,CSS 的隐式副作用会让 AI 生成内容里混入人眼难以第一时间察觉的错误,批量生产前最好加一道视觉校验环节。
本内容由 AI 生成,仅供参考,请注意甄别
英伟达:四种方式部署更安全的 AI 智能体
英伟达发文介绍四种部署更安全AI智能体的方法,应对智能体接入带来的安全风险
AI 解读
英伟达发文探讨企业该如何更安全地部署 AI 智能体,背景是越来越多知识工作者开始让智能体承担“数字同事”角色——审查 bug、写代码、推补丁、找人审核,效率提升明显,但把大模型接入真实系统权限也带来新的安全隐患。
- 智能体已经能完成端到端的工作闭环:阅读 bug 报告、实现并测试修复、提交补丁、通知人工复核
- 这类自动化能显著减轻团队处理重复性任务的负担,释放人力做更高价值工作
- 但智能体一旦被赋予调用工具、访问系统的权限,就把大模型的安全边界问题引入了生产环境
- 文章围绕“如何在授权范围、执行环境、监控审计等层面收紧智能体权限”给出四条部署建议
- 定位是给正在或计划把智能体接入实际工作流的团队提供安全设计参考
- 随着智能体从“聊天助手”走向“能操作真实系统的数字员工”,权限收紧和执行可控性会成为企业落地绕不开的门槛,这类安全部署建议对正在做智能体化改造的团队有直接参考价值。
本内容由 AI 生成,仅供参考,请注意甄别
Nathan Lambert 讲座:工具调用与智能体 RL,从基础到前沿
Nathan Lambert发布工具调用与智能体RL讲座第11讲,系统讲解基础设施与训练方法
AI 解读
AI 研究者 Nathan Lambert 发布了他“语言模型与工具使用”系列讲座的第 11 讲,系统梳理工具调用与智能体强化学习,从最基础的概念一路讲到 OpenThoughts-Agent 这类前沿课题,适合想系统补课的人。
- 讲座从“LLM 为什么需要工具”这个最基础的问题讲起,搭建起工具调用的必要性认知
- 详细介绍工具调用所需的基础设施,即模型如何发现、调用、解析工具返回结果
- 深入讲解针对工具使用和智能体行为的训练方法,是内容的核心部分
- 结合 OpenThoughts-Agent 等具体项目,讨论当前智能体 RL 领域仍然存在的挑战
- 视频按章节划分(引言、工具必要性、基础设施、训练方法、总结等),方便按需跳看
- 作为一门体系化的“101 到前沿”课程,这条讲座适合正在做工具调用或智能体 RL 相关研发、但对底层原理还不够扎实的团队和个人系统补课,能少走一些自己摸索的弯路。
本内容由 AI 生成,仅供参考,请注意甄别
对话 vLLM 作者游凯超:模型与基础设施协同设计
张珺对话vLLM作者游凯超,探讨模型与基础设施协同设计,以电力系统类比token、硬件与推理引擎关系。
AI 解读
张珺在最新一期播客里对话vLLM核心作者游凯超,围绕大模型与底层基础设施的协同设计展开了一场系统性讨论,把抽象的工程理念讲得很具象。
- 游凯超用电力系统做类比:token相当于电流,硬件(风能、水能)是发电源头,模型是发电机,推理引擎则扮演电网的角色,层层传导效率决定最终发电效果
- 讨论核心落在协同设计的深度上——模型结构设计得越贴合推理引擎和硬件特性,系统整体吞吐和成本效率的提升空间就越大,单独优化某一层收效有限
- 作为vLLM的作者,游凯超的视角更偏推理侧,与此前一期对话昇腾团队廖恒博士偏训练与硬件侧的内容形成互补
- 官方建议把这两期节目连起来看,才能贯通从芯片、训练框架到推理引擎的完整协同设计链条
- 看点:随着大模型训练和推理成本持续承压,模型、硬件与系统的协同设计正从少数头部团队的内部经验变成行业公开讨论的话题,值得关注LLM基础设施方向的读者细看。
本内容由 AI 生成,仅供参考,请注意甄别
Nathan Lambert:Harness 工程仍有大量唾手可得的提升空间
AI研究员Nathan Lambert认为harness工程仍有大量容易实现的性能提升空间,是一个值得深入研究的高性价比方向。
AI 解读
AI2 研究员 Nathan Lambert 借 GPT-5.6 Sol 靠改进 harness(智能体运行框架/脚手架)让分数暴涨 188% 一事,抛出一个判断:harness 工程的"低垂果实"多到不可思议,这比堆算力升级模型本身性价比高得多。
- 核心论点是同一个模型,仅靠优化运行框架(如上下文管理、工具调用策略、记忆机制)就能把跑分提升近两倍
- 他指出 harness 效果研究本身是个交叉领域,横跨后训练(post-training)和评估/推理(eval/inference)两端,目前研究得还不够系统
- 言下之意是行业过度聚焦"训练更强的模型",而忽视了"如何更好地驱动现有模型"这个同样关键的杠杆
- 这类优化的性价比(每单位性能提升所需成本)可能远高于继续堆参数或算力
- 对于做 AI 应用和智能体产品的团队,这是一个务实提醒:与其等下一代模型,不如先把自己的 harness/prompt 编排打磨到位,收益可能立竿见影。
本内容由 AI 生成,仅供参考,请注意甄别
RLM 框架:定义子智能体深度与工具调用层级
Dex Horthy提出RLM(递归语言模型)框架,用最大/最小子智能体深度两个维度定义子智能体的调用层级与工具调用边界。
AI 解读
独立开发者 Dex Horthy 提出了一个简洁的框架来描述"递归语言模型"(RLM,即智能体调用子智能体的层级结构),用两个参数就把复杂的多智能体调用关系量化了下来,为智能体架构设计提供了一把标尺。
- 框架被形式化为 f(max_subagent_depth, min_subagent_depth),用两个整数刻画调用层级
- max_subagent_depth 定义了子智能体可以嵌套多少层,即整个调用链能"递归"多深
- min_subagent_depth 则规定了在哪一层开始允许调用非智能体的普通工具(如搜索、执行代码),避免每一层都强行经过一次完整智能体决策
- 这种拆分让开发者能明确权衡:更深的子智能体嵌套换来更强的任务分解能力,但也带来更高的延迟和成本
- 这套坐标系的价值在于把此前各家"多智能体系统"里模糊的调用深度设计,变成了可以显式配置、比较和调优的两个数字,方便工程落地。
本内容由 AI 生成,仅供参考,请注意甄别