2026.08.03 · AI 日报
今天的主线仍是开源阵营的"反整合":Nathan Lambert 盘点 Laguna S2.1、Inkling、Kimi K3 后判断,开源模型并未如预期整合,反而不断有实验室拿出帕累托前沿级权重;MiniMax 官宣视频模型 H3 即将开源,微软牵头235家公司联署呼吁保护开放权重,声势不小。但硬币另一面同一天发生:DoorDash 因为用了月之暗面的 Kimi 模型写代码,被美国国会两个委员会联合调查——开放权重喊得越响,"用谁的模型"却越政治化。另一条线上,创作与开发的门槛还在被继续砸低:Claude Opus 5 一句提示词生成完整3D游戏原型,Karpathy 花十美元渲染出《指环王》场景,Greg Brockman 也晒出用 GPT-5.6 Sol 做出的3D解剖教学应用。今天先看这三条:Nathan Lambert 的开源盘点、DoorDash 调查、Cloudflare 的 Agents Week。
今日热点
TOP 10Nathan Lambert:最新开源模型盘点——Laguna S2.1、Inkling 与 Kimi K3 展现开源模型的帕累托前沿价值
Nathan Lambert盘点Laguna S2.1、Inkling与Kimi K3,指出更多实验室仍在持续开源帕累托前沿强模型,行业并未如预期走向整合
AI 解读
Nathan Lambert在最新一期开源模型盘点里,推翻了自己此前“实验室会走向整合”的预判——2026年反而是更多机构砸重金训练强模型且选择开源,这期盘点被他称为史上最密集的一次,值得看新入局玩家怎么把开源做出商业闭环。
- 曾被当成纯闭源打法的Thinking Machines,靠开源模型微调服务Tinker一年做到数亿美元营收,推出的Inkling(975B-A41B多模态MoE,支持文本、图像、音频输入)已是美国最强开源权重模型之一,超过英伟达Nemotron和Arcee Trilogy
- Inkling同时放出276B-A12B小尺寸版本,在同量级里具备很强竞争力
- 腾讯Hy3(295B-A21B MoE)相比前代全面提升,延续中国实验室开源节奏不减
- 小米等新玩家仍在持续积累开源生态的话语权和心智份额
- 作者提出关键悬念:Kimi K3这类收入分成许可模式能走多远,开源模型还能从闭源手里抢下多少市场份额
- 这轮盘点的信号是:开源不再是闭源打不过的退而求其次,而是被验证的独立商业路径,接下来比拼的是谁能把开源模型和商业化服务拧成一股绳。
本内容由 AI 生成,仅供参考,请注意甄别
Simon Willison梳理近期AI政策公开信:微软牵头235家公司联署开放权重倡议
Simon Willison梳理近期AI政策公开信,微软牵头235家公司联署开放权重倡议,意在抵制美国政府限制开源模型的动向
AI 解读
Simon Willison梳理了近期一连串关于AI开发方向的公开信,其中最重磅的是微软牵头、235家公司联署的《开放权重与美国AI领导力》,矛头直指美国政府可能以“安全”为由限制开放权重模型的倾向,这场表态战值得关注谁签了、谁没签。
- 联署方阵容庞大,英伟达、亚马逊、Y Combinator、Linux基金会在列,OpenAI是后来才补签的
- 公开信核心论点:只依赖闭源模型并不天然安全,少数闭源模型集中风险,一旦被攻破或滥用外部难以察觉;开放权重能让更广泛的社区检验、发现漏洞并持续改进
- 信中意外地为“蒸馏”(用一个模型的输出训练或改进另一个模型)公开背书,称其为长期存在的正当技术改进手段,而非窃取
- 最引人注意的缺席者是Anthropic,没有签署这封信,而是三天后单独发布了自己的《我们对开放权重模型的立场》表态
- 开放权重正从技术路线之争升级为政策游说战场,各家表态背后是对未来监管走向和自身商业定位的提前卡位。
本内容由 AI 生成,仅供参考,请注意甄别
Cloudflare 启动"Agents Week",聚焦智能体基础设施
Cloudflare 启动 Agents Week,反思云计算基础设施应从服务人转向服务 AI 智能体的需求。
AI 解读
Cloudflare 官宣为期一周的“Agents Week”,抛出一个核心问题——不是云厂商该造什么,而是“智能体需要什么”,这是边缘计算/CDN 巨头首次系统性地把智能体而非人类当作产品设计的第一受众,值得所有做 Agent 基础设施的团队关注。
- 反思现有云和 Web 的底层假设:一切都是为“有人在看屏幕”设计的——抓注意力的页面、要点击的仪表盘、按人类阅读习惯调的界面,智能体不需要这些,也没有疲劳和分心
- 提出“Agent Cloud”双重定位:一头是从零为智能体设计原语的“agent-native”未来,另一头是连接现有人类网络与智能体网络的“翻译层”,两者要同时兼顾
- 一周议程涵盖五块:智能体所需的计算/存储原语与执行层、“ADLC”(去掉人类环节的软件开发生命周期)、企业如何安全地让员工与智能体访问内部系统、智能体如何重塑 Web 形态、以及智能体与人类共存的现实落地
- 官方甚至建议开发者直接去问自己的智能体“你需要一个什么样的 Agent Cloud”,把“询问对象”从人类转向了 AI 本身
- 这是基础设施巨头首次把“智能体是甲方”当作产品设计前提公开表态,后续五天陆续放出的具体功能值得持续跟进,大概率会重塑云厂商在 Agent 时代的竞争打法。
本内容由 AI 生成,仅供参考,请注意甄别
MiniMax官宣视频模型H3即将开源
MiniMax宣布视频模型H3即将开源权重,用户反馈其质量、数量优于2.5版且成本更低、速度更快
AI 解读
MiniMax宣布其视频生成模型H3即将开放权重,这是继此前2.5版本后MiniMax在视频生成赛道的又一次开源动作,早期用户反馈其质量、成本和速度全面优于上代。
- 已有用户实测反馈,H3生成视频的质量和数量都优于2.5版本
- 成本更低、推理速度更快,自定义音频上传功能可正常使用
- 有评论认为,创意工具领域最终拼的是成本和速度,谁能把两者做到最优谁就赢
- 一旦规模化铺开,视频生成有望走向“无限生成”的使用体验
- 视频生成模型的开源化正在加速,MiniMax这步棋如果落地,会进一步压低AI视频创作的门槛和成本。
本内容由 AI 生成,仅供参考,请注意甄别
Greg Brockman:用 GPT-5.6 Sol 与 Codex 构建 3D 人体解剖教学应用
开发者用 GPT-5.6 Sol 和 Codex 做出 3D 人体解剖教学应用,模型体积从900MB压缩到28.6MB且帧率大幅提升。
AI 解读
OpenAI 联合创始人 Greg Brockman 亲自转发了一个用 GPT-5.6 Sol 与 Codex 完成的实战案例——把一款 3D 人体解剖教学应用从“卡到没法用”优化到流畅,是少见的、带具体量化数字的 AI 辅助工程案例。
- 核心是模型体积压缩:单个 3D 解剖模型从 120-150MB 降到 2-5.5MB,压缩比超过 95%,直接决定了应用能否在普通设备上流畅加载
- 应用总资源包从约 900MB 压到 28.6MB,配合按需加载(而非一次性全量加载),大幅降低首屏等待和内存占用
- 帧率从 16fps(明显卡顿)提升到流畅区间,教学场景下这是“能用”和“不能用”的分水岭
- Codex 不只是改代码,还自动生成了解剖插图和交互式热点标记,说明它承担了部分内容生产而不只是性能调优
- 这类案例比跑分更有说服力——它证明当前一代 Agentic 编程工具已能独立完成“性能诊断+资源优化+内容生成”的完整工程闭环,对做教育类/3D 可视化应用的团队是可直接参考的优化路径。
本内容由 AI 生成,仅供参考,请注意甄别
Francois Chollet:深度学习瓶颈的两条出路——主动推理与离散程序搜索
Chollet称主动推理只是深度学习瓶颈的补丁方案,长期AI必将转向以MDL原则替代SGD的离散程序搜索
AI 解读
Francois Chollet撰文指出深度学习正撞上瓶颈,行业目前用的是补丁方案,即主动推理(active inference),但他认为这只是权宜之计,长期必然转向更彻底的范式转移:抛弃深度学习式的曲线拟合,转向离散程序搜索。
- 主动推理这一“方案一”最早在2024年12月首次演示,如今已经在业内变得无处不在
- Chollet认为这只是应对深度学习局限的临时补丁,而非根本解法
- 他判断的“方案二”是用最小描述长度(MDL)等更稳健的原则取代梯度下降(SGD)
- 这意味着彻底告别当前深度学习曲线拟合的范式,转而探索离散程序搜索这条路径
- 作为ARC基准的提出者,Chollet这一判断延续了他一贯“深度学习无法真正抵达通用智能”的立场,值得关注离散程序搜索路线后续会不会真正落地成可用系统。
本内容由 AI 生成,仅供参考,请注意甄别
高通完成收购 AI 基础设施公司 Modular,加码 AI 计算布局
高通完成收购 AI 基建公司 Modular,加码数据中心、边缘及工业 AI 布局。
AI 解读
高通正式完成对AI基础设施创业公司Modular的收购(7月29日官宣完成),这笔交易把Modular在异构计算(CPU、GPU、NPU)上部署生成式AI和智能体的软件平台,并入高通从数据中心到边缘、工业AI的全栈布局,是芯片巨头补软件短板的又一动作。
- Modular核心资产是面向异构硬件的AI原生软件基础设施,主打帮开发者在不同芯片架构上无缝部署生成式AI与智能体;
- 收购后Modular旗下Mojo编程语言、MAX推理引擎、Modular Cloud三大产品线保留独立品牌运营,继续获高通投资支持;
- 人事上,Modular联合创始人兼CEO Chris Lattner将出任高通技术公司高级AI软件与平台执行副总裁,直接掌舵高通AI软件战略;
- 高通借此补齐芯片强、软件弱的短板,意图打通从底层硬件到上层AI应用的完整栈,对标英伟达CUDA生态的护城河打法。
- 这笔收购的看点不在金额,而在人——Lattner执掌高通AI软件平台,意味着高通要用一套跨CPU、GPU、NPU的统一软件层去争夺英伟达之外的AI基础设施份额。
本内容由 AI 生成,仅供参考,请注意甄别
Claude Opus 5 把「提示词生成游戏」从色块草图推进到带物理与音乐的完整 3D 原型
Claude Opus 5可从单一提示词生成含物理与音乐的完整3D游戏原型,细节表现优于GPT-5.6 Sol和Kimi K3
AI 解读
Anthropic的Claude Opus 5把一句话生成游戏这件事从简单色块草图推进到了带物理引擎和音乐的完整3D原型,第一人称射击、卡丁车竞速、类Minecraft沙盒都能靠单个提示词直接生成,且不依赖任何外部美术素材。
- 几何体、贴图、物理系统甚至部分场景的配乐都由代码直接生成,在浏览器里就能跑起来
- 测试覆盖了第一人称射击、卡丁车赛车、类Minecraft沙盒建造等多种游戏类型
- 在与GPT-5.6 Sol、Kimi K3的横向对比中,Opus 5生成的效果明显更精细
- 整个过程“零外部素材”,意味着从提示词到可玩原型的链路已经相当完整
- 提示词直接生成可玩3D游戏原型,把AI辅助游戏开发往AI直接产出游戏又推进了一大步,是游戏行业和创意工具方向值得盯紧的信号。
本内容由 AI 生成,仅供参考,请注意甄别
OpenAI 推出 Presence,让 AI 智能体在企业场景真正落地生产
OpenAI推出企业级智能体产品Presence,面向客服与内部工作流的外部部署,复杂场景由OpenAI工程师介入支持
AI 解读
OpenAI推出企业级新产品Presence,目标是让AI智能体真正在客服和内部工作流等生产场景里落地,和此前面向内部的Workspace Agents不同,Presence专门瞄准面向外部客户的部署场景。
- 定位是让AI智能体从能用的演示变成能扛的生产系统,服务客户服务和内部工作流两类场景
- 与Workspace Agents的分工不同:后者服务企业内部,Presence主打对外部署
- 遇到复杂案例时,OpenAI自己的工程师会介入支持,而不是完全甩给客户自行排障
- 这是OpenAI企业业务线进一步细分、从通用助手转向分场景交付的又一步
- AI智能体能否真正扛住生产环境的复杂度和责任归属,是企业级落地的关键卡点,Presence的工程师介入机制某种程度上也说明这道坎还没被完全跨过去。
本内容由 AI 生成,仅供参考,请注意甄别
独家爆料:微软双向语音模型 MAI-Realtime 抢先看
爆料称微软正测试新一代双向语音模型 MAI-Realtime,比 MAI Voice 2 更自然,支持联网搜索等工具调用。
AI 解读
科技爆料账号 testingcatalog 独家放出微软下一代语音模型“MAI-Realtime”的早期预览消息,这是微软自研语音技术继 MAI Voice 2 之后的又一次迭代,也是其在语音交互赛道加码自研的信号。
- “双向”(bidirectional)是关键词,意味着模型支持实时语音对话式交互,而非单向的文本转语音或语音转文本
- 爆料称其自然度明显优于此前的 MAI Voice 2,说明微软在语音模型的拟人化和低延迟上有实质进展
- 具备工具调用能力,可操作网络搜索等外部工具,意味着这不只是“会说话”,而是能在对话中执行任务的语音智能体
- 目前仍是早期预览阶段,信息来自第三方爆料而非微软官方发布,正式发布时间和开放范围尚不确定
- 如果消息属实,这将是微软在 Copilot 语音交互体验上的关键升级,值得关注其正式发布节奏,以及是否会对标 OpenAI 的实时语音能力和 Google 的语音助手。
本内容由 AI 生成,仅供参考,请注意甄别
模型发布/更新
MODEL RELEASES3 篇MiniMax官宣视频模型H3即将开源
MiniMax宣布视频模型H3即将开源权重,用户反馈其质量、数量优于2.5版且成本更低、速度更快
AI 解读
MiniMax宣布其视频生成模型H3即将开放权重,这是继此前2.5版本后MiniMax在视频生成赛道的又一次开源动作,早期用户反馈其质量、成本和速度全面优于上代。
- 已有用户实测反馈,H3生成视频的质量和数量都优于2.5版本
- 成本更低、推理速度更快,自定义音频上传功能可正常使用
- 有评论认为,创意工具领域最终拼的是成本和速度,谁能把两者做到最优谁就赢
- 一旦规模化铺开,视频生成有望走向“无限生成”的使用体验
- 视频生成模型的开源化正在加速,MiniMax这步棋如果落地,会进一步压低AI视频创作的门槛和成本。
本内容由 AI 生成,仅供参考,请注意甄别
Claude Opus 5 把「提示词生成游戏」从色块草图推进到带物理与音乐的完整 3D 原型
Claude Opus 5可从单一提示词生成含物理与音乐的完整3D游戏原型,细节表现优于GPT-5.6 Sol和Kimi K3
AI 解读
Anthropic的Claude Opus 5把一句话生成游戏这件事从简单色块草图推进到了带物理引擎和音乐的完整3D原型,第一人称射击、卡丁车竞速、类Minecraft沙盒都能靠单个提示词直接生成,且不依赖任何外部美术素材。
- 几何体、贴图、物理系统甚至部分场景的配乐都由代码直接生成,在浏览器里就能跑起来
- 测试覆盖了第一人称射击、卡丁车赛车、类Minecraft沙盒建造等多种游戏类型
- 在与GPT-5.6 Sol、Kimi K3的横向对比中,Opus 5生成的效果明显更精细
- 整个过程“零外部素材”,意味着从提示词到可玩原型的链路已经相当完整
- 提示词直接生成可玩3D游戏原型,把AI辅助游戏开发往AI直接产出游戏又推进了一大步,是游戏行业和创意工具方向值得盯紧的信号。
本内容由 AI 生成,仅供参考,请注意甄别
国家超算互联网上线 DeepSeek-V4-Flash 正式版 API,一键接入即可调用
国家超算互联网上线DeepSeek-V4-Flash正式版API和模型文件,企业和开发者可一键接入调用
AI 解读
国家超算互联网正式上线DeepSeek-V4-Flash正式版模型的API调用服务,企业和开发者无需自行配置环境即可一键接入调用,这也是国产大模型基础设施持续对外开放的又一落地动作。
- DeepSeek-V4-Flash-0731经过大量后训练强化,智能体能力和指令遵循能力都有大幅提升,多项基准测试可与当前最强闭源模型相媲美
- 用户通过国家超算互联网官网PC端服务下拉菜单进入模型服务专区,即可一键直达API调用页面,免去繁琐的环境配置
- 平台目前已汇集1700余款国内外热门开源大模型,覆盖DeepSeek、GLM、Qwen、Kimi等主流系列,并全面上线DeepSeek-V4、MiniMax-M3、Kimi-K3等国产开源大模型API
- 随着核心节点正式投运,国家超算互联网已成为全国首个十万卡级超智融合算力资源池
- 国家级算力平台直接托管主流国产大模型的API服务,意味着企业接入大模型的路径进一步简化,算力和模型的国家队基础设施正在加速成型。
本内容由 AI 生成,仅供参考,请注意甄别
产品发布/更新
PRODUCT LAUNCHES6 篇Cloudflare 启动"Agents Week",聚焦智能体基础设施
Cloudflare 启动 Agents Week,反思云计算基础设施应从服务人转向服务 AI 智能体的需求。
AI 解读
Cloudflare 官宣为期一周的“Agents Week”,抛出一个核心问题——不是云厂商该造什么,而是“智能体需要什么”,这是边缘计算/CDN 巨头首次系统性地把智能体而非人类当作产品设计的第一受众,值得所有做 Agent 基础设施的团队关注。
- 反思现有云和 Web 的底层假设:一切都是为“有人在看屏幕”设计的——抓注意力的页面、要点击的仪表盘、按人类阅读习惯调的界面,智能体不需要这些,也没有疲劳和分心
- 提出“Agent Cloud”双重定位:一头是从零为智能体设计原语的“agent-native”未来,另一头是连接现有人类网络与智能体网络的“翻译层”,两者要同时兼顾
- 一周议程涵盖五块:智能体所需的计算/存储原语与执行层、“ADLC”(去掉人类环节的软件开发生命周期)、企业如何安全地让员工与智能体访问内部系统、智能体如何重塑 Web 形态、以及智能体与人类共存的现实落地
- 官方甚至建议开发者直接去问自己的智能体“你需要一个什么样的 Agent Cloud”,把“询问对象”从人类转向了 AI 本身
- 这是基础设施巨头首次把“智能体是甲方”当作产品设计前提公开表态,后续五天陆续放出的具体功能值得持续跟进,大概率会重塑云厂商在 Agent 时代的竞争打法。
本内容由 AI 生成,仅供参考,请注意甄别
Greg Brockman:用 GPT-5.6 Sol 与 Codex 构建 3D 人体解剖教学应用
开发者用 GPT-5.6 Sol 和 Codex 做出 3D 人体解剖教学应用,模型体积从900MB压缩到28.6MB且帧率大幅提升。
AI 解读
OpenAI 联合创始人 Greg Brockman 亲自转发了一个用 GPT-5.6 Sol 与 Codex 完成的实战案例——把一款 3D 人体解剖教学应用从“卡到没法用”优化到流畅,是少见的、带具体量化数字的 AI 辅助工程案例。
- 核心是模型体积压缩:单个 3D 解剖模型从 120-150MB 降到 2-5.5MB,压缩比超过 95%,直接决定了应用能否在普通设备上流畅加载
- 应用总资源包从约 900MB 压到 28.6MB,配合按需加载(而非一次性全量加载),大幅降低首屏等待和内存占用
- 帧率从 16fps(明显卡顿)提升到流畅区间,教学场景下这是“能用”和“不能用”的分水岭
- Codex 不只是改代码,还自动生成了解剖插图和交互式热点标记,说明它承担了部分内容生产而不只是性能调优
- 这类案例比跑分更有说服力——它证明当前一代 Agentic 编程工具已能独立完成“性能诊断+资源优化+内容生成”的完整工程闭环,对做教育类/3D 可视化应用的团队是可直接参考的优化路径。
本内容由 AI 生成,仅供参考,请注意甄别
OpenAI 推出 Presence,让 AI 智能体在企业场景真正落地生产
OpenAI推出企业级智能体产品Presence,面向客服与内部工作流的外部部署,复杂场景由OpenAI工程师介入支持
AI 解读
OpenAI推出企业级新产品Presence,目标是让AI智能体真正在客服和内部工作流等生产场景里落地,和此前面向内部的Workspace Agents不同,Presence专门瞄准面向外部客户的部署场景。
- 定位是让AI智能体从能用的演示变成能扛的生产系统,服务客户服务和内部工作流两类场景
- 与Workspace Agents的分工不同:后者服务企业内部,Presence主打对外部署
- 遇到复杂案例时,OpenAI自己的工程师会介入支持,而不是完全甩给客户自行排障
- 这是OpenAI企业业务线进一步细分、从通用助手转向分场景交付的又一步
- AI智能体能否真正扛住生产环境的复杂度和责任归属,是企业级落地的关键卡点,Presence的工程师介入机制某种程度上也说明这道坎还没被完全跨过去。
本内容由 AI 生成,仅供参考,请注意甄别
独家爆料:微软双向语音模型 MAI-Realtime 抢先看
爆料称微软正测试新一代双向语音模型 MAI-Realtime,比 MAI Voice 2 更自然,支持联网搜索等工具调用。
AI 解读
科技爆料账号 testingcatalog 独家放出微软下一代语音模型“MAI-Realtime”的早期预览消息,这是微软自研语音技术继 MAI Voice 2 之后的又一次迭代,也是其在语音交互赛道加码自研的信号。
- “双向”(bidirectional)是关键词,意味着模型支持实时语音对话式交互,而非单向的文本转语音或语音转文本
- 爆料称其自然度明显优于此前的 MAI Voice 2,说明微软在语音模型的拟人化和低延迟上有实质进展
- 具备工具调用能力,可操作网络搜索等外部工具,意味着这不只是“会说话”,而是能在对话中执行任务的语音智能体
- 目前仍是早期预览阶段,信息来自第三方爆料而非微软官方发布,正式发布时间和开放范围尚不确定
- 如果消息属实,这将是微软在 Copilot 语音交互体验上的关键升级,值得关注其正式发布节奏,以及是否会对标 OpenAI 的实时语音能力和 Google 的语音助手。
本内容由 AI 生成,仅供参考,请注意甄别
ChatGPT 浏览器扩展与桌面应用迎来功能更新
ChatGPT Chrome 扩展支持选中文本右键提问、侧边栏引用标签页;桌面版新增地址栏建议与浏览历史管理功能。
AI 解读
OpenAI 悄悄给 ChatGPT 的浏览器端体验做了一轮实用性升级,核心思路是让 ChatGPT 更紧密地嵌入日常浏览行为,而不是停留在独立对话框里。
- Chrome 扩展新增划词右键提问,选中网页任意文本即可直接发问,减少来回复制粘贴的操作成本
- 侧边栏可以引用当前打开的标签页内容进行提问,包括针对 YouTube 视频内容提问,相当于把浏览器标签变成了可对话的上下文
- 桌面应用同步更新:输入问题时给出 URL 建议、支持回顾和管理浏览器历史,进一步把“网页浏览”和“AI 问答”两个动作揉在一起
- 更新从今日起逐步推送,并非一次性全量上线
- 这类“环境嵌入式”更新看似琐碎,实则是 ChatGPT 从“打开才用”的工具转向“浏览器原生助手”的关键一步,长期看会不断蚕食独立搜索和浏览器插件的使用场景。
本内容由 AI 生成,仅供参考,请注意甄别
英伟达发布Molt:PyTorch原生智能体强化学习框架
英伟达NeMo团队发布PyTorch原生智能体强化学习框架Molt,代码量仅8.6K行,远小于verl和slime等同类框架
AI 解读
英伟达NeMo团队发布Molt,一个PyTorch原生的智能体强化学习框架,主打代码轻量到一个研究者能装进脑子里、AI编程助手也能完整读懂的设计目标,直接对标verl、slime、OpenRLHF等主流方案。
- 核心代码量仅约8.6K行,对比之下verl约62K行、slime约25K行、OpenRLHF约7.2K行,精简幅度明显
- 采用Ray做任务调度和异步队列、vLLM做推理rollout、NVIDIA AutoModel加FSDP2做训练,三个组件均未做魔改分叉,上游更新可以直接跟进而不用重新合并代码
- 支持流式请求池让prompt分组持续在途,推理引擎不会因等待训练而空闲;还支持部分rollout,训练时暂停引擎、用NCCL广播权重分片、再恢复未完成的请求而不是直接丢弃
- 以Apache 2.0协议开源,提供Slurm脚本和预构建容器,推荐配置是2节点16张H100(8张训练加8张推理),门槛对准前沿及次前沿实验室、经费充足的AI创业公司和高校多节点算力团队
- 支持多轮工具调用智能体、代码执行智能体、视觉语言环境、LLM当裁判的奖励回路,以及向小模型做在线策略蒸馏等应用
- 又一个大厂把内部强化学习基础设施标准化开源,agentic RL的工具链门槛正在被持续拉低,中小团队复现前沿训练方法的可行性在增加。
本内容由 AI 生成,仅供参考,请注意甄别
行业动态
INDUSTRY4 篇Simon Willison梳理近期AI政策公开信:微软牵头235家公司联署开放权重倡议
Simon Willison梳理近期AI政策公开信,微软牵头235家公司联署开放权重倡议,意在抵制美国政府限制开源模型的动向
AI 解读
Simon Willison梳理了近期一连串关于AI开发方向的公开信,其中最重磅的是微软牵头、235家公司联署的《开放权重与美国AI领导力》,矛头直指美国政府可能以“安全”为由限制开放权重模型的倾向,这场表态战值得关注谁签了、谁没签。
- 联署方阵容庞大,英伟达、亚马逊、Y Combinator、Linux基金会在列,OpenAI是后来才补签的
- 公开信核心论点:只依赖闭源模型并不天然安全,少数闭源模型集中风险,一旦被攻破或滥用外部难以察觉;开放权重能让更广泛的社区检验、发现漏洞并持续改进
- 信中意外地为“蒸馏”(用一个模型的输出训练或改进另一个模型)公开背书,称其为长期存在的正当技术改进手段,而非窃取
- 最引人注意的缺席者是Anthropic,没有签署这封信,而是三天后单独发布了自己的《我们对开放权重模型的立场》表态
- 开放权重正从技术路线之争升级为政策游说战场,各家表态背后是对未来监管走向和自身商业定位的提前卡位。
本内容由 AI 生成,仅供参考,请注意甄别
高通完成收购 AI 基础设施公司 Modular,加码 AI 计算布局
高通完成收购 AI 基建公司 Modular,加码数据中心、边缘及工业 AI 布局。
AI 解读
高通正式完成对AI基础设施创业公司Modular的收购(7月29日官宣完成),这笔交易把Modular在异构计算(CPU、GPU、NPU)上部署生成式AI和智能体的软件平台,并入高通从数据中心到边缘、工业AI的全栈布局,是芯片巨头补软件短板的又一动作。
- Modular核心资产是面向异构硬件的AI原生软件基础设施,主打帮开发者在不同芯片架构上无缝部署生成式AI与智能体;
- 收购后Modular旗下Mojo编程语言、MAX推理引擎、Modular Cloud三大产品线保留独立品牌运营,继续获高通投资支持;
- 人事上,Modular联合创始人兼CEO Chris Lattner将出任高通技术公司高级AI软件与平台执行副总裁,直接掌舵高通AI软件战略;
- 高通借此补齐芯片强、软件弱的短板,意图打通从底层硬件到上层AI应用的完整栈,对标英伟达CUDA生态的护城河打法。
- 这笔收购的看点不在金额,而在人——Lattner执掌高通AI软件平台,意味着高通要用一套跨CPU、GPU、NPU的统一软件层去争夺英伟达之外的AI基础设施份额。
本内容由 AI 生成,仅供参考,请注意甄别
DoorDash 因用月之暗面模型写代码遭美国国会议员调查
DoorDash 因用月之暗面 Kimi 模型编程并路由任务给它,遭美国国会两委员会联合调查。
AI 解读
美国众议院两个委员会联合调查外卖巨头DoorDash使用中国AI大模型的情况,起因是DoorDash创始人此前公开表示,月之暗面Kimi K2.6搭配Anthropic Fable 5的组合,效果超过Sonnet 4.6加Opus 4.8且成本更低,公司已用模型路由把底层任务交给Kimi K2.6处理。
- 调查函由美国众议院国土安全委员会等牵头,要求DoorDash提供其使用的中国AI大模型的具体信息;
- 众议院措辞明确承认开放权重的中国模型使用成本更低、定制化程度更高,但强调这不能抵消安全风险和国家安全担忧;
- 众议院国土安全委员会主席Andrew Garbarino公开表态,称中国开源模型的网络安全能力已经逼近美国前沿模型水平,令人担忧;
- DoorDash回应称坚定支持美国AI领先地位,并表示愿与调查方沟通其如何安全使用AI,包括同时使用美国前沿模型和开放权重模型。
- 这起调查是美国企业低成本采用中国开源模型与国家安全审查之间张力的又一次公开摊牌,后续可能影响更多美国企业在模型选型上的合规顾虑。
本内容由 AI 生成,仅供参考,请注意甄别
2026年科技裁员超去年全年,AI投资却持续狂飙
2026年前七个月全球科技裁员已超12.4万人,超过2025全年总量,同时各大厂商仍在加码AI资本投入
AI 解读
据layoffs.fyi数据,2026年前七个月全球科技行业裁员人数已经超过2025年全年总量,与此同时各大科技巨头却在持续加码AI投资,这一边裁员边加投AI的反差值得细看背后逻辑。
- 前七个月裁员超12.4万人,超过2025全年的12.2万人,甲骨文、亚马逊、戴尔、Meta是主要裁员大户
- Workday、GitLab、Robinhood等中型企业也在裁员之列,加州今年已减少1.6万个科技岗位,Meta一家就占了五分之一
- 裁员原因不止AI替代,管理层级臃肿、疫情期间过度招聘、官僚主义盛行同样是重要推手
- Meta、亚马逊已上调2026年资本支出预期至数千亿美元级别,甲骨文更宣布下一财年砸900亿美元建AI基础设施
- 咨询公司PwC的研究反而发现,重度采用AI的企业员工数增长更快,旧金山失业率已因OpenAI、Anthropic本地招聘降到3.7%
- 裁员与AI投资同步飙升,说明这轮调整更像是科技行业组织结构和资源分配的重新洗牌,而非简单的AI抢走饭碗,岗位是消失还是转移,现在下结论都还太早。
本内容由 AI 生成,仅供参考,请注意甄别
论文研究
RESEARCH0 篇技巧与观点
TIPS & OPINIONS6 篇Nathan Lambert:最新开源模型盘点——Laguna S2.1、Inkling 与 Kimi K3 展现开源模型的帕累托前沿价值
Nathan Lambert盘点Laguna S2.1、Inkling与Kimi K3,指出更多实验室仍在持续开源帕累托前沿强模型,行业并未如预期走向整合
AI 解读
Nathan Lambert在最新一期开源模型盘点里,推翻了自己此前“实验室会走向整合”的预判——2026年反而是更多机构砸重金训练强模型且选择开源,这期盘点被他称为史上最密集的一次,值得看新入局玩家怎么把开源做出商业闭环。
- 曾被当成纯闭源打法的Thinking Machines,靠开源模型微调服务Tinker一年做到数亿美元营收,推出的Inkling(975B-A41B多模态MoE,支持文本、图像、音频输入)已是美国最强开源权重模型之一,超过英伟达Nemotron和Arcee Trilogy
- Inkling同时放出276B-A12B小尺寸版本,在同量级里具备很强竞争力
- 腾讯Hy3(295B-A21B MoE)相比前代全面提升,延续中国实验室开源节奏不减
- 小米等新玩家仍在持续积累开源生态的话语权和心智份额
- 作者提出关键悬念:Kimi K3这类收入分成许可模式能走多远,开源模型还能从闭源手里抢下多少市场份额
- 这轮盘点的信号是:开源不再是闭源打不过的退而求其次,而是被验证的独立商业路径,接下来比拼的是谁能把开源模型和商业化服务拧成一股绳。
本内容由 AI 生成,仅供参考,请注意甄别
Francois Chollet:深度学习瓶颈的两条出路——主动推理与离散程序搜索
Chollet称主动推理只是深度学习瓶颈的补丁方案,长期AI必将转向以MDL原则替代SGD的离散程序搜索
AI 解读
Francois Chollet撰文指出深度学习正撞上瓶颈,行业目前用的是补丁方案,即主动推理(active inference),但他认为这只是权宜之计,长期必然转向更彻底的范式转移:抛弃深度学习式的曲线拟合,转向离散程序搜索。
- 主动推理这一“方案一”最早在2024年12月首次演示,如今已经在业内变得无处不在
- Chollet认为这只是应对深度学习局限的临时补丁,而非根本解法
- 他判断的“方案二”是用最小描述长度(MDL)等更稳健的原则取代梯度下降(SGD)
- 这意味着彻底告别当前深度学习曲线拟合的范式,转而探索离散程序搜索这条路径
- 作为ARC基准的提出者,Chollet这一判断延续了他一贯“深度学习无法真正抵达通用智能”的立场,值得关注离散程序搜索路线后续会不会真正落地成可用系统。
本内容由 AI 生成,仅供参考,请注意甄别
Nathan Lambert:开源模型逆势扩张,行业整合预言落空
Nathan Lambert 称训练成本虽逐年暴涨,但行业未如预期整合,反而更多公司加码开源模型并靠开放微调服务盈利。
AI 解读
AI2 研究员、知名 AI 评论人 Nathan Lambert 推翻了业界流传已久的“训练成本暴涨必然导致行业整合”的预言——现实是入局者不减反增,而且越来越多人选择把强模型开源出来。
- 反常识现象:训练成本按数量级逐年攀升,理论上该淘汰掉小玩家,但实际是更多公司愿意砸下数亿到数十亿美元去训练并开源模型
- 举例 Thinking Machines 的开放微调服务年收入已达数亿美元规模,其开源权重模型甚至反超部分美国同行
- 中国实验室持续保持竞争力,小米等此前不在牌桌上的新玩家也在快速积累模型影响力
- Lambert 判断“持续采用”(更多玩家、更多模型并存)比“整合”(少数寡头垄断)更可能,关键变量是开源模型的市场份额,以及 Kimi K3 这类“收入分成许可”商业模式能否跑通
- 这是对“大模型终将寡头化”叙事的一次正面挑战,如果收入分成许可模式被验证可行,可能给中小实验室开辟出一条不必烧钱陪跑巨头也能商业化的开源路线。
本内容由 AI 生成,仅供参考,请注意甄别
TimesFM 2.5端到端时间序列预测实战教程
教程演示用TimesFM 2.5搭建端到端时间序列预测流程,涵盖回测、协变量、异常检测与Colab部署
AI 解读
这是一篇TimesFM 2.5的端到端时间序列预测实战教程,用一个模拟多门店零售数据集,完整跑通从模型加载、零样本预测到评估、回测、异常检测的全流程,适合想快速上手时序基础模型的开发者参考。
- 数据集自带趋势、季节性、定价促销、节假日、温度等多种真实业务因素,更贴近实际零售场景
- 覆盖MAE、RMSE、sMAPE、MASE、pinball loss、预测区间覆盖率等多套评估指标,而不只是单一误差数字
- 测试维度较全,包括批量推理、滚动起点回测、上下文长度敏感性、通过XReg引入协变量、异常检测、长周期预测、吞吐调优和输入鲁棒性
- 整个流程可以在Colab上跑通,并给出自动检测硬件、依赖安装等工程细节,降低了上手门槛
- 对于想把时序基础模型用到零售、运营等实际预测场景的团队,这篇教程提供了一套可直接复用的评估和部署方法论,比单纯读论文更有实操价值。
本内容由 AI 生成,仅供参考,请注意甄别
Karpathy用Opus 5花10美元渲染《指环王》3D场景
Karpathy用约10美元预算让Opus 5耗时2小时写出5500行代码渲染《指环王》3D场景,称成本已趋近于零
AI 解读
Karpathy 只给了 Opus 5 一段《指环王》开篇文字和约 10 美元的 token 预算,模型就独立写出程序化渲染代码,把小说场景搭成了 3D 画面,这次实验被他视为大模型能力的一个标志性瞬间。
- 输入极简,只有小说第一段文字,输出却是长达 5500 行的渲染代码,模型自主完成了从文本理解到 3D 场景搭建的全流程
- 耗时约 2 小时、成本约 10 美元,Karpathy 强调这是「从没人会做,到几乎免费」的门槛转变,同等工程量过去需要专业团队投入
- 他认为评测大模型的方式正在离开「画一只鹈鹕 SVG」式的玩具题,转向更贴近真实生产场景的复杂任务
- 同时坦承短板:模型在视频画面感知、以及对生成结果做游戏内审计方面能力仍明显不足,离"全自动导演"还有距离
- 这类实验测的其实是模型「长任务自主执行+海量 token 预算」的组合能力,而非单纯的代码生成水平
- 对独立开发者和内容创作者来说,这意味着过去要靠 3D 团队才能完成的程序化场景生成,正在变成人人可负担的即时能力,但感知类短板也提醒:模型能干活,却还不能完全替人把关。
本内容由 AI 生成,仅供参考,请注意甄别
Codex 技巧:用 Sol 指挥 Luna Max 子代理省额度翻倍产出
Codex 玩法:让主模型 Sol 配置并调度子代理 Luna Max 处理具体编码,以节省高阶模型额度、提升产出效率。
AI 解读
这是一条 Codex 重度用户圈流传的进阶省钱技巧——用便宜模型 Sol 做“项目经理”,指挥更贵但推理更强的子代理 Luna Max 去干脏活累活,把两种模型的成本和能力错位利用起来。
- 核心分工:Sol 负责任务拆解和代码审查(相对省钱的环节),具体实现细节委托给配置为 gpt-5.6-luna、reasoning effort 设为 max 的子代理 Luna Max 去干(烧钱但产出质量更高的环节)
- 配置方式是在 ~/.codex/agents/ 目录下建一个 luna-worker.toml 子代理文件,而且这套配置本身也是“让 Sol 自己帮你配好”,不用手动写
- 相比更早版本的省钱 tip,这是进阶版,说明 Codex 玩家社区在快速迭代出一套“贵模型只用在刀刃上”的分层调度打法
- 本质是额度管理问题:Sol 贵、额度烧得快,但胜在规划和把关能力强,把执行环节转移给专门配置的子代理可以省整体开销
- 这条技巧反映出重度 Agentic 编程用户已在自发摸索“多模型分层调度”的最佳实践,对同样在算力/额度上精打细算的开发者,这种主控模型加专用子代理的架构值得直接参考。
本内容由 AI 生成,仅供参考,请注意甄别