Induction Labs发布Photon-1:从一次预训练即可模拟桌面、玩跳棋及物理模型

📡 MarkTechPost2026-07-26 17:14

Induction Labs发布Photon-1,仅通过视频预训练即可模拟桌面操作和物理模型。

AI 深度解读

Induction Labs 发布 Photon-1,一种“想象模型”,仅通过无动作标签的计算机演示视频预训练,便能隐式学习策略,在计算机使用基准上超越 Gemini。

  • 核心创新:使用下一潜在令牌预测目标,预训练时不生成像素,也不依赖动作标签,学习“隐式策略”。
  • 压缩技术:有限标量量化将每帧压缩为 960 个离散令牌,差分潜在编码描述帧间差异,压缩超 100 倍。
  • 训练数据:从 20 亿公开视频中筛选约 200 万段屏幕录制,经关键帧去重后得到 5.75 亿帧(18 年视频)。
  • 性能表现:仅用 30,000 H200 GPU 小时预训练,在计算机使用测试中击败 Gemini 3.1 Flash-Lite,推理成本低约 3 倍。
  • 影响/看点:Photon-1 证明了无需动作标签的预训练路径可行,可能彻底改变智能体学习的数据效率与泛化能力。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com