Meta Muse Spark 1.3 评测汇总:长上下文与 Agent 基准表现优异
行业评测汇总显示 Meta Muse Spark 1.3 在超长上下文与智能体基准测试中表现优异,多项指标逼近顶级模型。
AI 深度解读
Meta 发布轻量模型 Muse Spark 1.3,在优化计算资源消耗的同时提升了长文本和智能体评测表现。
- 官方数据显示,Muse Spark 1.3 相比 1.2 版本减少了 20% 的工具调用次数和 25% 的 token 消耗量。
- 在长文本理解评测 MRCR 256K-512K 范围中获得 98.5 分,高于部分同级别前沿模型。
- 在智能体基准测试中,JobBench 得分 64.9、OSWorld 得分 66.9、AutomationBench 得分 49.4,整体表现接近高端旗舰模型水准。
- 影响/看点:该模型如果在保持高准确率的同时降低 token 与工具调用开销,可能促使更多端侧与企业智能体采用低成本架构,实际落地效果取决于在复杂生产环境下的稳定性表现。
- 资料依据:
- X:Rohan Paul(2026-09-02):https://x.com/rohanpaul_ai/status/2095237722046881912
- Meta AI(2026-09-02):https://ai.meta.com/blog/muse-spark-1-3/
本内容由 AI 生成,仅供参考,请注意甄别