微软发布自研模型MAI-Image-2.5-Pro与MAI-Voice-2-Flash,未蒸馏第三方,已落地Bing与PowerPoint
微软发布自研模型MAI-Image-2.5-Pro与MAI-Voice-2-Flash,未蒸馏第三方,已用于Bing、PowerPoint等场景。
AI 深度解读
微软放出两款自研模型MAI-Image-2.5-Pro与MAI-Voice-2-Flash,不再依赖第三方蒸馏,这标志着微软在图像和语音两条线上正式建起自己的模型底座,而且不是实验室秀肌肉,是直接接进了Bing、PowerPoint、OneDrive、Dynamics 365这些数亿级用户产品里。
- MAI-Image-2.5-Pro主打高保真图像生成与编辑,尤其优化了图内文字渲染准确性,支持自然语言指令直接改图,定价按token计费,图像输出每百万token约718.8元
- MAI-Voice-2-Flash相比上代提速约2倍、成本降32%,专为高并发语音场景设计,定价每百万字符约101.7元
- 落地效果给出具体数字:Bing Image Creator全面切换为该模型;PowerPoint图像编辑对比GPT-Image-2省下最高84%的GPU成本;OneDrive部署后保存成功率提升26%、P95延迟降25%
- 语音侧接入Dynamics 365客服智能体,GPU成本降最高89%,T-Mobile、EasyJet等已在用;子模型MAI-Transcribe-1.5支撑医疗产品Dragon Copilot,服务17万医疗提供者、单季度处理2800万次问诊记录
- 微软强调训练数据全部自有、可追踪、企业级,不走蒸馏第三方模型的捷径
- 看点:这不是又一次模型跑分秀,而是巨头把自研基础模型直接顶到自家现金流产品里省成本、提体验,对靠API转售或蒸馏起家的中间层玩家是个警示。
本内容由 AI 生成,仅供参考,请注意甄别