字节发布Seed Audio 1.0音频创作模型:支持精细时间控制,音色风格可控

📡 IT之家2026-07-20 14:43

字节跳动发布Seed Audio 1.0模型,支持精细时间控制、音色风格可控,可端到端生成影视级音频。

AI 深度解读

字节跳动发布 Seed Audio 1.0 音频创作模型,实现精细时间控制与音色风格可控,在影视级音频生成上达到可用率 90% 以上,值得关注。

  • 多要素统一编排:一条 prompt 即可同时生成对白、音效和环境声,并支持按时间线精确控制声音进场,实现“听见即看见”的叙事效果。
  • 音色风格可控且长时稳定:支持文本与参考音频输入,在长音频和多次延长场景下保持角色一致性,同一音色可自然呈现不同语气和情绪。
  • 多语种自然生成:支持 20+ 语种,同一角色声音能依据语种特点呈现更自然的发音、节奏与表达方式,在音频自然度上大部分语言 MOS 超过 4 分。
  • 多场景高可用率:在影视、电视节目、短剧、动漫、播客对话、直播带货等场景中,音频可用率多数达到 90% 以上。
  • 影响/看点:Seed Audio 1.0 将音频创作从“后期配音”升级为“智能编排”,大幅降低影视级音频制作门槛,有望推动短视频、直播、影视等行业的音频内容生产效率变革。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com