字节跳动发布Seed Audio 1.0:音频生成从“会说”迈向“会创作”

📅 2026年7月20号 ⏱ 6 分钟阅读

近日,字节跳动正式推出音频创作模型Seed Audio1.0,标志着AI音频生成技术从单一语音合成阶段,迈入完整声音场景创作的崭新阶段。该模型目前已上线火山方舟体验中心,向创作者开放测试。

长期以来,影视级音频内容生产依赖多模型分别生成人声、音效与环境声,再通过人工繁琐拼接与混音,流程冗长且难以保证整体叙事一致性。Seed Audio1.0的核心突破在于,它并非简单拼接素材,而是在统一框架下联合建模多种音频要素,端到端生成可服务于叙事的“完整声音作品”。

据官方介绍,Seed Audio1.0具备三大核心能力。首先是精准的时空编排,支持以100毫秒的精度按时间线控制对白、音效的入场时机,完美适配视频配音与广告制作。其次是稳定的音色演绎,支持零样本生成与长音频延展,在保持角色音色一致性的同时,能自然呈现愤怒、喜悦等不同情绪,甚至允许同一音色演绎多个角色。第三是地道的多语种支持,覆盖包括中文、英语、日语在内的20余种语言,确保声音在不同语种下都能符合本土的表达节奏与重音习惯。

评测数据显示,该模型在九大类常见创作场景中的音频可用率已超过90%,多语言生成的自然度MOS评分普遍达到4分以上(优秀水平)。

从“会说”到“会创作”,Seed Audio1.0的发布降低了高质量音频内容的制作门槛。未来,团队计划进一步融合视频参考等多模态输入,并探索可控翻译技术,持续优化长音频与分轨生成能力,助力创作者将脑海中的声音构想高效转化为可听见的作品。

项目主页:

https://seed.bytedance.com/seedaudio1_0

体验入口:

火山方舟体验中心 - 登录 - 选择语音模型 -?语音合成?-?Doubao-音频生成-1.0