字节跳动发布 Seed Audio 1.0 音频创作模型:统一建模人声、音效与环境声,端到端生成影视级声音场景
字节跳动 Seed 团队于 7 月 20 日发布音频创作模型 Seed Audio 1.0。与常见的 TTS 或音效生成模型不同,它面向「完整声音场景」:在统一框架下联合建模人声、音效和环境声等多类音频要素,端到端生成影视级音频作品——一条 prompt 即可统一编排带情绪的对白、关键音效和环境声,让声音直接参与叙事。模型目前已上线火山方舟体验中心开放体验。
技术路线上,Seed Audio 1.0 的核心是「统一声学表征」:团队训练了一个通用声学编码器,把不同类型的音频要素视为同一声音场景的组成部分映射到统一表征中,而非将语音、音效作为独立任务分别编码再拼接。这样做的直接收益是生成结果更像一段完整作品而非拼接素材——角色语气、背景氛围与声音节奏之间有时间和情绪上的相互关系。
可控性是该模型的主打卖点。它支持先把创作意图拆解为结构化时间线(明确角色、台词、情绪和音效的进场时机),当前时间控制精度达 100ms 间隔,对视频配音、翻配、广告片等场景尤其关键。声音控制方面支持零样本生成——纯文字描述或结合参考音频均可,单次可生成约 2 分钟音频并可继续延长,长音频场景下保持角色音色一致;同时支持「单音色、多角色」,同一音色可通过差异化演绎塑造不同人物。多语种方面支持 20+ 语种生成,同一角色声音按不同语种特点呈现更自然的发音与节奏。
这是字节 Seed 线在视频生成(Seedance 2.0 刚被 Neill Blomkamp 用于全 AI 短片《Nightborne》)之后,向音频创作侧的延伸——「会说话的模型」正在变成「会做声音设计的模型」。需要注意的是,官方博客未披露模型规模、基准对比数据与 API 定价,当前仅提供体验入口,商用条款与开放范围以后续官方公告为准。