ElevenLabs v3
音频标签
由你掌控的声音
直接在文本中输入 [laughs]、[whispers]、[excited] 等提示。v3 会将每个提示理解为表演指令。一次 API 调用即可生成多人场景,支持 70+ 种语言。导出 WAV 或 MP3,再把音频节点拖入 Zeemo 的视频工作流。
像电影导演一样指导声音
一个模型,四种能力:用音频标签控制情绪;一份脚本生成多说话人场景;覆盖 70+ 种语言的原生韵律;每次生成的错误率仅 4.9%。
写下 [laughs],让笑声自然出现
在脚本中写下你希望每行的表达方式。 [笑]、[窃窃私语]、[缓慢]、[兴奋]——将它们放在类似的舞台方向上,模型就会跟随。没有预设下拉菜单。没有波形编辑器。
脚本由你掌控。
导演你的第一个场景粘贴脚本,生成完整演员阵容
粘贴带有角色名称的脚本。获取完整的对话场景,其中每个声音从第一行到最后一行都保持一致,最多可达 5,000 个字符。没有缝合在一起。长场景中没有语音漂移。
全体演员。一键点击。每个声音都保持个性。
生成对话场景像当地人一样说 70+ 种语言
支持 70+ 种语言,每种语言都有自然的节奏和语调。日语听起来像日语,而不是带口音的英语;印地语也能保留正确重音。音频标签适用于每一种语言。
真实表演。每种语言。
以 70+ 语言生成写下一整本书,生成一个完整音频文件
一次性生成最多 5,000 个字符。有声读物、播客剧集、训练配音 - 编写完整的脚本,获取一个连续的文件。声音自始至终保持稳定。无需拼接。无接缝。
一个文件,连贯到底。尽管写长。
生成长格式音频听听你可以创作什么
有声读物、播客、游戏对话、视频配音。一个模型涵盖每个语音项目。
如何在 Zeemo 上使用 ElevenLabs v3
选择模式和模型
打开 Zeemo 无限画布中选择 ElevenLabs v3;TTS 适合单人语音,对话模式适合多说话人场景。
标记和生成
粘贴文本,在需要改变表达的地方加入 [笑]、[窃窃私语] 或 [兴奋]。每个标签约控制 4–5 个词,无需反复猜测。
试听并导出
生成后直接在画布上试听。调整标签即可重新生成。导出 WAV/MP3,再把音频节点拖入任意视频工作流——全程在同一块画布上完成。

