让声音跨越语言 · 免下载 · 免显卡,上传一段参考音频即可零样本声音克隆(又称语音克隆、音色克隆)
IndexSpeech 团队发布的官方宣传片,展示同一音色在五种语言间的跨语言克隆与情绪复刻效果。
围绕“克隆一个声音、用好一个声音”,把 IndexTTS 2.5 的核心能力全部搬进浏览器。
上传一段参考音频即可克隆音色,无需针对说话人单独训练。用你的声音朗读任意文字,也可跨语言生成(文字转语音 / AI 配音场景通用)。
音色参考和情绪参考可以来自不同的人、甚至不同语言。支持情绪参考音频、8 维情绪向量强度调节与文本情绪描述三种控制方式。
2.5 开放 duration_factor 时长控制,0.5–2.0 倍范围内自由调节快慢,旁白、口播、有声书节奏一手掌握。
支持中文拼音、英文 CMU 音素、日语假名三种发音控制,多音字、专有名词读错时可逐字修正。
三步完成,全程无需下载任何软件、无需显卡。
在安静环境用手机录一句完整的话,或直接上传已有音频。口齿清晰、无背景噪音的样本克隆效果最稳定。
约 30 秒粘贴文案,选择生成语言、情绪类型与语速。跨语言场景直接选目标语种即可,无需重录参考音频。
约 1 分钟点击生成,在线试听满意后下载音频文件,用于短剧、有声书、口播视频或课件解说。
数秒生成IndexTTS 是 IndexSpeech 团队开源的文本转语音(TTS)系列,从初代 IndexTTS、到 IndexTTS2(IndexTTS 2.0),再到最新的 IndexTTS2.5,持续向零样本声音克隆、情绪复刻、多语种与推理效率演进。本页聚焦最新的 IndexTTS2.5,并提供其免部署在线使用入口。
IndexTTS 2.5 是 IndexSpeech 团队于 2026 年 8 月 10 日开源的多语种零样本情感 TTS 模型,参数量约 0.8B,支持中文、英文、日语、西班牙语、阿拉伯语五种语言。给定一段参考音频,模型即可克隆该声音的音色,并支持音色与情绪分离控制、0.5–2.0 倍语速调节。代码、模型权重、论文与 Demo 已全部开源。
相比 2.0 版本,2.5 把语义 codec 帧率从 50 Hz 压缩到 25 Hz、用 Zipformer 替换 U-DiT 作为 S2M 主干,并对 T2S 模块进行 GRPO 强化学习后训练。官方论文在同一套 A10 硬件上测得,两模块合计 RTF 由 0.310 降到 0.136,约 2.28 倍速度提升;官方五语种零样本评测中,RL 版平均词错误率 6.00%、平均说话人相似度 73.63。
本地运行 IndexTTS 2.5 需要 NVIDIA 显卡与 Python 环境;本站提供免部署方案——打开浏览器即可使用同款开源模型能力,并针对中文创作场景做了工程优化。
以上模型数据来自 IndexTTS 官方 GitHub 仓库与论文(arXiv:2601.03888)。

IndexTTS2(即 IndexTTS 2.0)是上一代版本,2.5 是 2.0 发布约 11 个月后的升级版本,核心变化集中在语言覆盖、推理效率与可控性三个方向。
| 对比项 | IndexTTS 2.0 | IndexTTS 2.5 |
|---|---|---|
| 支持语言 | 中文、英文 | 中、英、日、西、阿 5 种 |
| 语速控制 | 发布版未开放 | 0.5–2.0× duration_factor |
| 发音控制 | 中文拼音 | 中文拼音 + 英文 CMU 音素 + 日语假名 |
| 语义 codec 帧率 | 50 Hz | 25 Hz(序列长度减半) |
| S2M 主干 | U-DiT | Zipformer(主观偏好测试 56% vs 40%) |
| T2S 后训练 | — | GRPO 强化学习(平均 WER 6.75→6.00) |
| 合计 RTF(A10 同硬件) | 0.310 | 0.136(约 2.28× 提速) |
| 半精度 | FP16 | BF16 |
| 生产部署 | 原仓库推理 / WebUI | 新增官方 vLLM 部署方案 |
数据来源:IndexTTS 官方 GitHub 仓库与 2.5 论文(arXiv:2601.03888)。速度数据均为同一官方表内的同硬件对比,不跨硬件混算。
用中文参考音频直接生成外语语音——官方中文提示跨语言评测平均 WER 6.17、说话人相似度 70.20(RL 版)。中、英、日、西、阿五个语种均已开放在线生成,各语种官方评测数据见下表。
表中为官方论文五语种零样本评测数据(RL 版,WER 越低越好、SS 越高越好)。阿拉伯语 WER 相对偏高,建议先小样本试听再批量生成。
IndexTTS 2.5 原生支持音色与情绪解耦:先克隆音色,再单独指定情绪来源——可以是一段情绪参考音频、8 维情绪向量,或一句文字描述。情绪参考甚至可以来自另一个人、另一种语言。
8 维情绪向量支持强度调节,非固定预设。官方中英情绪感知评测中,2.5 的整体情绪识别准确率为中文 0.713、英文 0.673,均高于对照模型。语速通过 duration_factor 控制:大于 1 变慢、小于 1 变快,有效范围 0.5–2.0 倍时长。
两种方式各有适用人群,按需选择即可。
| 对比项 | IndexTTS2.5 在线版(本站) | 本地部署 |
|---|---|---|
| 硬件要求 | 无,浏览器即用,手机可操作 | 需 NVIDIA 显卡 |
| 环境配置 | 无需配置 | Python ≥3.10 且 <3.12;CUDA 问题需 Toolkit 12.8+ |
| 上手时间 | 约 1 分钟 | 拉仓库 + 下载数 GB 权重 + 装依赖 |
| 批量 / 二次开发 | 网页流程为主 | 灵活,官方支持 vLLM 生产部署 |
| 数据位置 | 云端处理,生成记录保存 7 天 | 完全本地,数据不出机器 |
| 适合谁 | 想快速出结果的创作者、无显卡用户 | 开发者、数据敏感或超大批量场景 |

为不同角色克隆专属音色,同一角色用情绪向量切换喜怒哀乐,台词节奏用语速控制精确匹配画面。

叙述用平静情绪、对白按情节切换,一个人完成整本书的多角色演播;长文本分段生成保持音色一致。

录一次自己的声音,之后每期视频粘贴文案即可生成同款音色配音,口误重录成为历史。

用中文参考音频直接生成英语、日语版配音,同一个“你的声音”面向不同语言的观众。
关于在线使用、模型能力、商用边界的 21 个高频问题,答案均基于官方公开数据与本站实际功能。