IndexTTS2.5在线版
首页
AI音色库
创建声音模型
声音克隆
声音设计
AI免费降噪
常见问题
IndexTTS2.5在线版
首页
AI音色库
创建声音模型
声音克隆
声音设计
AI免费降噪
IndexTTS 2.5 · ONLINE

IndexTTS2.5 在线使用

让声音跨越语言 · 免下载 · 免显卡,上传一段参考音频即可零样本声音克隆(又称语音克隆、音色克隆)

⚡ 推理提速 2.28×🌐 5 语种🎚 语速 0.5–2.0×🎭 8 维情绪控制
选择声音
选择
支持方言更多方言
2.28×推理提速 vs 2.0官方论文 A10 同硬件测试
5 语种中 · 英 · 日 · 西 · 阿官方 README
6.00%五语种平均词错误率官方论文 · RL 版评测
0.5–2.0×语速时长控制duration_factor
Official Demo

IndexTTS2.5 官方演示视频

IndexSpeech 团队发布的官方宣传片,展示同一音色在五种语言间的跨语言克隆与情绪复刻效果。

视频要点:五语种零样本克隆 · 中文提示生成英/西/日/阿语音 · 音色与情绪可来自不同说话人在 bilibili 观看原片 ↗
Features

IndexTTS2.5 在线版能做什么

围绕“克隆一个声音、用好一个声音”,把 IndexTTS 2.5 的核心能力全部搬进浏览器。

ZERO-SHOT

零样本声音克隆

上传一段参考音频即可克隆音色,无需针对说话人单独训练。用你的声音朗读任意文字,也可跨语言生成(文字转语音 / AI 配音场景通用)。

EMOTION

音色与情绪分离

音色参考和情绪参考可以来自不同的人、甚至不同语言。支持情绪参考音频、8 维情绪向量强度调节与文本情绪描述三种控制方式。

SPEED

语速自由控制

2.5 开放 duration_factor 时长控制,0.5–2.0 倍范围内自由调节快慢,旁白、口播、有声书节奏一手掌握。

G2P

发音精确纠正

支持中文拼音、英文 CMU 音素、日语假名三种发音控制,多音字、专有名词读错时可逐字修正。

How It Works

IndexTTS2.5 在线怎么用

三步完成,全程无需下载任何软件、无需显卡。

🎤 上传参考音频

在安静环境用手机录一句完整的话,或直接上传已有音频。口齿清晰、无背景噪音的样本克隆效果最稳定。

约 30 秒

✍️ 输入文字并设置

粘贴文案,选择生成语言、情绪类型与语速。跨语言场景直接选目标语种即可,无需重录参考音频。

约 1 分钟

🎧 生成、试听、下载

点击生成,在线试听满意后下载音频文件,用于短剧、有声书、口播视频或课件解说。

数秒生成
About The Model

IndexTTS2.5 模型介绍

IndexTTS 是 IndexSpeech 团队开源的文本转语音(TTS)系列,从初代 IndexTTS、到 IndexTTS2(IndexTTS 2.0),再到最新的 IndexTTS2.5,持续向零样本声音克隆、情绪复刻、多语种与推理效率演进。本页聚焦最新的 IndexTTS2.5,并提供其免部署在线使用入口。

IndexTTS 2.5 是 IndexSpeech 团队于 2026 年 8 月 10 日开源的多语种零样本情感 TTS 模型,参数量约 0.8B,支持中文、英文、日语、西班牙语、阿拉伯语五种语言。给定一段参考音频,模型即可克隆该声音的音色,并支持音色与情绪分离控制、0.5–2.0 倍语速调节。代码、模型权重、论文与 Demo 已全部开源。

相比 2.0 版本,2.5 把语义 codec 帧率从 50 Hz 压缩到 25 Hz、用 Zipformer 替换 U-DiT 作为 S2M 主干,并对 T2S 模块进行 GRPO 强化学习后训练。官方论文在同一套 A10 硬件上测得,两模块合计 RTF 由 0.310 降到 0.136,约 2.28 倍速度提升;官方五语种零样本评测中,RL 版平均词错误率 6.00%、平均说话人相似度 73.63。

本地运行 IndexTTS 2.5 需要 NVIDIA 显卡与 Python 环境;本站提供免部署方案——打开浏览器即可使用同款开源模型能力,并针对中文创作场景做了工程优化。

以上模型数据来自 IndexTTS 官方 GitHub 仓库与论文(arXiv:2601.03888)。

Key Metrics · 官方公开数据

发布日期2026-08-10
模型参数量0.8B
支持语言中 / 英 / 日 / 西 / 阿
五语种平均 WER(RL 版)6.00%
平均说话人相似度(RL 版)73.63
推理提速(A10 论文测试)2.28× vs 2.0
整体 RTF(4090 · BF16)0.2065
语速控制范围0.5 – 2.0×
开源许可bilibili Model Use License
创作者在电脑前使用 IndexTTS2.5 在线版上传参考音频、输入文案并生成声音克隆配音
真实使用场景:打开 IndexTTS2.5 在线版,上传一段参考音频、输入文案,数秒生成可下载的克隆语音
2.0 → 2.5

IndexTTS2 与 IndexTTS2.5 的区别(IndexTTS 2.0 → 2.5 升级)

IndexTTS2(即 IndexTTS 2.0)是上一代版本,2.5 是 2.0 发布约 11 个月后的升级版本,核心变化集中在语言覆盖、推理效率与可控性三个方向。

对比项IndexTTS 2.0IndexTTS 2.5
支持语言中文、英文中、英、日、西、阿 5 种
语速控制发布版未开放0.5–2.0× duration_factor
发音控制中文拼音中文拼音 + 英文 CMU 音素 + 日语假名
语义 codec 帧率50 Hz25 Hz(序列长度减半)
S2M 主干U-DiTZipformer(主观偏好测试 56% vs 40%)
T2S 后训练GRPO 强化学习(平均 WER 6.75→6.00)
合计 RTF(A10 同硬件)0.3100.136(约 2.28× 提速)
半精度FP16BF16
生产部署原仓库推理 / WebUI新增官方 vLLM 部署方案

数据来源:IndexTTS 官方 GitHub 仓库与 2.5 论文(arXiv:2601.03888)。速度数据均为同一官方表内的同硬件对比,不跨硬件混算。

Languages

IndexTTS2.5 五语种覆盖与跨语言克隆

用中文参考音频直接生成外语语音——官方中文提示跨语言评测平均 WER 6.17、说话人相似度 70.20(RL 版)。中、英、日、西、阿五个语种均已开放在线生成,各语种官方评测数据见下表。

🇨🇳
中文WER 3.93 · SS 77.92
🇬🇧
英语WER 3.89 · SS 67.79
🇯🇵
日语WER 5.30 · SS 75.41
🇪🇸
西班牙语WER 3.33 · SS 76.68
🇸🇦
阿拉伯语WER 13.58 · SS 70.36

表中为官方论文五语种零样本评测数据(RL 版,WER 越低越好、SS 越高越好)。阿拉伯语 WER 相对偏高,建议先小样本试听再批量生成。

Emotion · Speed

IndexTTS2.5 情绪与语速控制

IndexTTS 2.5 原生支持音色与情绪解耦:先克隆音色,再单独指定情绪来源——可以是一段情绪参考音频、8 维情绪向量,或一句文字描述。情绪参考甚至可以来自另一个人、另一种语言。

😄高兴
😠愤怒
😢悲伤
😨害怕
🤢厌恶
😔忧郁
😲惊讶
😌平静

8 维情绪向量支持强度调节,非固定预设。官方中英情绪感知评测中,2.5 的整体情绪识别准确率为中文 0.713、英文 0.673,均高于对照模型。语速通过 duration_factor 控制:大于 1 变慢、小于 1 变快,有效范围 0.5–2.0 倍时长。

Online vs Local

IndexTTS2.5 在线使用与本地部署怎么选

两种方式各有适用人群,按需选择即可。

对比项IndexTTS2.5 在线版(本站)本地部署
硬件要求无,浏览器即用,手机可操作需 NVIDIA 显卡
环境配置无需配置Python ≥3.10 且 <3.12;CUDA 问题需 Toolkit 12.8+
上手时间约 1 分钟拉仓库 + 下载数 GB 权重 + 装依赖
批量 / 二次开发网页流程为主灵活,官方支持 vLLM 生产部署
数据位置云端处理,生成记录保存 7 天完全本地,数据不出机器
适合谁想快速出结果的创作者、无显卡用户开发者、数据敏感或超大批量场景
Use Cases

IndexTTS2.5 适合哪些场景

真人短剧拍摄现场,创作者用 IndexTTS2.5 为不同角色克隆专属音色制作 AI 短剧配音
短剧 · 漫剧

🎬 AI 短剧配音

为不同角色克隆专属音色,同一角色用情绪向量切换喜怒哀乐,台词节奏用语速控制精确匹配画面。

配音演员戴耳机在麦克风前用 IndexTTS2.5 演播有声书,屏幕显示配音文本
有声书

🎧 有声书演播

叙述用平静情绪、对白按情节切换,一个人完成整本书的多角色演播;长文本分段生成保持音色一致。

短视频创作者在桌前用 IndexTTS2.5 为口播视频生成同款音色配音
口播

📱 短视频口播

录一次自己的声音,之后每期视频粘贴文案即可生成同款音色配音,口误重录成为历史。

出海内容创作者用 IndexTTS2.5 将中文参考音频跨语言生成英语日语配音
出海

🌐 多语言内容出海

用中文参考音频直接生成英语、日语版配音,同一个“你的声音”面向不同语言的观众。

FAQ

IndexTTS2.5 常见问题

关于在线使用、模型能力、商用边界的 21 个高频问题,答案均基于官方公开数据与本站实际功能。

IndexTTS2.5 可以在线使用吗?
可以。本站提供免部署的在线入口:打开浏览器上传参考音频即可生成,无需 Python 环境、无需 NVIDIA 显卡,手机也能操作。官方另提供 GitHub 开源仓库供本地部署,适合开发者和批量生成场景。
IndexTTS2.5 是什么?
IndexTTS 2.5 是 IndexSpeech 团队于 2026 年 8 月 10 日开源的多语种零样本情感 TTS 模型,参数量约 0.8B,支持中、英、日、西、阿五种语言,可用一段参考音频完成声音克隆。代码、模型权重、论文(arXiv:2601.03888)与 Demo 已全部公开。
IndexTTS2.5 和 2.0 有什么区别?
主要升级五点:语言从 2 种扩展到 5 种;开放 0.5–2.0 倍语速控制;发音控制从中文拼音扩展到中英日三语;语义 codec 帧率 50Hz 降为 25Hz、S2M 主干换用 Zipformer;新增 GRPO 强化学习后训练。官方 A10 同硬件测试中合计 RTF 由 0.310 降到 0.136,约 2.28 倍提速。
IndexTTS2 和 IndexTTS2.5 有什么区别?还能用 IndexTTS2 吗?
IndexTTS2(即 IndexTTS 2.0)是上一代版本,主打中英文零样本克隆;IndexTTS2.5 在其基础上扩展到中英日西阿五语种,新增 0.5–2.0 倍语速控制、中英日发音控制,并通过 GRPO 后训练提升稳定性,官方 A10 同硬件测试约 2.28 倍提速。IndexTTS2 的开源代码仍可继续使用;若追求最新多语种与情绪复刻效果,建议直接用 IndexTTS2.5,本站在线版即为 2.5。
IndexTTS 是什么?和 IndexTTS2.5 是什么关系?
IndexTTS 是 IndexSpeech 团队开源的文本转语音系列的统称,包含初代 IndexTTS、IndexTTS2(2.0)与 IndexTTS2.5 等版本。IndexTTS2.5 是该系列目前最新的公开版本;平时说的“用 IndexTTS 克隆声音”,现在多指使用 IndexTTS2.5。本站是基于开源 IndexTTS2.5 搭建的在线服务平台,模型本身的代码与论文可在官方 GitHub 仓库查看。
IndexTTS2.5 在线版免费吗?
可以免费开始。模型本身开源免费;本站提供每日免费生成额度,页面示例音频试听不消耗额度。超出免费额度后可按套餐购买,具体以定价页为准。
声音克隆需要什么样的参考音频?
一段口齿清晰的录音即可,手机录制可以直接使用,支持 WAV 和 MP3 格式。建议在安静环境完整说一句话;背景噪音过多会影响克隆稳定性。IndexTTS 2.5 是零样本模型,无需长时间录音,参考音频过长并不会提升效果。
IndexTTS2.5 生成速度有多快?
官方仓库在 RTX 4090 上测得整体 RTF 0.2065(BF16),即生成 1 秒音频约需 0.21 秒计算,较 2.0 FP16 的 0.3257 降低约 36.6%。在线版的实际耗时还受文本长度与当前负载影响,常规段落通常数秒内完成。
怎么调语速?
通过 duration_factor 时长因子控制,有效范围 0.5–2.0 倍:数值大于 1 语速变慢,小于 1 变快。本站已做成滑杆交互,生成前拖动即可。注意它控制的是"时长"而非"速度倍率",2.0 版本未开放此能力,为 2.5 新增。
怎么控制情绪?
三种方式任选:① 上传一段情绪参考音频;② 调节 8 维情绪向量(高兴、愤怒、悲伤、害怕、厌恶、忧郁、惊讶、平静)的类型与强度;③ 直接用文字描述情绪。官方中英情绪感知评测中 2.5 的整体准确率分别为 0.713 和 0.673。
音色和情绪可以来自不同的人吗?
可以。这是 IndexTTS 系列的特色能力:音色参考与情绪参考彼此解耦,可以来自不同说话人,甚至不同语言。例如用你自己的声音做音色、用一段外语表演音频做情绪,生成"你的声音 + 那种情绪"的语音。
支持跨语言克隆吗?
支持。可以用中文参考音频直接生成英语、日语、西班牙语、阿拉伯语语音。官方中文提示跨语言评测中,RL 版平均 WER 6.17、说话人相似度 70.20。这对多语言内容出海是核心能力。
各语种效果一样吗?
不一样。官方评测中西班牙语 WER 3.33 表现最好,中文 3.93、英文 3.89、日语 5.30,阿拉伯语 13.58 相对偏高。五语种均已开放在线生成;阿拉伯语内容建议先小样本试听、满意后再批量生成。
能精确控制发音吗?
可以。2.5 支持三种发音控制:中文拼音、英文 CMU 音素、日语假名。遇到多音字、专有名词、人名读错时,可对单个字词指定读音,比 2.0 仅支持中文拼音的范围明显扩大。
生成的音频可以商用吗?
模型采用官方发布的 bilibili Model Use License:在遵守条款的前提下授予免版税使用权,常规规模的个人与商业使用可行(月活超 1 亿或年营收超 10 亿元的使用方需另行取得书面许可)。同时你需要对输入文本和克隆的声音拥有相应权利,生成内容的合规风险由使用者承担。
本地部署需要什么配置?
当前官方仓库要求 Python ≥3.10 且 <3.12,Linux/Windows 遇 CUDA 问题需安装 CUDA Toolkit 12.8+,需 NVIDIA 显卡;模型权重可从 Hugging Face 或 ModelScope 下载,官方支持 vLLM 生产部署。不想折腾环境可直接用本站在线版。
IndexTTS 怎么下载?本地部署需要什么显卡?
IndexTTS 的代码与模型权重在官方 GitHub 仓库与 Hugging Face、ModelScope 开源,可直接下载;部分社区也提供整合包简化安装。本地部署需 NVIDIA 显卡与 Python 3.10–3.12 环境,显存越大越适合长文本。不想下载数 GB 权重、不想配环境,可直接用本站在线版,浏览器即开即用。
在线版和本地部署怎么选?
偶尔生成、没有显卡、想快速出结果——选在线版,浏览器打开即用。需要批量离线生成、二次开发、或数据完全不出本机——选本地部署。详见上方对比表,两种方式使用的是同一个开源模型的能力。
可以克隆别人的声音吗?
仅限本人声音或已获得明确授权的声音。未经授权克隆他人声音可能侵犯声音权益并违反相关法律法规。本站在克隆流程中会要求确认你对参考音频拥有合法权利,请勿上传未经授权的他人录音、影视或名人音频。
生成的内容有 AI 标识吗?
有。按照深度合成相关管理规定,本站生成的音频会添加 AI 生成标识。对外发布时请保留标识,不要将生成音频用于伪造他人言论、诈骗或其他误导性用途。
这是 IndexTTS 官方网站吗?
本站是基于开源 IndexTTS 2.5 模型独立搭建的在线服务平台;模型由 IndexSpeech 团队开源发布。查阅模型本身的代码、论文与权重,请访问官方 GitHub 仓库(github.com/index-tts/index-tts)。查找“IndexTTS 官网”或“index tts / index-tts”时请注意:这些写法指的都是同一个开源项目 IndexTTS。

🛡️ 安全使用说明

  • 克隆边界:仅可克隆本人声音或已取得明确授权的声音;请勿上传未授权的他人录音、影视片段或名人音频。
  • 内容边界:禁止将生成音频用于伪造他人言论、诈骗、骚扰、虚假宣传或其他违法违规用途。
  • AI 标识:本站生成的音频按深度合成相关规定添加 AI 生成标识,对外发布时请予以保留。
  • 商用说明:商业使用的前提是你对输入素材与克隆声音拥有相应权利;模型许可证条款以官方仓库为准。

现在开始,克隆你的第一个声音

免下载、免显卡、免配环境 · 上传一段参考音频,数秒听到结果

立即免费试用
首页
声音模型
声音克隆