Spark-TTS,极简版音频克隆

干啥的？
如果你是播客，经常在b站发视频解说之类的
可以录制一段你说话的录音
然后输入一段文本，生成音频，用你的音色生成一段音频
你还可以叫猪八戒给你讲故事
等等等等
使用方法非常简单
上传一段参考音频或者录制你自己的声音
输入你想转换成音频的文本
点击开始克隆即可

Spark-TTS是一款先进的文本转语音（Text-to-Speech，TTS）系统，
它利用大型语言模型（Large Language Model，LLM）的强大功能，实现了高度准确且自然流畅的语音合成。
该系统旨在为研究和生产使用提供高效、灵活且强大的解决方案。

Spark-TTS的核心优势在于其简洁性和效率。
它完全基于Qwen2.5构建，无需额外的生成模型，如流匹配模型等。
这一设计使得Spark-TTS能够直接从LLM预测的代码中重构音频，从而简化了流程，提高了效率，并降低了复杂性。
这种创新的方法使得Spark-TTS在语音合成领域具有显著的优势。

此外，Spark-TTS还支持零样本语音克隆（Zero-Shot Voice Cloning），
这意味着它可以复制说话者的声音，而无需为该声音提供特定的训练数据。
这一功能在跨语言和代码切换场景中尤为有用，它允许Spark-TTS在不同的语言和声音之间无缝切换，而无需为每个语言或声音分别进行训练。

Spark-TTS还支持中文和英文，这使得它能够在多种语言环境中提供高质量的语音合成服务。
同时，通过调整参数如性别、音调和语速等，Spark-TTS还可以创建虚拟说话者，为用户提供更加个性化的语音合成体验。

然而，需要注意的是，Spark-TTS主要用于学术研究、教育目的以及合法应用，如个性化语音合成、辅助技术和语言学研究等。
用户在使用时应遵守当地法律法规和道德规范，不得将Spark-TTS用于未经授权的语音克隆、冒充、欺诈、诈骗、深度伪造或任何非法活动。

jian27打包 https://www.jian27.com/html/1459.html

我在jian27打包基础上进行了二次负优化
将我不需要的web界面进行了删减
删减了原包中用不上的文件，压缩包整体进行了减肥(原作 5.99gb，本站负优化后，4.11gb)
修复了一个致命bug
当文本输入框中有回车换行时，原作只会生成第一句，剩下的都舍弃了
本站所发的版本已经修复该问题，回车也不影响音频生成
另外还加了显存回收

效果的话，大概能达到原音参考音频的7成左右
某些时候转换出来的音频会语速较快

需要黄皮显卡，显存4gb以上即可
推荐6gb以上显卡

运行界面.jpg