首页 最新 热门 推荐

  • 首页
  • 最新
  • 热门
  • 推荐

一款刚刚开源的TTS语音模型!25ms超低延迟支持实时对话,4种规格适配全场景!

  • 25-04-25 05:40
  • 4054
  • 7539
juejin.cn

在 TTS 领域,情感表达的自然度和实时性一直是两大挑战。传统模型往往在延迟和语音质量间难以平衡。

近两年 TTS 模型也发展的越来越好,也有越来越多的功能全面的 TTS 模型面世。

Orpheus TTS 是一款刚刚发布的开源 TTS 模型,它以其接近人类的自然情感表达、超低延迟的实时输出以及强大的零样本语音克隆能力,迅速成为开源社区关注的焦点。

不仅能生成流畅自然、充满情感的声音,还将延迟压缩到令人惊叹的 25-50 毫秒,完美适配实时对话场景。

并且提供了从 150M 到 3B 参数的四种型号,满足不同场景的需求。支持零样本语音克隆和灵活的情感控制,可让每个人都能轻松定制专属音色。

图片

核心亮点

  • 超低延迟:支持实时流式推理,延迟低至约200毫秒,通过压缩最低可至 25-50 毫秒

  • 自然情感表达:支持丰富的情感和语调控制,支持高兴、悲伤、生气、困倦等多种情绪

  • 零样本语音克隆:无需预训练,仅需提供参考音频即可克隆目标音色

  • 提供 4 种模型规模:Medium (3B)、Small (1B)、Tiny (400M)、Nano (150M)

  • 端到端语音生成:还未上线,上线即可提升语音自然度、可控性及生成速度

快速使用

Orpheus TTS 的安装和使用过程简单,支持本地部署。

如果想要直接体验该TTS工具,HF平台上也有在线Demo可体验(需魔法)。

图片

在线Demo:

huggingface.co/spaces/Moha…

本地部署步骤:

① 克隆项目

bash
代码解读
复制代码
git clone https://github.com/canopyai/Orpheus-TTS.git cd Orpheus-TTS

② 安装依赖

代码解读
复制代码
pip install orpheus-speech

③ Python调用示例

ini
代码解读
复制代码
from orpheus_tts import OrpheusModel import wave import time model = OrpheusModel(model_name ="canopylabs/orpheus-tts-0.1-finetune-prod") prompt = '''Man, the way social media has, um, completely changed how we interact is just wild, right? Like, we're all connected 24/7 but somehow people feel more alone than ever. And don't even get me started on how it's messing with kids' self-esteem and mental health and whatnot.''' start_time = time.monotonic() syn_tokens = model.generate_speech(    prompt=prompt,    voice="tara",    ) with wave.open("output.wav", "wb") as wf:    wf.setnchannels(1)    wf.setsampwidth(2)    wf.setframerate(24000)    total_frames = 0    chunk_counter = 0    for audio_chunk in syn_tokens: # output streaming       chunk_counter += 1       frame_count = len(audio_chunk) // (wf.getsampwidth() * wf.getnchannels())       total_frames += frame_count       wf.writeframes(audio_chunk)    duration = total_frames / wf.getframerate()    end_time = time.monotonic()    print(f"It took {end_time - start_time} seconds to generate {duration:.2f} seconds of audio")

写在最后

传统语音合成(TTS)系统面临三大核心挑战:情感表达生硬、推理延迟过高(普遍>500ms)、克隆音色需大量数据。

Orpheus TTS通过混合专家架构(MoE)与KV缓存优化,在150M到3B参数范围内实现:MOS评分达4.6、端到端延迟压至25ms、零样本语音克隆、超强情感控制。

适用于 AI 语音助手、游戏配音、有声读物、虚拟客服、智能语音交互等 多种应用,兼顾 高质量语音合成 & 实时交互体验,是当前最具潜力的开源 TTS 方案之一!

GitHub 项目地址:github.com/canopyai/Or…

注:本文转载自juejin.cn的梓羽玩Python的文章"https://juejin.cn/post/7483796304724967459"。版权归原作者所有,此博客不拥有其著作权,亦不承担相应法律责任。如有侵权,请联系我们删除。
复制链接
复制链接
相关推荐
发表评论
登录后才能发表评论和回复 注册

/ 登录

评论记录:

未查询到任何数据!
回复评论:

分类栏目

后端 (14832) 前端 (14280) 移动开发 (3760) 编程语言 (3851) Java (3904) Python (3298) 人工智能 (10119) AIGC (2810) 大数据 (3499) 数据库 (3945) 数据结构与算法 (3757) 音视频 (2669) 云原生 (3145) 云平台 (2965) 前沿技术 (2993) 开源 (2160) 小程序 (2860) 运维 (2533) 服务器 (2698) 操作系统 (2325) 硬件开发 (2492) 嵌入式 (2955) 微软技术 (2769) 软件工程 (2056) 测试 (2865) 网络空间安全 (2948) 网络与通信 (2797) 用户体验设计 (2592) 学习和成长 (2593) 搜索 (2744) 开发工具 (7108) 游戏 (2829) HarmonyOS (2935) 区块链 (2782) 数学 (3112) 3C硬件 (2759) 资讯 (2909) Android (4709) iOS (1850) 代码人生 (3043) 阅读 (2841)

热门文章

109
人工智能
关于我们 隐私政策 免责声明 联系我们
Copyright © 2020-2025 蚁人论坛 (iYenn.com) All Rights Reserved.
Scroll to Top