漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-29 talkingdev

ElevenLabs发布Eleven v4:迄今最具表现力的文本转语音模型,Turbo版延迟仅约100毫秒

ElevenLabs正式推出Eleven v4及Eleven v4 Turbo,这是其迄今最具情感表现力的文本转语音模型。Eleven v4能够识别并生成语气、节奏、情绪、角色和上下文等细微变化,使合成语音呈现戏剧化、温柔、紧迫、喜剧或日常对...

Read More
2026-08-28 talkingdev

设备端实时语音克隆新突破:Halo Neuro开源Sopro V2 Turbo

Halo Neuro正式发布Sopro V2语音克隆文本转语音模型家族,并开源其中的轻量级多语言模型Sopro V2 Turbo。该模型仅120M参数,具备语音克隆能力,支持多语言合成,并原生支持欧洲葡萄牙语,能够在笔记本CPU和浏览器环...

Read More
2026-01-09 talkingdev

开源|Sopro TTS:仅1.69亿参数,支持零样本语音克隆的轻量级CPU端模型

近日,GitHub上开源了一个名为Sopro的轻量级文本转语音(TTS)模型,其核心亮点在于仅包含1.69亿参数,却实现了零样本语音克隆能力,并能在普通CPU上流畅运行。该项目由开发者samuel-vitorino发布,迅速在技术社区引...

Read More
2025-12-18 talkingdev

开源|Chatterbox:支持情感控制与零样本语音克隆的SOTA开源TTS模型发布

近日,由Resemble AI团队在GitHub上开源了名为Chatterbox的文本转语音模型,标志着开源TTS领域迈入了一个新的技术高度。该项目被定位为当前最先进的开源TTS解决方案,其核心亮点在于集成了多语言支持、精细化的情感...

Read More
2025-07-11 talkingdev

Cactus:支持手机部署LLM/VLM/TTS跨平台框架

开发者Henry和Roman近日推出开源项目Cactus,这是一个专为智能手机设计的跨平台框架,支持本地部署大型语言模型(LLM)、视觉语言模型(VLM)和文本转语音(TTS)模型。与Ollama专注于笔记本和边缘服务器不同,Cactu...

Read More
2025-07-08 talkingdev

🗣️ Rime推出极具个性的AI语音技术,引领人机交互新趋势

Rime公司近日推出了市场上最逼真、最具表现力的AI语音技术,能够创造出听起来像普通人而非机器人或配音演员的智能语音体验。这一技术不仅显著提升了用户体验,还为像达美乐这样的品牌带来了两位数的转化率增长。Rime...

Read More
2025-07-04 talkingdev

KyutaiTTS开源-支持流式传输与低延迟的TTS引擎

法国研究机构Kyutai Labs近日开源其文本转语音(TTS)系统Kyutai TTS,该技术凭借L40S GPU实现32请求并行处理时仅350毫秒的延迟表现,达到行业领先水平。系统创新性地提供单词级时间戳输出功能,英语和法语的字错误...

Read More
2025-05-06 talkingdev

[开源]VoiceStar文本转语音模型:零样本语音克隆与情感控制新突破

近日,GitHub上开源了一个名为VoiceStar的文本转语音(TTS)模型,该模型在零样本语音克隆和情感表达控制方面展现出显著优势。VoiceStar能够通过极少的样本数据实现高质量的语音克隆,这意味着用户只需提供几秒钟的...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page