漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-28 talkingdev

设备端实时语音克隆新突破:Halo Neuro开源Sopro V2 Turbo

Halo Neuro正式发布Sopro V2语音克隆文本转语音模型家族,并开源其中的轻量级多语言模型Sopro V2 Turbo。该模型仅120M参数,具备语音克隆能力,支持多语言合成,并原生支持欧洲葡萄牙语,能够在笔记本CPU和浏览器环...

Read More
2026-08-06 talkingdev

字节跳动推出SeedRealtime:原生音视频实时交互模型,开启多模态对话新范式

字节跳动近日正式公开了其最新的原生音视频实时交互模型SeedRealtime,该模型突破了传统语音助手仅依赖音频或文本的限制,能够同时处理连续的视频、音频和文本流,并以人类对话般的自然速度进行实时语音回应。这一技...

Read More
2026-08-06 talkingdev

AI语音赛道融资额一年暴涨7倍,OpenAI和谷歌押注语音成下一代AI代理核心交互界面

根据PitchBook的最新数据,全球AI语音初创公司在2026年第一季度共获得70亿美元融资,而该数字在2025年同期仅为10亿美元,同比增幅高达600%。这一爆发式增长反映出资本对语音赛道的强烈信心,背后推手是人工智能行业...

Read More
2026-06-10 talkingdev

Gemini 3.5 Live Translate:实时语音翻译,消除尴尬停顿,带来自然对话体验

谷歌近日发布了Gemini 3.5 Live Translate,这是一个全新的音频模型,专注于实现实时语音到语音的翻译。与传统的语音翻译相比,该模型支持超过70种语言,并致力于消除翻译过程中常见的尴尬停顿,同时保持语调和情感...

Read More
2026-05-12 talkingdev

Thinking Machines Lab发布交互模型:实时人机协作的可扩展新范式

Thinking Machines Lab 近日发布了一项名为“交互模型”的研究预览,旨在通过音频、视频和文本三种模态,实现人类与人工智能之间的实时协作。该模型采用从头训练的“多流架构”,能够持续处理与交换多模态信息,彻底打破...

Read More
2026-05-11 talkingdev

OpenAI发布实时语音翻译构建指南,专为同声传译优化的GPT模型登场

OpenAI近日发布了一份工程指南,详细介绍了如何使用其最新优化的模型gpt-realtime-translate构建实时语音翻译系统。该模型专为同声传译场景设计,与传统的轮次语音交互不同,它能实现对语音流进行实时、连续的翻译处...

Read More
2026-05-08 talkingdev

谷歌Gemma大模型提速3倍!投机解码技术揭秘:小模型“草稿师”成关键

谷歌近期在Gemma大型语言模型上实现了令人瞩目的推理速度提升,成功将性能提升了三倍。这一突破性进展的核心在于采用了“投机解码”(Speculative Decoding)技术。该技术的工作原理是部署一个轻量级、速度极快的“草稿...

Read More
2026-05-08 talkingdev

OpenAI再掀语音革命:发布GPT-Realtime多模态实时音频模型,开启对话式AI新纪元

OpenAI近日在API中正式推出了一系列全新的实时音频模型,标志着语音交互技术迈入了一个全新阶段。该系列包括三款核心模型:GPT-Realtime-2,专注于增强对话式推理能力,能够实现更自然、更具逻辑性的实时语音对话;G...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page