漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-16 talkingdev

谷歌发布Gemini 3.8 Live与3.5 Transcribe,实时语音应用开发再提速

谷歌正式发布Gemini 3.8 Live和Gemini 3.5 Transcribe,为开发者构建实时语音应用提供新一代工具组合。Gemini 3.8 Live聚焦实时交互场景,支持语音对话与即时响应;Gemini 3.5 Transcribe则强化语音识别与转录能力,...

Read More
2026-09-04 talkingdev

微软发布 MAI-Transcribe-2:号称全球最快、最准、最便宜的语音识别模型

微软正式发布 MAI-Transcribe-2 语音识别模型,官方宣称其在速度、准确率和成本方面全面领先,并超越 Gemini 3.5 Transcribe、GPT-Transcribe 和 Whisper V3-Large。该模型集成了说话人分离、可配置转录风格和词级时...

Read More
2026-08-28 talkingdev

设备端实时语音克隆新突破:Halo Neuro开源Sopro V2 Turbo

Halo Neuro正式发布Sopro V2语音克隆文本转语音模型家族,并开源其中的轻量级多语言模型Sopro V2 Turbo。该模型仅120M参数,具备语音克隆能力,支持多语言合成,并原生支持欧洲葡萄牙语,能够在笔记本CPU和浏览器环...

Read More
2026-08-06 talkingdev

字节跳动推出SeedRealtime:原生音视频实时交互模型,开启多模态对话新范式

字节跳动近日正式公开了其最新的原生音视频实时交互模型SeedRealtime,该模型突破了传统语音助手仅依赖音频或文本的限制,能够同时处理连续的视频、音频和文本流,并以人类对话般的自然速度进行实时语音回应。这一技...

Read More
2026-08-05 talkingdev

OpenAI发布GPT-Live:仅用六个月打造全双工实时语音AI系统,对话再无延迟感

OpenAI近期公开了其最新的实时语音交互系统GPT-Live,标志着语音AI从“交替发言”正式迈入“自然共时”的新阶段。该系统以连续语音处理为核心,实现了全双工通信,彻底抛弃了传统语音助手依赖的轮流对话检测机制。在架构...

Read More
2026-08-04 talkingdev

OpenAI 实时语音架构深度揭秘:半年打造全双工GPT-Live,人机对话迈入“无间断”时代

OpenAI 近期公开了其低延迟实时语音系统 GPT-Live 的技术细节,展示了一套仅用六个月构建的全新架构。区别于传统的轮流发言模式,GPT-Live 采用了全双工语音模型,能够实现一边聆听一边发言的连续对话,大幅减少了交...

Read More
2026-08-03 talkingdev

独家:微软正内测全新MAI Realtime语音模型,双向全双工对话更自然

微软首个原生实时语音模型“MAI Realtime”日前在MAI Playground中以隐藏早期访问条目浮出水面。该模型采用双向全双工架构,能够同时监听与说话,彻底打破传统语音助手“你一句我一句”的轮流对话模式。目前提供Victoria...

Read More
2026-06-10 talkingdev

Gemini 3.5 Live Translate:实时语音翻译,消除尴尬停顿,带来自然对话体验

谷歌近日发布了Gemini 3.5 Live Translate,这是一个全新的音频模型,专注于实现实时语音到语音的翻译。与传统的语音翻译相比,该模型支持超过70种语言,并致力于消除翻译过程中常见的尴尬停顿,同时保持语调和情感...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page