漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-07-17 talkingdev

Wispr Flow:让语音输入秒杀键盘,AI 应用的“嘴”替时代来了

当我们还在为向 ChatGPT 或 Claude 输入一段精准提示词而反复斟酌措辞时,一款名为 Wispr Flow 的工具正试图让键盘成为次选项。它并非简单的语音转文字,而是专为 AI 交互打造的流式语音输入引擎,支持用自然口语一...

Read More
2026-07-12 talkingdev

OpenAI 发布 GPT-Live:全双工语音模型重塑人机对话体验

OpenAI 正式推出新一代语音模型 GPT-Live,现已驱动 ChatGPT 语音功能。该模型采用全双工架构,允许 AI 在说话的同时持续倾听,彻底打破传统一问一答的交互模式,实现更接近人类自然交流的同步对话。GPT-Live 能够实...

Read More
2026-07-12 talkingdev

OpenAI发布GPT-Live:全双工语音模型登场,ChatGPT语音对话迎来质变

OpenAI正式推出新一代语音模型GPT-Live,并已作为核心引擎驱动ChatGPT Voice。该模型首次实现了真正的全双工交互能力,能够同时进行聆听与讲话,彻底告别传统语音助手“轮流发言”的机械感。GPT-Live不仅可以捕捉和处...

Read More
2026-05-11 talkingdev

OpenAI发布实时语音翻译构建指南,专为同声传译优化的GPT模型登场

OpenAI近日发布了一份工程指南,详细介绍了如何使用其最新优化的模型gpt-realtime-translate构建实时语音翻译系统。该模型专为同声传译场景设计,与传统的轮次语音交互不同,它能实现对语音流进行实时、连续的翻译处...

Read More
2026-05-08 talkingdev

OpenAI 也面临 WebRTC 难题:AI 语音交互的实时性陷阱与 QUIC 替代方案

在 AI 语音交互技术飞速发展的今天,实时通信协议的选择正成为影响系统性能与可靠性的关键瓶颈。一篇来自 moq.dev 的最新技术分析文章指出,广泛使用的 WebRTC 协议并非 AI 语音应用的理想选择。WebRTC 的设计初衷是...

Read More
2026-05-08 talkingdev

OpenAI再掀语音革命:发布GPT-Realtime多模态实时音频模型,开启对话式AI新纪元

OpenAI近日在API中正式推出了一系列全新的实时音频模型,标志着语音交互技术迈入了一个全新阶段。该系列包括三款核心模型:GPT-Realtime-2,专注于增强对话式推理能力,能够实现更自然、更具逻辑性的实时语音对话;G...

Read More
2026-05-05 talkingdev

OpenAI披露低延迟语音AI全球架构:WebRTC分体中继与收发器模型成关键

OpenAI近日详细披露了其用于全球规模实时语音交互的低延迟基础设施架构。该架构基于重新设计的WebRTC协议,核心采用了分体中继(split relay)和收发器(transceiver)模型。通过将传统WebRTC的单一媒体传输路径拆解...

Read More
2026-04-08 talkingdev

开源|Clicky:macOS上的AI“桌面伙伴”,实时看屏、语音交互与光标指点

近日,一个名为Clicky的开源项目在GitHub上发布,为macOS用户带来了一种新颖的人机交互体验。该项目本质上是一个运行在光标侧的AI“教师”或“伙伴”,能够实时“看到”用户屏幕内容,并通过语音与用户交流,甚至能直接“指...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page