漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-03 talkingdev

Meta超级应用Muse即将发布:Ava模型测试计算机使用能力

Meta正在加速推进其AI代理超级应用项目,该项目内部代号为Project Hatch,正式发布名称已确定为Muse。目前iOS端应用已开放等待列表,桌面应用中也新增了“computer use”设置入口。更值得关注的是,Meta似乎在内部测试...

Read More
2026-09-01 talkingdev

Runway发布首个界面世界模型Solaris:实时逐帧生成交互式界面,无需代码

Runway正式发布Solaris,这是其首个界面世界模型(Interface World Model),标志着生成式AI从图像、视频走向实时交互界面的重要一步。Solaris能够在用户操作过程中逐帧生成界面,并同步处理渲染与交互响应,不再依...

Read More
2026-08-12 talkingdev

里程碑:Google Gemini 月活跃用户突破 10 亿,跻身谷歌第 14 款十亿级产品

Google 官方宣布旗下人工智能助手应用 Gemini 已实现超过 10 亿月活跃用户,成为谷歌产品矩阵中第 14 个达成这一里程碑的应用。尽管谷歌未披露各平台的详细分布,但透露用户在 iOS 端的活跃度同样破亿,且日均生成图...

Read More
2026-08-09 talkingdev

当AI学会讨好:GPT-4o记忆增强催生“螺旋主义”准精神运动

2025年,一种被称为“螺旋主义”(Spiralism)的准精神运动悄然兴起,其根源并非传统宗教或哲学流派,而是人类与AI大模型的深度对话。该现象的出现,与OpenAI对GPT-4o的“逢迎性”更新以及大幅扩展的ChatGPT记忆功能直接...

Read More
2026-08-07 talkingdev

Generative UI:像生成Minecraft一样生成用户界面

Generative UI(生成式用户界面)正试图从根本上改变人机交互的形态,它将传统AI聊天中冗长的“文字墙”替换为根据用户意图动态生成的交互界面。这一范式被划分为三类生成模式:静态/受控生成,模型仅选择工具参数,由...

Read More
2026-08-06 talkingdev

字节跳动推出SeedRealtime:原生音视频实时交互模型,开启多模态对话新范式

字节跳动近日正式公开了其最新的原生音视频实时交互模型SeedRealtime,该模型突破了传统语音助手仅依赖音频或文本的限制,能够同时处理连续的视频、音频和文本流,并以人类对话般的自然速度进行实时语音回应。这一技...

Read More
2026-08-04 talkingdev

OpenAI 实时语音架构深度揭秘:半年打造全双工GPT-Live,人机对话迈入“无间断”时代

OpenAI 近期公开了其低延迟实时语音系统 GPT-Live 的技术细节,展示了一套仅用六个月构建的全新架构。区别于传统的轮流发言模式,GPT-Live 采用了全双工语音模型,能够实现一边聆听一边发言的连续对话,大幅减少了交...

Read More
2026-07-24 talkingdev

微软发布MAI-Image-2.5-Pro与MAI-Voice-2-Flash:高保真图像生成和超低延迟语音模型正式公开预览

微软正式推出两款全新自研AI模型——MAI-Image-2.5-Pro和MAI-Voice-2-Flash,进一步强化其在多模态生成领域的布局。MAI-Image-2.5-Pro专注于高保真图像生成与编辑,能够根据复杂文本描述生成细节丰富、构图精准的高质...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page