漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-01 talkingdev

开源|FnScribe:macOS 本地语音听写工具,快捷键一键输入、隐私不落云

FnScribe 是一款面向 macOS 的私有化语音听写工具,核心特点是语音转写在本地完成,不需要将录音上传至云端,从而降低敏感语音数据外泄风险。用户可以通过快捷键在任意活跃应用中启动听写,并支持免提操作,适合写作...

Read More
2026-08-28 talkingdev

设备端实时语音克隆新突破:Halo Neuro开源Sopro V2 Turbo

Halo Neuro正式发布Sopro V2语音克隆文本转语音模型家族,并开源其中的轻量级多语言模型Sopro V2 Turbo。该模型仅120M参数,具备语音克隆能力,支持多语言合成,并原生支持欧洲葡萄牙语,能够在笔记本CPU和浏览器环...

Read More
2026-08-27 talkingdev

Meta推出Muse Image图像生成模型:先推理后渲染,单图成本仅0.01美元

Meta推出的Muse Image图像生成模型,其核心特点在于能够基于搜索结果进行图像生成,并在最终渲染前执行推理过程。这意味着模型不再仅依赖训练数据中的视觉模式,而是可以结合外部信息来约束生成结果,有望提升图像的...

Read More
2026-08-27 talkingdev

谷歌发布Gemini 3.5 Transcribe:智能语音转写进入格式化新时代

谷歌正式推出Gemini 3.5 Transcribe,这是面向智能语音交互场景的新一代语音转文本模型。它能够将原始音频直接转换为准确、经过润色并完成格式化的文本,减少用户在后期整理和编辑上的工作量。该模型现已在Gemini AP...

Read More
2026-08-20 talkingdev

Meta Muse Video 视频模型独家样片曝光:原生音频与10秒级时间一致性表现抢眼

Meta 旗下的 Muse Video 视频生成模型已进入封闭测试阶段。根据曝光的早期生成样片,该模型在 10 秒级视频中展现出较高的细节还原能力、对场景的理解能力以及时间一致性,并且原生支持音频生成。这意味着 Muse Video...

Read More
2026-07-31 talkingdev

MiniMax发布H3开源模型:首创文图视音统一上下文,直出2K立体声视频

MiniMax正式推出开源模型H3,首次在单一模型中打破了任务与模态的边界,实现了文本、图像、视频和音频的统一理解与生成。H3不再是简单的多模态拼接,而是在统一上下文中进行深层语义融合,尤其在视频生成领域带来了...

Read More
2026-07-30 talkingdev

NVIDIA提出并行解码蒸馏技术:仅用4步评估实现视频生成新标杆

NVIDIA研究团队最新发布了并行解码蒸馏(Parallel Decoding Distillation)技术,该方法通过在一次模型评估中同时预测多个去噪步骤,显著减少了扩散模型在图像和视频生成时所需的迭代次数。不同于传统需要数十甚至上...

Read More
2026-07-27 talkingdev

开源|Instatic:全能自托管CMS崛起,欲做Webflow与WordPress的开源终结者

GitHub上新晋开源项目Instatic正在引发Dev社区关注。作为一个自托管的可视化内容管理系统,它将可视化编辑器、内容引擎与发布工具全部封装进单一服务端,用户只需极少配置即可快速搭建并发布站点。Instatic定位为 We...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page