漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-01 talkingdev

开源|FnScribe:macOS 本地语音听写工具,快捷键一键输入、隐私不落云

FnScribe 是一款面向 macOS 的私有化语音听写工具,核心特点是语音转写在本地完成,不需要将录音上传至云端,从而降低敏感语音数据外泄风险。用户可以通过快捷键在任意活跃应用中启动听写,并支持免提操作,适合写作...

Read More
2026-08-28 talkingdev

开源|腾讯开源BrowserSkill:让AI智能体用你的真实浏览器干活,不打断工作

腾讯在GitHub开源了BrowserSkill项目,旨在解决AI智能体与真实浏览器环境之间的协作难题。该项目通过本地命令行接口与浏览器扩展协同,使AI智能体能够直接操作用户已登录的浏览器,无需中断当前工作或切换到自动化专...

Read More
2026-08-07 talkingdev

Generative UI:像生成Minecraft一样生成用户界面

Generative UI(生成式用户界面)正试图从根本上改变人机交互的形态,它将传统AI聊天中冗长的“文字墙”替换为根据用户意图动态生成的交互界面。这一范式被划分为三类生成模式:静态/受控生成,模型仅选择工具参数,由...

Read More
2026-08-01 talkingdev

印度应用市场迎来“付费觉醒”:Sensor Tower 报告 Q2 消费者支出破纪录达 3.45 亿美元,ChatGPT 下载量霸榜、收入第二

根据 Sensor Tower 发布的最新数据,印度移动应用市场在 2026 年第二季度实现历史性突破,消费者支出达到创纪录的 3.45 亿美元,同比增长 35%。这一数据标志着印度市场正从“全球最大应用下载市场但难以变现”的旧标签...

Read More
2026-07-31 talkingdev

MiniMax发布H3开源模型:首创文图视音统一上下文,直出2K立体声视频

MiniMax正式推出开源模型H3,首次在单一模型中打破了任务与模态的边界,实现了文本、图像、视频和音频的统一理解与生成。H3不再是简单的多模态拼接,而是在统一上下文中进行深层语义融合,尤其在视频生成领域带来了...

Read More
2026-07-24 talkingdev

开源|吴恩达团队发布OpenWorker:本地桌面AI同事,跨文件跨应用自主完成任务

人工智能领军人物吴恩达(Andrew Ng)在GitHub上开源了一个名为OpenWorker的新项目。该项目旨在构建一个运行在本地桌面端的AI同事,它能够理解用户指令,自主跨越不同的文件、文件夹乃至桌面应用程序来执行复杂工作...

Read More
2026-07-22 talkingdev

通义千问发布Qwen-Image-3.0图像生成模型:支持4.5k token输入,原生渲染12种语言

阿里巴巴通义千问团队近日正式推出第三代基础图像生成模型Qwen-Image-3.0,在内容丰富度、细节真实感和世界知识融合方面实现全面升级。该模型支持最高4.5k token的文本输入,能够精准理解复杂长文本的语义,并生成富...

Read More
2026-07-17 talkingdev

Wispr Flow:让语音输入秒杀键盘,AI 应用的“嘴”替时代来了

当我们还在为向 ChatGPT 或 Claude 输入一段精准提示词而反复斟酌措辞时,一款名为 Wispr Flow 的工具正试图让键盘成为次选项。它并非简单的语音转文字,而是专为 AI 交互打造的流式语音输入引擎,支持用自然口语一...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page