漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-18 talkingdev

苹果摄像头版 AirPods 演示视频泄露:macOS Tahoe 26.7 RC 曝光 Visual Intelligence 功能

科技记者 Juli Clover 在 macOS Tahoe 26.7 候选版本中发现一段视频,显示一名男子正在演示一副疑似配备摄像头的 AirPods,并借助 Visual Intelligence(视觉智能)完成环境识别。该视频出现在系统发布候选包中,通...

Read More
2026-06-02 talkingdev

Qwen3.7-Plus发布:统一视觉与语言的通用多模态智能体模型

阿里巴巴通义千问团队近日发布了其最新的多模态智能体模型Qwen3.7-Plus,标志着通用人工智能在感知与行动融合层面迈出了重要一步。该模型将视觉识别与语言理解能力深度融合,构建了一个单一、通用的多模态智能体基础...

Read More
2026-04-20 talkingdev

Anthropic推出Claude Design:基于Opus 4.7视觉模型,AI驱动设计协作新范式

Anthropic Labs今日正式发布Claude Design,标志着生成式AI在专业视觉创作领域迈出关键一步。该产品基于Claude Opus 4.7多模态视觉模型构建,能够协助用户高效生成设计原型、商业演示文稿、营销单页等视觉内容。其核...

Read More
2025-08-05 talkingdev

开源|ScreenCoder:将UI截图秒变网页代码的模块化多智能体系统

GitHub开源项目ScreenCoder推出了一项突破性技术,通过模块化多智能体架构实现UI设计稿到代码的自动化转换。该系统具备三大核心技术能力:1)基于计算机视觉的界面元素识别;2)动态布局规划算法;3)自适应代码生成...

Read More
2025-04-26 talkingdev

[开源] Magnitude:基于视觉大模型的Web应用测试框架,开源发布

开发者Anders和Tom近日在Hacker News上宣布推出Magnitude,一个完全开源的、基于视觉大模型(VLM)的端到端Web应用测试框架。该框架旨在解决传统浏览器代理测试工具速度慢、成本高且结果不一致的问题。Magnitude采用...

Read More
2025-04-24 talkingdev

xAI聊天机器人Grok新增视觉识别功能,iOS用户可体验

马斯克旗下人工智能公司xAI推出的Grok聊天机器人近日迎来重要升级,新增了视觉识别能力。这一功能允许iOS用户上传图片或通过摄像头捕捉画面,随后向Grok提问关于所看到内容的问题。该功能与OpenAI的ChatGPT和谷歌的G...

Read More
2025-04-21 talkingdev

Gemini图像分割技术揭秘:轻松实现精准视觉识别

Gemini作为谷歌推出的多模态AI模型,其视觉能力一直备受业界关注。最新研究发现,Gemini在图像分割这一计算机视觉核心任务上展现出惊人的易用性。图像分割技术可将数字图像分解为多个具有语义意义的区域,是自动驾驶...

Read More
2024-09-20 talkingdev

3000个免费SVG图标,助力热门品牌形象提升

近日,设计师社区发布了3000个免费的SVG图标,专为热门品牌设计。这些图标涵盖了广泛的行业和用途,旨在为设计师、开发者以及品牌营销人员提供灵活的视觉资源。SVG格式的优势在于其可缩放性,使得这些图标在不同尺寸...

Read More
  1. Next Page