漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-25 talkingdev

NVIDIA Groq 3 LPX AI推理加速芯片全面量产,Vera Rubin迎来史上最快Token生成速度

NVIDIA的Groq 3 LPX AI推理加速芯片现已进入全面量产阶段。Groq 3 LPX机架作为NVIDIA Vera Rubin平台的扩展,显著提升了AI推理能力,能够为响应敏感型智能体(Agentic)工作负载提供超高速的Token生成表现。在面向智...

Read More
2026-08-14 talkingdev

OpenAI发布GPT-5.6 Sol超高速模式:推理速度最高提升14倍,每秒输出750 tokens

OpenAI正式预览了GPT-5.6 Sol的Ultrafast模式,该模式在推理速度上实现显著突破,最高可生成750个输出token/秒,整体处理速度达到标准模式的14倍。值得关注的是,这一性能提升并非通过切换更小的轻量模型来实现,而...

Read More
2026-08-11 talkingdev

开源|antirez发布h3-metal:将MiniMax H3原生推理引擎搬上Mac,M3 Max/M5 Max获极致Metal优化

知名开发者antirez(Redis之父)在GitHub上推出了新项目h3-metal,将MiniMax最新的H3模型原生带入苹果芯片生态。该项目并非简单的模型移植,而是一个完全面向Apple Silicon的推理引擎,当前已支持prompt直接生成视频...

Read More
2026-08-07 talkingdev

AMD宣布收购AI芯片初创公司Taalas,定制化硅片将AI模型直接“烧录”进硬件

美国芯片巨头AMD已同意收购多伦多AI芯片创业公司Taalas。这家由前AMD员工及Tenstorrent核心成员创立的公司,专注于将AI模型“硬连线”进定制硅片,从而在前沿推理场景中大幅打破计算与内存瓶颈。与传统依赖通用GPU或庞...

Read More
2026-07-28 talkingdev

Cogent发布前沿网络推理模型VR-1,自主渗透测试能力翻倍

人工智能安全公司Cogent推出了其最新的前沿网络推理模型VR-1,该模型经过专门的后训练,能够自主探查陌生企业环境、组合跨系统弱点,并通过实际执行验证攻击路径。VR-1的核心能力在于模拟真实攻击链:从有限初始访问...

Read More
2026-07-23 talkingdev

告别昂贵算力:Petals让大模型在家用显卡上分布式运行成为现实

Petals 是一个颠覆性的点对点网络平台,它让普通用户能够在自己家中,仅凭消费级GPU甚至是免费的Google Colab笔记本环境,就运行起像 Llama 3.1、Mixtral、Falcon 和 BLOOM 这类巨型语言模型。其核心技术思路是将大...

Read More
2026-07-21 talkingdev

谷歌秘密研发新一代AI芯片Frozen v2,或将大幅降低Gemini推理成本

据TechCrunch报道,谷歌母公司Alphabet正在秘密推进一项代号为Frozen v2的服务器芯片项目,目标是在2028年前后实现部署。这款芯片专为提升Gemini系列大模型的运行效率而设计,其核心突破在于能效比:与谷歌现有的AI...

Read More
2026-06-24 talkingdev

开源|Graphsignal Profiler:生产级AI推理性能剖析利器,助力模型与GPU极致优化

Graphsignal Profiler 是一个面向生产环境的推理性能剖析平台,专为大规模 AI 推理场景设计。它能够跨越模型、推理引擎、GPU 及其他加速器,提供全栈式的性能可见性,帮助工程师精准定位瓶颈并优化推理效率。与传统...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page