漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-25 talkingdev

安全预警:LLM可能通过推理引擎漏洞反控宿主机

承载前沿大语言模型(LLM)的宿主机正成为高价值攻击目标。这类机器不仅拥有运行先进模型所需的GPU算力,还能直接访问模型权重,并在数据中心内具备比普通互联网主机更高的特权。最新研究指出,LLM可以生成特定token...

Read More
2026-08-25 talkingdev

NVIDIA Groq 3 LPX AI推理加速芯片全面量产,Vera Rubin迎来史上最快Token生成速度

NVIDIA的Groq 3 LPX AI推理加速芯片现已进入全面量产阶段。Groq 3 LPX机架作为NVIDIA Vera Rubin平台的扩展,显著提升了AI推理能力,能够为响应敏感型智能体(Agentic)工作负载提供超高速的Token生成表现。在面向智...

Read More
2026-07-31 talkingdev

开源WASTE推理引擎发布:仅需29GB内存即可本地运行2700亿参数Kimi K3模型

近日,开源推理引擎WASTE正式亮相,其核心亮点在于能够运行权重规模远超宿主设备物理内存的模型。该引擎作为让强大模型在更多硬件上可用的初步举措,旨在为个人和机构在基础设施成本、数据隐私、可用性及部署方式上...

Read More
2026-06-30 talkingdev

DeepSeek开源DSpark新型框架,大模型推理速度飙升85%

DeepSeek近日正式开源了一款名为DSpark的创新框架,旨在显著加速大型语言模型(LLM)的推理过程,据称最高能将解码速度提升85%。这一突破性进展直接针对当前AI大模型在实际应用中普遍存在的响应延迟痛点。与传统模型...

Read More
2026-06-22 talkingdev

Morph发布代码生成模型优化方案:投机解码速度提升3倍,低端GPU也能跑出162 tok/s

Morph LLM近期发布了一系列针对开源代码生成模型的优化技术,旨在解决当前推理效率瓶颈。首先,团队通过训练一个专注于模型自身编码输出(而非通用互联网数据)的“起草模型”(drafter),在投机解码中取得了显著加速...

Read More
2026-05-28 talkingdev

万亿参数模型分布式训练新突破:Hugging Face 推出“Delta Weight Sync”技术,带宽开销从GB降至MB

Hugging Face 团队近日发布了一项名为“Delta Weight Sync”的创新技术,旨在解决大规模强化学习(RL)训练中的通信瓶颈问题。在训练拥有万亿参数量的模型时,传统的权重同步方式需要在训练器(Trainer)和推理引擎(I...

Read More
2026-04-23 talkingdev

AI推理新挑战:基准测试揭示智能体工作负载对引擎性能的深层影响

随着人工智能向智能体(Agent)方向演进,传统的大模型推理基准测试正面临根本性变革。智能体工作负载不再是简单的单轮问答,而是包含多轮交互、工具调用等复杂场景。这种变化给推理引擎带来了前所未有的压力,尤其...

Read More
2026-02-13 talkingdev

开源模型+Blackwell架构:头部推理服务商实现AI成本骤降10倍

近日,多家领先的AI推理服务提供商,包括Baseten、DeepInfra、Fireworks AI和Together AI,宣布通过在其服务中部署基于NVIDIA Blackwell架构的GPU并运行开源模型,成功将每次推理的令牌成本大幅降低了高达10倍。这一...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page