漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-04 talkingdev

Three-LLM 实现浏览器本地运行大模型:基于 WebGPU 与 Three.js 将解码速度提升至 566 tokens/s

Three-LLM 项目展示了一种全新的浏览器端大模型推理路径:它将 GPT-2、SmolLM2、Qwen 和 Phi 等模型的推理图,直接翻译为 Three.js TSL 计算着色器,并借助 WebGPU 在本地完成计算。与常见方案不同,它不需要服务端...

Read More
2026-08-21 talkingdev

PagedAttention:用虚拟内存破解KV缓存碎片化,大模型GPU并发推理提升2-4倍

在大模型自回归推理过程中,KV缓存用于保存每个请求的注意力键值对,避免每一步解码都重新计算。但随着序列长度增加,KV缓存会线性膨胀,长上下文场景下甚至会消耗比模型权重更多的GPU显存,成为稀缺资源。更严重的...

Read More
2026-07-30 talkingdev

开源|TurboFieldfare:任意M系列MacBook仅需2GB内存即可运行Gemma 4 26B-A4B模型

苹果生态中内存长期被认为是大模型本地推理的瓶颈,而TurboFieldfare项目提供了一个极具突破意义的解决方案。这个专门为Apple Silicon Mac设计的自定义运行时,让庞大的Gemma 4 26B-A4B模型(完整加载需约14.3 GB内...

Read More
2026-07-28 talkingdev

谷歌云发布Gemini蒸馏服务:用gemini-2.5-flash复现大模型推理能力

谷歌云在Gemini企业智能体平台上正式推出Gemini蒸馏服务(Gemini Distillation Service),旨在通过大型“教师”模型的输出和推理路径,训练出更小、更高效的“学生”模型。该服务专门针对高吞吐量、低延迟严苛要求的应...

Read More
2026-07-23 talkingdev

告别昂贵算力:Petals让大模型在家用显卡上分布式运行成为现实

Petals 是一个颠覆性的点对点网络平台,它让普通用户能够在自己家中,仅凭消费级GPU甚至是免费的Google Colab笔记本环境,就运行起像 Llama 3.1、Mixtral、Falcon 和 BLOOM 这类巨型语言模型。其核心技术思路是将大...

Read More
2026-06-30 talkingdev

DeepSeek开源DSpark新型框架,大模型推理速度飙升85%

DeepSeek近日正式开源了一款名为DSpark的创新框架,旨在显著加速大型语言模型(LLM)的推理过程,据称最高能将解码速度提升85%。这一突破性进展直接针对当前AI大模型在实际应用中普遍存在的响应延迟痛点。与传统模型...

Read More
2026-06-24 talkingdev

开源|Graphsignal Profiler:生产级AI推理性能剖析利器,助力模型与GPU极致优化

Graphsignal Profiler 是一个面向生产环境的推理性能剖析平台,专为大规模 AI 推理场景设计。它能够跨越模型、推理引擎、GPU 及其他加速器,提供全栈式的性能可见性,帮助工程师精准定位瓶颈并优化推理效率。与传统...

Read More
2026-05-12 talkingdev

开源|AutoTTS:无需梯度更新,用编码Agent自动探索测试时扩展策略

在AI大模型推理成本与日俱增的背景下,测试时扩展(Test-Time Scaling)正成为提升模型性能的前沿方向之一。近日,来自开源社区的项目AutoTTS提出了一种全新的自动化策略发现框架,旨在通过编码Agent在回放环境中迭...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page