漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-09 talkingdev

Cohere发布North Mini Code超内核推理引擎:解码速度达vLLM 1.58倍

Cohere近日公布了专为North Mini Code模型打造的超内核(Megakernel)推理服务引擎,将一次完整的解码过程合并进一个常驻GPU内核,而不是像传统方案那样为每个操作启动独立内核。这种设计能够显著减少内核启动开销和...

Read More
2025-06-20 talkingdev

LLM编译技术重大突破:单核化Megakernel实现低延迟推理

传统大型语言模型(LLM)系统普遍存在硬件利用率低下的问题,主要源于GPU内核的序列化启动及跨设备通信开销。一支研究团队创新性地开发出专用编译器,可将LLM推理过程自动编译为单一megakernel(超级内核),通过三大...

Read More
2025-06-20 talkingdev

将大语言模型编译为MegaKernel:低延迟推理的新路径

近日,一篇关于将大语言模型(LLMs)编译为单一MegaKernel以实现低延迟推理的技术文章引发广泛讨论。该技术通过优化编译器设计,将传统需要多个内核调用的LLM推理过程整合为高度融合的单一内核,显著减少了内核启动...

Read More