随着DeepSeek-V4-Pro等1.6万亿参数Mixture-of-Experts(MoE)模型同时发布FP8与FP4权重,如何在真实资源约束下高效服务前沿模型成为AI基础设施团队的核心挑战。LMSYS博客文章指出,服务配置不应仅依据硬件规格或孤立...
Read More英伟达与OpenAI正接近敲定一项围绕美国俄亥俄州大型数据中心园区的财务安排。根据最新协议,英伟达将为该项目第一阶段提供财务担保,对应电力规模约5吉瓦;OpenAI则需在后续阶段自行决定剩余部分的融资方式和节奏。...
Read MoreNVIDIA研究团队近日推出了一项名为WorldTrace的训练无关框架,直指视频世界模型在长时序自回归生成中的关键短板——记忆遗忘与生成质量退化。该工作通过为压缩的键值记忆赋予稳定、分布内位置偏移的方式,确保记忆在远...
Read More英伟达推出了全新的Nemotron 3.5 Lightning模型和NeMo Switchyard开源库,旨在大幅降低AI代理的推理成本并提升效率。Nemotron 3.5 Lightning是一个拥有300亿参数的混合专家模型(MoE),专为高吞吐量的专用代理任务...
Read More美国芯片巨头AMD已同意收购多伦多AI芯片创业公司Taalas。这家由前AMD员工及Tenstorrent核心成员创立的公司,专注于将AI模型“硬连线”进定制硅片,从而在前沿推理场景中大幅打破计算与内存瓶颈。与传统依赖通用GPU或庞...
Read More来自Google的研究团队发布了DiffusionGemma技术报告,提出了一种实验性的开源权重语言模型,通过离散扩散生成文本,速度远超传统自回归模型。DiffusionGemma并未从零训练,而是在专家混合架构Gemma 4(激活参数38亿...
Read MoreMistral AI正式发布Shieldstral,这是一款参数量仅为3B的开放权重多模态安全分类器。它能够同时处理文本与图像输入,并在推理时直接接受用自然语言描述的安全策略,无需针对不同政策重新训练模型。尽管体量轻巧,Shi...
Read MoreNVIDIA研究团队最新发布了并行解码蒸馏(Parallel Decoding Distillation)技术,该方法通过在一次模型评估中同时预测多个去噪步骤,显著减少了扩散模型在图像和视频生成时所需的迭代次数。不同于传统需要数十甚至上...
Read More