漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-05 talkingdev

论文推荐|DiffusionGemma:基于离散扩散的超高速语言模型,单卡H100每秒生成1500 Token

来自Google的研究团队发布了DiffusionGemma技术报告,提出了一种实验性的开源权重语言模型,通过离散扩散生成文本,速度远超传统自回归模型。DiffusionGemma并未从零训练,而是在专家混合架构Gemma 4(激活参数38亿...

Read More
2026-07-29 talkingdev

微软推出轻量级多模态模型家族Mage:4B参数实现高效训练与部署

微软研究团队近期发布了Mage,一个专为研究场景设计的轻量级多模态模型家族。该系列模型严格遵循40亿参数的固定预算,在保持紧凑架构的同时,性能足以比肩规模大得多的开源系统。Mage包含两大核心成员:Mage-VL和Mag...

Read More
2026-07-13 talkingdev

论文推荐| 稀疏训练技术取得突破:大幅降低大语言模型计算成本,小型机构也能担纲

一项新研究探索了利用稀疏技术高效训练大语言模型的方法,旨在显著减少算力开销的同时保持模型性能。该方案通过引入结构化稀疏与动态剪枝策略,在训练前期识别并冻结低重要性参数,使有效参数量呈指数级下降,从而降...

Read More
2026-03-05 talkingdev

微软发布Phi-4推理视觉模型:15B参数实现多模态推理,懂得“何时思考”以提升效率

微软近日发布了Phi-4-reasoning-vision-15B,这是一款开源的、权重开放的多模态视觉AI模型。该模型仅包含150亿参数,却在数学、科学、文档及用户界面(UI)推理任务上,达到了与参数量大数倍的模型相当甚至更优的性...

Read More
2025-10-06 talkingdev

LoRA无憾:低秩适配技术全面匹敌全参数微调,突破大模型高效训练瓶颈

思维机器实验室最新研究揭示了低秩适配技术(LoRA)在大语言模型微调领域的突破性表现。这项发表于权威平台的研究表明,当LoRA应用于模型所有层(尤其是MLP层)且不受数据集规模限制时,其性能可完全媲美传统全参数...

Read More
2025-08-24 talkingdev

突破性进展:研究者用CUDA C++实现5090光速级Flash Attention算法

近日,一项名为《Writing Speed-of-Light Flash Attention for 5090 in CUDA C++》的技术研究引发广泛关注。该研究通过CUDA C++实现了针对5090硬件的光速级Flash Attention算法,显著提升了注意力机制的计算效率。Fl...

Read More
2025-07-18 talkingdev

[论文推荐] 突破长文本限制:新型“Power”注意力机制实现高效训练

一项名为“Power”注意力的创新技术通过引入超参数p,实现了对状态大小的独立控制,有效解决了长上下文训练中计算成本平衡的难题。该机制在长序列任务中表现优于标准注意力,并支持定制GPU内核,在64k上下文长度下速度...

Read More
2025-06-24 talkingdev

强化学习新突破:AI通过试错与创新方法实现高效训练

强化学习(RL)作为一种让AI模型通过试错而非简单模仿人类示例进行学习的技术,正展现出其在复杂任务处理中的独特优势。最新行业动态显示,科技公司正在采用两种创新方法大幅扩展训练数据规模:一是利用AI模型相互评...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page