漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-07-28 talkingdev

Ramp Labs开源PorTAL框架:一次训练即可跨模型复用LoRA任务表示

Ramp Labs近日正式开源了PorTAL框架,这是一个面向共享任务表示与跨模型LoRA适配的前沿工具。PorTAL的核心思路在于将任务知识与基座模型解耦:它首先学习一个与模型架构无关的“任务隐变量”,再通过轻量级的逐模型对...

Read More
2026-07-22 talkingdev

Poolside 发布 Laguna S 2.1:1180 亿参数 MoE 模型,专攻智能体编程,上下文窗口突破 100 万 token

专攻 AI 编码的初创公司 Poolside 在 Hugging Face 上正式发布了其最新大型语言模型 Laguna S 2.1。该模型采用混合专家架构,总参数量高达 1180 亿,但每个 token 仅激活其中 80 亿个参数,在保持强大能力的同时实现...

Read More
2025-04-07 talkingdev

[论文推荐]Rope to Nope:混合注意力机制突破长上下文处理极限

Meta最新发布的Llama 4模型通过创新性的混合位置编码策略,实现了超过1000万tokens的上下文处理能力。该技术核心在于交替使用无位置嵌入(NoPE)和旋转位置嵌入(RoPE),在保持计算效率的同时显著扩展了上下文窗口...

Read More
2024-06-25 talkingdev

混合注意力MoA在大型语言模型中的应用

混合注意力(MoA)方法在大型语言模型中优化稀疏注意力,通过为不同的头部和层定制独特的稀疏注意力配置。该方法通过改变稀疏注意力的配置,使模型可以更有效地处理复杂的语言模型,从而提高模型的性能和效率。

Read More