漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-07-12 talkingdev

Anthropic提出GRAM方法:为AI模型内的双用途知识装上可关闭的“开关”

AI模型在学习过程中不可避免地会掌握大量“双用途知识”——既能用于网络防御、漏洞检测等正面场景,也可能被用于网络攻击和信息窃取等恶意目的。如何在不削弱模型整体能力的前提下,精准管控这类敏感知识,一直是AI安全...

Read More
2026-06-30 talkingdev

DiScoFormer:单一Transformer模型,跨分布同时估计密度与得分,性能碾压传统KDE

近日,AI2研究团队在Hugging Face博客上发布了DiScoFormer模型,这是一种基于Transformer架构的创新方法,能够在单次前向传播中同时完成数据的密度估计和得分函数估计,而无需针对新分布进行重新训练。与经典的核密...

Read More
2026-05-30 talkingdev

代码差异渲染新突破:Pierre社区发布零擦除渲染技术深度解析

在代码审查与版本控制领域,差异渲染(Diffs Rendering)一直是开发者关注的焦点。近日,开发者Pierre在个人博客上发布了一篇技术深度文章,详细介绍了其构建的@pierre/diffs包及CodeView组件,核心亮点在于实现了一...

Read More
2026-04-19 talkingdev

NIST科学家实现突破:在微型硅基光路中制造“任意波长”激光器

美国国家标准与技术研究院(NIST)的科学家及其合作者近期取得了一项重大技术突破,他们开发出一种创新方法,能够在硅晶圆上沉积复杂图案的特殊材料,从而制造出用于光的集成光路,并实现了“任意波长”激光器的微型化...

Read More
2026-04-08 talkingdev

开源|TriAttention:基于三角函数的KV缓存压缩技术,助力大模型长上下文推理在内存受限GPU上本地部署

近日,GitHub上开源了一个名为TriAttention的项目,其核心是一种创新的KV(键值)缓存压缩技术。该技术旨在解决大语言模型在处理长上下文任务时,因KV缓存占用内存巨大而难以在消费级或内存受限的GPU上高效部署的行...

Read More
2026-04-06 talkingdev

论文推荐|简单自蒸馏显著提升大模型代码生成能力,无需额外验证器或强化学习

一项名为‘简单自蒸馏’(Simple Self-Distillation, SSD)的新方法为大语言模型的代码生成能力提升开辟了一条高效且成本低廉的路径。该方法的核心在于,仅利用模型自身在特定采样配置(如温度参数和截断策略)下生成...

Read More
2026-03-16 talkingdev

注意力残差:重新思考深度聚合,Moonshot AI提出新架构提升模型性能

在深度学习领域,残差连接(Residual Connections)是构建深层神经网络的关键技术,它通过将浅层特征直接传递到深层,有效缓解了梯度消失问题。然而,传统的残差连接通常采用固定、均匀的累加方式,这可能限制了模型...

Read More
2026-03-06 talkingdev

Anthropic发布新框架:量化AI对劳动力市场的冲击与早期证据

人工智能安全与研究公司Anthropic近期发布了一项重要研究,提出了一种全新的框架,旨在系统性地理解和衡量AI技术对劳动力市场的实际影响。该研究的目标是建立一个可重复、可验证的测量方法,以追踪AI如何具体影响就...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page