AI模型在学习过程中不可避免地会掌握大量“双用途知识”——既能用于网络防御、漏洞检测等正面场景,也可能被用于网络攻击和信息窃取等恶意目的。如何在不削弱模型整体能力的前提下,精准管控这类敏感知识,一直是AI安全...
Read More近日,AI2研究团队在Hugging Face博客上发布了DiScoFormer模型,这是一种基于Transformer架构的创新方法,能够在单次前向传播中同时完成数据的密度估计和得分函数估计,而无需针对新分布进行重新训练。与经典的核密...
Read More在代码审查与版本控制领域,差异渲染(Diffs Rendering)一直是开发者关注的焦点。近日,开发者Pierre在个人博客上发布了一篇技术深度文章,详细介绍了其构建的@pierre/diffs包及CodeView组件,核心亮点在于实现了一...
Read More美国国家标准与技术研究院(NIST)的科学家及其合作者近期取得了一项重大技术突破,他们开发出一种创新方法,能够在硅晶圆上沉积复杂图案的特殊材料,从而制造出用于光的集成光路,并实现了“任意波长”激光器的微型化...
Read More近日,GitHub上开源了一个名为TriAttention的项目,其核心是一种创新的KV(键值)缓存压缩技术。该技术旨在解决大语言模型在处理长上下文任务时,因KV缓存占用内存巨大而难以在消费级或内存受限的GPU上高效部署的行...
Read More一项名为‘简单自蒸馏’(Simple Self-Distillation, SSD)的新方法为大语言模型的代码生成能力提升开辟了一条高效且成本低廉的路径。该方法的核心在于,仅利用模型自身在特定采样配置(如温度参数和截断策略)下生成...
Read More在深度学习领域,残差连接(Residual Connections)是构建深层神经网络的关键技术,它通过将浅层特征直接传递到深层,有效缓解了梯度消失问题。然而,传统的残差连接通常采用固定、均匀的累加方式,这可能限制了模型...
Read More人工智能安全与研究公司Anthropic近期发布了一项重要研究,提出了一种全新的框架,旨在系统性地理解和衡量AI技术对劳动力市场的实际影响。该研究的目标是建立一个可重复、可验证的测量方法,以追踪AI如何具体影响就...
Read More