语言模型的相关内容 - 漫话开发者

2025-05-02 talkingdev

[开源] BLAST：斯坦福大学发布高性能浏览器-LLM自动扩展服务引擎

斯坦福大学MAST实验室推出的BLAST项目，是一款专为浏览器增强型大语言模型（LLM）设计的高性能服务引擎。该技术旨在简化网页浏览AI代理的部署流程，显著提升响应速度并优化成本管理。其核心创新包括：1）自动并行化...

2025-05-02 talkingdev

Fed-SB研究团队在arXiv最新论文中提出了一种突破性的联邦学习框架LoRA-SB，该技术通过低秩自适应(Low-Rank Adaptation, LoRA)方法实现大型语言模型(LLM)的高效分布式微调。这一创新方案通过参数高效微调(PEFT)技术，...

2025-05-02 talkingdev

本文系统介绍了如何结合检索增强生成（RAG）技术与大语言模型运维（LLMOps）构建高仿真智能体的技术路径。作为当前AI领域的前沿方向，该方案通过实时监控智能体的决策过程、知识检索准确性和生成质量等关键指标，显...

2025-05-02 talkingdev

艾伦人工智能研究所（Allen Institute for AI）近日发布了OLMo-2-1B语言模型，这是一款参数规模为1B的小型开源模型。该项目的突破性意义在于其完全透明的训练范式：研究团队不仅公开了模型权重，还完整披露了训练数...

2025-05-02 talkingdev

微软近日发布了Phi-4-reasoning系列变体，这一创新标志着小型语言模型（SLMs）在效率与复杂推理能力上的重大进展。Phi-4-reasoning通过算法优化和架构改进，在保持参数规模精简的同时，实现了接近大型语言模型（LLMs...

2025-05-01 talkingdev

最新研究表明，通过在大语言模型（LLM）的残差流中实施简单的表征控制向量干预，可显著调节其推理性能。这项发表于arXiv的突破性研究揭示了神经网络内部表征与逻辑推理能力的直接关联，为可解释AI领域提供了新工具。...

2025-04-30 talkingdev

小米近日在GitHub上开源了MiMo推理模型项目，该项目旨在解锁语言模型的推理潜力，涵盖从预训练到后训练的全过程。MiMo模型通过优化训练流程和引入新的推理机制，显著提升了语言模型在复杂任务中的表现。这一开源项目...

2025-04-30 talkingdev

人工智能研究机构Inception Labs近日正式发布了商用级扩散语言模型Mercury，标志着自然语言处理技术向大规模商业化应用迈出重要一步。该模型基于先进的扩散概率模型框架，通过多阶段训练策略实现了文本生成的稳定性...