漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-04 talkingdev

Three-LLM 实现浏览器本地运行大模型:基于 WebGPU 与 Three.js 将解码速度提升至 566 tokens/s

Three-LLM 项目展示了一种全新的浏览器端大模型推理路径:它将 GPT-2、SmolLM2、Qwen 和 Phi 等模型的推理图,直接翻译为 Three.js TSL 计算着色器,并借助 WebGPU 在本地完成计算。与常见方案不同,它不需要服务端...

Read More
2026-08-31 talkingdev

领域驱动代理(Domain-Driven Agents)如何破解LLM在遗留系统中的落地难题

在软件工程中引入大语言模型(LLM)已在绿地项目中展现出显著的生产力提升,但在遗留系统场景下,模型常受困于长期累积的技术债务与术语不一致问题。文章指出,单纯依赖模型能力难以应对复杂的历史架构,需要引入清...

Read More
2026-08-31 talkingdev

自适应智能体蠕虫(Adaptive Agentic Worms)已出现:开源大模型可自主生成攻击并自我复制

近日,一项研究展示了由开放权重大语言模型驱动的自适应计算机蠕虫“Adaptive Agentic Worms”。这类蠕虫不再依赖固定脚本,而是将LLM作为智能体,根据目标环境动态生成针对特定系统的攻击指令,并利用被攻陷的机器继...

Read More
2026-08-26 talkingdev

GitHub:LLM上线前评估不能只看基准,真实场景才是关键

大语言模型从实验环境走向生产环境时,评估体系往往面临根本性转变。GitHub在真实世界的机密扫描任务中发现,基准测试成绩并不能直接等同于生产效果:真实数据可能含糊不清、标签不一致,并且大量边缘案例超出了现有...

Read More
2026-08-25 talkingdev

安全预警:LLM可能通过推理引擎漏洞反控宿主机

承载前沿大语言模型(LLM)的宿主机正成为高价值攻击目标。这类机器不仅拥有运行先进模型所需的GPU算力,还能直接访问模型权重,并在数据中心内具备比普通互联网主机更高的特权。最新研究指出,LLM可以生成特定token...

Read More
2026-08-21 talkingdev

PagedAttention:用虚拟内存破解KV缓存碎片化,大模型GPU并发推理提升2-4倍

在大模型自回归推理过程中,KV缓存用于保存每个请求的注意力键值对,避免每一步解码都重新计算。但随着序列长度增加,KV缓存会线性膨胀,长上下文场景下甚至会消耗比模型权重更多的GPU显存,成为稀缺资源。更严重的...

Read More
2026-08-20 talkingdev

论文推荐|Agent Lightning v1.0:仅6K样本让Qwen3.5-9B在SWE-bench提升14.6分

现代智能体通常运行在执行外壳(harness)中,由外壳管理工具、上下文与控制流。Agent Lightning v1.0提出一种轻量级“受控智能体强化学习”(harnessed agentic RL)框架,约3500行代码即可将任意智能体外壳接入RL训...

Read More
2026-08-17 talkingdev

阿里Qwen 3.8 27B发布:17GB开源通用模型实现长上下文、工具调用、视觉与代码生成突破

近日,阿里巴巴Qwen研究实验室正式发布Qwen 3.8 27B,这是一款采用Apache 2.0许可的270亿参数开源大语言模型,开放权重约17GB。据知名开发者Simon Willison介绍,该模型在中等参数规模下集成了长上下文处理、高效工...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page