漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-08-26 talkingdev

GitHub:LLM上线前评估不能只看基准,真实场景才是关键

语言模型从实验环境走向生产环境时,评估体系往往面临根本性转变。GitHub在真实世界的机密扫描任务中发现,基准测试成绩并不能直接等同于生产效果:真实数据可能含糊不清、标签不一致,并且大量边缘案例超出了现有...

Read More
2026-08-25 talkingdev

安全预警:LLM可能通过推理引擎漏洞反控宿主机

承载前沿大语言模型(LLM)的宿主机正成为高价值攻击目标。这类机器不仅拥有运行先进模型所需的GPU算力,还能直接访问模型权重,并在数据中心内具备比普通互联网主机更高的特权。最新研究指出,LLM可以生成特定token...

Read More
2026-08-25 talkingdev

中国关联黑客组织加速AI网络攻击:DeepSeek与Kimi K3成主要工具

据彭博社报道,安全研究人员发现,多个被认为具有中国国家背景的黑客组织正越来越多地将DeepSeek、Kimi K3等开源权重大语言模型整合到网络攻击行动中,用于生成钓鱼邮件、辅助恶意代码开发、开展目标侦察与情报分析...

Read More
2026-08-21 talkingdev

AI真的会“思考”吗?梅拉妮·米切尔称其为“异类智能”:我们可能测错了方向

计算机科学家梅拉妮·米切尔认为,当前对人工智能“智能”的讨论常常陷入拟人化误区。她指出,大语言模型表现出的对话、推理和解题能力,并不意味着它们像人类一样思考或理解,而更像一种“异类智能”。为了更准确地衡量...

Read More
2026-08-18 talkingdev

AI起草法案“淹没”美国众议院立法顾问:修复耗时竟超从头撰写

据Politico报道,美国众议院立法顾问办公室正面临大量由生成式人工智能工具起草的立法提案。消息人士透露,这些AI生成的法案在法条表述、格式规范、条款一致性等方面频繁出错,甚至出现虚构内容,国会律师不得不耗费...

Read More
2026-08-17 talkingdev

阿里Qwen 3.8 27B发布:17GB开源通用模型实现长上下文、工具调用、视觉与代码生成突破

近日,阿里巴巴Qwen研究实验室正式发布Qwen 3.8 27B,这是一款采用Apache 2.0许可的270亿参数开源大语言模型,开放权重约17GB。据知名开发者Simon Willison介绍,该模型在中等参数规模下集成了长上下文处理、高效工...

Read More
2026-08-16 talkingdev

菲尔兹奖得主Timothy Gowers:LLM解决著名数学问题几乎全靠反例而非证明

近日,菲尔兹奖得主、知名数学家Timothy Gowers在其博客发文探讨大语言模型(LLM)在数学研究中真正擅长的任务类型。他指出,目前LLM参与解决的许多著名数学问题,几乎都是通过构造反例来完成的,而不是给出完整严格...

Read More
2026-08-14 talkingdev

空货架还是丢钥匙?谷歌研究:GPT-5与Gemini 3事实性错误的瓶颈在“回忆”

大模型事实性错误常被简单归因为训练知识不足,但谷歌研究团队通过知识画像框架对Gemini 3、GPT-5等先进模型进行分析后发现,模型对事实知识的编码已接近饱和,真正的瓶颈出现在参数化回忆阶段。也就是说,模型并非...

Read More
  1. Prev Page
  2. 2
  3. 3
  4. 4
  5. Next Page