漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-07-18 talkingdev

中国日消耗AI令牌量飙升至140万亿,字节跳动员工月耗近10亿枚

中国国家数据管理局最新数据显示,2026年3月全国每日AI令牌消耗量已突破140万亿枚,较2025年12月的100万亿枚和2024年初的1000亿枚呈指数级增长。这一数字背后折射出中国科技巨头在人工智能领域的疯狂竞速,大模型训...

Read More
2026-07-15 talkingdev

阿联酋以协助美国对伊行动换取AI芯片自由采购权,G42主导转型拟成美国公司

据《华尔街日报》披露,阿联酋因在伊朗相关军事行动中为美国提供关键协助,获得了美国政府放宽人工智能芯片出口限制的回报。这一地缘技术交易使阿联酋主权AI机构G42得以在至少九个月内自由采购先进的美国AI芯片,不...

Read More
2026-07-13 talkingdev

论文推荐| 稀疏训练技术取得突破:大幅降低大语言模型计算成本,小型机构也能担纲

一项新研究探索了利用稀疏技术高效训练大语言模型的方法,旨在显著减少算力开销的同时保持模型性能。该方案通过引入结构化稀疏与动态剪枝策略,在训练前期识别并冻结低重要性参数,使有效参数量呈指数级下降,从而降...

Read More
2026-05-19 talkingdev

开源|大模型预训练的“模式跳跃”:语言模型如何从鹦鹉学舌到展现智能?

一项最新研究揭示了语言模型在预训练过程中的一个惊人现象:它们并非平稳地提升能力,而是在“模仿”和“智能行为”之间突然切换,研究人员将其称为“模式跳跃”。这种非连续性的行为转变无法通过标准的优化技术(如调整学...

Read More
2026-04-30 talkingdev

DeepSpeed整合AutoSP:自动序列并行技术,轻松训练超长上下文LLM

PyTorch官方博客近日发布了一项名为AutoSP的创新技术,该技术旨在自动化地将标准Transformer训练代码转换为序列并行代码,用于长上下文大语言模型(LLM)的训练。AutoSP已与微软的DeepSpeed框架深度集成,使得开发者...

Read More
2026-04-30 talkingdev

OpenAI 转向灵活算力租赁,星际之门巨型数据中心计划名存实亡

据最新报道,OpenAI 已实质上放弃了最初雄心勃勃的“星际之门”(Stargate)自建超大规模数据中心集群计划。该计划最初宣称要建设20个巨型数据中心,但据报道,由于项目合作方在数据中心的最终控制权上无法达成一致,...

Read More
2025-12-19 talkingdev

开源|History LLMs:训练于1913年前文本的“历史专家”大语言模型项目引发热议

一个名为“History LLMs”的开源项目在技术社区引发了广泛关注。该项目旨在训练迄今为止规模最大的、专门基于1913年之前历史文本的大型语言模型。其核心构想是通过构建一个纯净的“前现代”语料库——即排除所有1913年之后...

Read More
2025-12-03 talkingdev

Mistral AI发布Mistral 3系列开源模型:含稀疏MoE巨兽与多款密集模型

人工智能领域迎来重要开源进展。Mistral AI正式发布了其新一代Mistral 3系列模型,该系列包含两大技术路线:一是三款不同规模的密集模型(参数规模分别为140亿、80亿和30亿),二是备受瞩目的Mistral Large 3稀疏混...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page