漫话开发者 - UWL.ME 精选全球AI前沿科技和开源产品
2026-09-01 talkingdev

谷歌发布TimesFM-3:万亿时间点预训练,多变量预测进入零样本时代

谷歌近日发布TimesFM-3,这是一款拥有3.3亿参数的时间序列基础模型,预训练数据规模超过1万亿个时间点。该模型聚焦零样本预测,可在不进行任务特定微调的情况下对多个目标变量进行联合预测,并支持历史协变量和已知...

Read More
2026-08-11 talkingdev

大模型知识截止日期背后:通过精准探测逆向推演GPT与Claude的训练时间线与数据混合秘辛

一项颇具技术趣味的研究揭示了如何通过向GPT、Claude等前沿大模型提出精心设计的问题,来逆向推断模型训练过程中的隐藏事实。研究人员发现,用特定领域的冷门知识对模型进行评分,可以大致估算出模型的参数量规模;...

Read More
2026-08-10 talkingdev

模型基因组:给大模型做个“DNA鉴定”,一眼看穿是否从零训练

在开源大语言模型百花齐放的今天,一个模型究竟是真正从零开始预训练,还是基于现有开源权重衍生微调,常让外界难以分辨。Hugging Face社区发布的“Model Genome”项目,首次提出用类似生物基因指纹的方式为模型“验明...

Read More
2026-08-07 talkingdev

字节跳动被曝预训练10万亿参数超大模型,规模达Kimi K3的三倍,刷新行业纪录

据《金融时报》援引知情人士消息,TikTok母公司字节跳动正在预训练一个参数量高达10万亿的超大规模人工智能模型。这一数字大约是月之暗面Kimi K3模型参数量的三倍,也超过了Anthropic传闻中Mythos 5约8万亿参数的预...

Read More
2026-07-23 talkingdev

美国能源部联手Arcee AI推出开放权重模型Genesis-Science-1,助力科学计算可复现

美国能源部与开放智能实验室Arcee AI宣布联合开发Genesis-Science-1(GS1),一个面向科学计算工作流的开放权重AI模型。该项目旨在解决科学研究中计算流程难以复现的长期痛点,通过透明、可定制的模型架构和开放权重...

Read More
2026-07-14 talkingdev

DeepMind推出GenCeption:视频生成预训练变身通用视觉模型,多任务六合一实测SOTA

DeepMind提出了GenCeption,将预训练的视频生成模型重新设计为一种可通过文本指令控制的统一视觉系统,引发学界关注。该模型基于前馈、非自回归的生成式架构,不需要针对下游任务进行微调即可同时处理深度估计、表面...

Read More
2026-07-13 talkingdev

论文推荐| 稀疏训练技术取得突破:大幅降低大语言模型计算成本,小型机构也能担纲

一项新研究探索了利用稀疏技术高效训练大语言模型的方法,旨在显著减少算力开销的同时保持模型性能。该方案通过引入结构化稀疏与动态剪枝策略,在训练前期识别并冻结低重要性参数,使有效参数量呈指数级下降,从而降...

Read More
2026-06-26 talkingdev

DeepReinforce开源Ornith-1.0编程模型:能自我编写强化学习框架,性能比肩Claude Opus 4.7

DeepReinforce近日开源了其新一代编程模型家族Ornith-1.0,这一系列模型的最大亮点在于具备自我编写强化学习(RL)训练框架的能力,标志着AI模型在自我优化和自动化研究方向上迈出重要一步。Ornith-1.0家族基于预训...

Read More
  1. 1
  2. 2
  3. 3
  4. Next Page