跳到正文

技术

多模态与视频 AI

能看、能听、能生成视频的模型及其算力需求。

//

本周

  • Nemotron 3.5 内容安全更新Nemotron 3.5 引入了统一的多模态评估、全球语言覆盖、自定义策略执行以及推理追踪,扩展了 NVIDIA 的内容安全技术。稳定技术1 个来源 · 1 个一手 · 3 条证据2026-06-05 02:57
  • LFM2.5-VL-DSpark 公布了具有推测解码功能的视觉-语言模型公司已发布其视觉-语言模型(VLM)LFM2.5-VL-3B的实验性DSpark草案模型,该模型采用推测解码技术以在CPU和GPU上提升推理速度,而不会影响输出质量。稳定技术1 个来源 · 1 个一手 · 3 条证据2026-09-24 22:08
  • Meta宣布Muse GlimmerMeta 已发布 Muse Glimmer,这是一款本地化、代理型、多模态且开源的 AI 模型,具备先进的功能,如推测解码和对多种推理端点的支持。稳定技术1 个来源 · 1 个一手 · 3 条证据2026-08-10
  • Gemini Omni被宣布为一个多功能AI模型Gemini Omni,一款来自Gemini的新AI模型,可以从任何输入中创建任何内容,首先从视频开始。它建立在之前Gemini模型Nano Banana的成功基础上,Nano Banana帮助了数百万用户进行图像生成和编辑。稳定1 个来源 · 1 个一手 · 4 条证据2026-05-18 03:50

本周 4 项已核实的变化。

每日活跃度

发展中
10月3日610月8日
该主题下的信号