技术
多模态与视频 AI
能看、能听、能生成视频的模型及其算力需求。
//
本周
- Nemotron 3.5 内容安全更新Nemotron 3.5 引入了统一的多模态评估、全球语言覆盖、自定义策略执行以及推理追踪,扩展了 NVIDIA 的内容安全技术。稳定技术1 个来源 · 1 个一手 · 3 条证据2026-06-05 02:57
- LFM2.5-VL-DSpark 公布了具有推测解码功能的视觉-语言模型公司已发布其视觉-语言模型(VLM)LFM2.5-VL-3B的实验性DSpark草案模型,该模型采用推测解码技术以在CPU和GPU上提升推理速度,而不会影响输出质量。稳定技术1 个来源 · 1 个一手 · 3 条证据2026-09-24 22:08
- Meta宣布Muse GlimmerMeta 已发布 Muse Glimmer,这是一款本地化、代理型、多模态且开源的 AI 模型,具备先进的功能,如推测解码和对多种推理端点的支持。稳定技术1 个来源 · 1 个一手 · 3 条证据2026-08-10
- Gemini Omni被宣布为一个多功能AI模型Gemini Omni,一款来自Gemini的新AI模型,可以从任何输入中创建任何内容,首先从视频开始。它建立在之前Gemini模型Nano Banana的成功基础上,Nano Banana帮助了数百万用户进行图像生成和编辑。稳定1 个来源 · 1 个一手 · 4 条证据2026-05-18 03:50
本周 4 项已核实的变化。
每日活跃度
发展中
该主题下的信号
- 01Google DeepMind 发布了 EmbeddingGemma 2,这是一个轻量级的多模态嵌入模型,适用于设备端使用。Google DeepMind 已推出 EmbeddingGemma 2,这是一个开源的多模态嵌入模型,拥有 7.4 亿个参数,能够在共享嵌入空间中统一文本、图像、音频和视频。该模型基于 Gemma 4 架构,并采用 Apache 2.0 许可证发布,支持设备端推理,仅需 191MB RAM 即可处理纯文本任务,并具备 8K token 的上下文窗口。技术发布2026-10-07 03:57
- 02SmallRig 在第三届 Visionary Storytellers 行业论坛上发布了《2025-2026 全球影像场景 Top 12 报告》SmallRig 在深圳举办了第三届视觉叙事者产业论坛,并发布了《2025-2026 全球顶级 12 大成像场景报告》,该报告确定了 12 个核心成像场景和四个关键行业趋势,包括移动电影制作、专业资源去中心化、创作者民主化以及 AI 驱动的视频生成。报告预测,未来五年外围设备将增长 9.2%,增速将超过主机设备。技术发布2026-10-08 16:20
- 03亚马逊宣布改进的语音代理技术亚马逊发布了 Amazon Nova 2.5 Sonic,这是一种用于语音代理的更新版语音到语音模型,具有增强的推理能力和更低的延迟,从而改善了实时语音交互。技术发布2026-10-05 16:10
- 04谷歌推出 EmbeddingGemma 2:支持多模态,优化端侧性能谷歌推出 EmbeddingGemma 2,支持多模态内容,参数量为 7.4 亿,适用于手机端运行,仅需 191MB 内存。技术发布2026-10-07 06:41
- 05AiSearch:结合视觉语言模型的交互式多模态搜索AiSearch引入了一种灵活的多模态检索框架,利用视觉语言模型实现对图像和视频的自然语言搜索,支持交互式搜索精炼和视觉基准测试。技术发布2026-10-02 12:00
- 06Nemotron 3.5 内容安全更新Nemotron 3.5 引入了统一的多模态评估、全球语言覆盖、自定义策略执行以及推理追踪,扩展了 NVIDIA 的内容安全技术。技术发布2026-06-05 02:57
- 07安德里尔工业公司计划在巴尔的摩港建设价值37亿美元的潜艇部件工厂Anduril Industries正在特拉德普恩特大西洋(Tradepoint Atlantic)投资37亿美元,建设一个潜艇组件制造设施,该设施是一个位于巴尔的摩的多模式物流枢纽,将创造3100个永久性工作岗位,并支持超过14000个总就业岗位。新的一手结论2026-10-07 03:00
- 08LFM2.5-VL-DSpark 公布了具有推测解码功能的视觉-语言模型公司已发布其视觉-语言模型(VLM)LFM2.5-VL-3B的实验性DSpark草案模型,该模型采用推测解码技术以在CPU和GPU上提升推理速度,而不会影响输出质量。技术发布2026-09-24 22:08
- 09Meta宣布Muse GlimmerMeta 已发布 Muse Glimmer,这是一款本地化、代理型、多模态且开源的 AI 模型,具备先进的功能,如推测解码和对多种推理端点的支持。技术发布2026-08-10
- 10Gemini Omni被宣布为一个多功能AI模型Gemini Omni,一款来自Gemini的新AI模型,可以从任何输入中创建任何内容,首先从视频开始。它建立在之前Gemini模型Nano Banana的成功基础上,Nano Banana帮助了数百万用户进行图像生成和编辑。技术发布2026-05-18 03:50