本文へ移動

テクノロジー

マルチモーダル・動画 AI

視覚・音声・動画生成のモデルとその計算需要。

//

今週

  • Nemotron 3.5 コンテンツセーフティアップデートNemotron 3.5 は、統合されたマルチモーダル評価、グローバルな言語カバレッジ、カスタムポリシーの強制、および論理的トレースを導入し、NVIDIA のコンテンツセーフティ技術を拡張しています。安定テクノロジー1件の情報源 · 一次情報 1件 · 3件の証拠2026-06-05 02:57
  • LFM2.5-VL-DSparkを発表 ビジョン・ランゲージモデルにおける推測的デコードが導入されました会社は、ビジョン・ランゲージモデル(VLM)LFM2.5-VL-3B用の実験的なDSparkドラフトモデルをリリースしました。このモデルは、CPUとGPUの両方で推論速度を向上させるために、speculative decodingを導入していますが、出力品質には影響を与えません。安定テクノロジー1件の情報源 · 一次情報 1件 · 3件の証拠2026-09-24 22:08
  • メタがミューズ・グリムを発表Metaは、ローカル、エージェント、マルチモーダル、オープンソースのAIモデルであるMuse Glimmerをリリースしました。このモデルには、推測デコードやさまざまな推論エンドポイントへのサポートなどの高度な機能が搭載されています。安定テクノロジー1件の情報源 · 一次情報 1件 · 3件の証拠2026-08-10
  • Gemini OmniはマルチモーダルAIモデルとして発表されました。Gemini Omni、これはGeminiから新たに発表されたAIモデルで、ビデオをはじめとするあらゆるものをあらゆる入力から生成できる。これは以前のGeminiモデルであるNano Bananaの成功を踏まえており、数百万の人々に画像の生成と編集を支援した。安定1件の情報源 · 一次情報 1件 · 4件の証拠2026-05-18 03:50

今週の検証済みの変化4件。

日次の動き

進行中
10月3日610月7日
このトピックのシグナル