テクノロジー
マルチモーダル・動画 AI
視覚・音声・動画生成のモデルとその計算需要。
//
今週
- Nemotron 3.5 コンテンツセーフティアップデートNemotron 3.5 は、統合されたマルチモーダル評価、グローバルな言語カバレッジ、カスタムポリシーの強制、および論理的トレースを導入し、NVIDIA のコンテンツセーフティ技術を拡張しています。安定テクノロジー1件の情報源 · 一次情報 1件 · 3件の証拠2026-06-05 02:57
- LFM2.5-VL-DSparkを発表 ビジョン・ランゲージモデルにおける推測的デコードが導入されました会社は、ビジョン・ランゲージモデル(VLM)LFM2.5-VL-3B用の実験的なDSparkドラフトモデルをリリースしました。このモデルは、CPUとGPUの両方で推論速度を向上させるために、speculative decodingを導入していますが、出力品質には影響を与えません。安定テクノロジー1件の情報源 · 一次情報 1件 · 3件の証拠2026-09-24 22:08
- メタがミューズ・グリムを発表Metaは、ローカル、エージェント、マルチモーダル、オープンソースのAIモデルであるMuse Glimmerをリリースしました。このモデルには、推測デコードやさまざまな推論エンドポイントへのサポートなどの高度な機能が搭載されています。安定テクノロジー1件の情報源 · 一次情報 1件 · 3件の証拠2026-08-10
- Gemini OmniはマルチモーダルAIモデルとして発表されました。Gemini Omni、これはGeminiから新たに発表されたAIモデルで、ビデオをはじめとするあらゆるものをあらゆる入力から生成できる。これは以前のGeminiモデルであるNano Bananaの成功を踏まえており、数百万の人々に画像の生成と編集を支援した。安定1件の情報源 · 一次情報 1件 · 4件の証拠2026-05-18 03:50
今週の検証済みの変化4件。
日次の動き
進行中
このトピックのシグナル
- 01Google DeepMindは、デバイス上で使用できる軽量なマルチモーダル埋め込みモデルであるEmbeddingGemma 2をリリースしました。Google DeepMindは、テキスト、画像、音声、および動画を共有された埋め込み空間で統合したオープンソースのマルチモーダル埋め込みモデルであるEmbeddingGemma 2をリリースしました。このモデルは740億のパラメータを持ち、Gemma 4アーキテクチャに基づいて構築され、Apache 2.0ライセンスで公開されています。テキストのみのワークロードでは191MBのRAMでデバイス上での推論をサポートしており、8Kトークンのコンテキストウィンドウを備えています。技術発表2026-10-07 03:57
- 02SmallRigは3rd Visionary Storytellers Industry Forumで2025-2026年のトップ12のグローバルイメージングシナリオレポートをリリースしましたSmallRigは深圳で3回目のVisionary Storytellers Industry Forumを開催し、「2025-2026年グローバルイメージングシナリオトップ12レポート」を発表しました。このレポートでは12の核心的なイメージングシナリオを特定し、モバイルシネマ、プロフェッショナルリソースのデセントラライゼーション、クリエイターの民主化、AIによるビデオ生成の4つの主要な産業トレンドを指摘しました。レポートは、次の5年間で周辺機器の成長率が9.2%になると予測しており、ホストデバイスを上回るとされています。技術発表2026-10-08 16:20
- 03アマゾンが改善されたボイスエージェント技術を発表Amazonは、音声エージェント向けに推論能力が向上し、レイテンシーが低減された音声間音声モデルであるAmazon Nova 2.5 Sonicをリリースしました。これにより、リアルタイムの音声インタラクションが改善されます。技術発表2026-10-05 16:10
- 04グーグルがEmbeddingGemma 2をリリース:マルチモーダルをサポートし、端末側のパフォーマンスを最適化グーグルは、多様なコンテンツをサポートし、7.4億のパラメータを持つEmbeddingGemma 2をリリースしました。このモデルはモバイル端末での実行に適しており、191MBのメモリで動作します。技術発表2026-10-07 06:41
- 05AiSearch: VLMを用いたインタラクティブマルチモーダル検索AiSearchは、画像および動画に対する自然言語検索をサポートする柔軟なマルチモーダル検索フレームワークを導入しました。これはビジョン言語モデルを使用しており、インタラクティブな検索精査とビジュアルベンチマークをサポートしています。技術発表2026-10-02 12:00
- 06Nemotron 3.5 コンテンツセーフティアップデートNemotron 3.5 は、統合されたマルチモーダル評価、グローバルな言語カバレッジ、カスタムポリシーの強制、および論理的トレースを導入し、NVIDIA のコンテンツセーフティ技術を拡張しています。技術発表2026-06-05 02:57
- 07アンドゥリル・インダストリーズは、バaltimore港に37億ドル規模の潜水艦部品工場を計画している。Anduril Industriesは、バaltimoreにある多モード物流ハブTradepoint Atlanticで submarine-component製造施設への投資を37億ドル行い、3,100人の永続的雇用を創出し、14,000人以上の雇用を支えることになります。新しい一次情報2026-10-07 03:00
- 08LFM2.5-VL-DSparkを発表 ビジョン・ランゲージモデルにおける推測的デコードが導入されました会社は、ビジョン・ランゲージモデル(VLM)LFM2.5-VL-3B用の実験的なDSparkドラフトモデルをリリースしました。このモデルは、CPUとGPUの両方で推論速度を向上させるために、speculative decodingを導入していますが、出力品質には影響を与えません。技術発表2026-09-24 22:08
- 09メタがミューズ・グリムを発表Metaは、ローカル、エージェント、マルチモーダル、オープンソースのAIモデルであるMuse Glimmerをリリースしました。このモデルには、推測デコードやさまざまな推論エンドポイントへのサポートなどの高度な機能が搭載されています。技術発表2026-08-10
- 10Gemini OmniはマルチモーダルAIモデルとして発表されました。Gemini Omni、これはGeminiから新たに発表されたAIモデルで、ビデオをはじめとするあらゆるものをあらゆる入力から生成できる。これは以前のGeminiモデルであるNano Bananaの成功を踏まえており、数百万の人々に画像の生成と編集を支援した。技術発表2026-05-18 03:50