JD.comが開発したJoyAI-VL-Interactionは、映像ストリームを1秒単位で監視し「沈黙・応答・委譲」を自律的に判断するプロアクティブVLMです。DouBaoに77.6%、Geminiに87.9%の勝率を達成し、モデルと学習レシピを全公開しました。
わずか 1.5M〜34.5M のパラメータを持つ軽量 OCR システム PP-OCRv6 が Qwen3-VL-235B や GPT-5.5 を検出・認識の両面で上回りました。MetaFormer 設計と構造的再パラメータ化による技術的な仕組みを解説します。
既存の画像生成モデル(FLUX等)を改変せずに活用し、テキストと画像を交互生成する能力を付与するマルチエージェントフレームワーク「InterleaveThinker」を解説。WISEスコアが0.47から0.73へ大幅に改善しました。
NVIDIAが提案する「SpatialClaw」は、PythonカーネルをAIの行動インターフェースに採用した空間推論エージェントです。20のベンチマークで従来手法を+11.2ポイント上回り、6種のVLMに追加学習なしで適用できます。
Kuaishouが開発した30B MoE型マルチモーダルモデル「Keye-VL-2.0」を解説します。3Bのアクティブパラメータで256Kコンテキストを処理し、LongVideoBenchで235B超のモデルを上回る長尺動画理解性能を実現しました。
ARMは7Bパラメータの単一モデルで画像の理解・生成・編集を統合した自己回帰型マルチモーダルAIです。独自の離散視覚トークナイザーと強化学習でWISE総合スコアが0.50から0.56に向上し、コードも公開されています。
LLMのChain-of-Thought推論をテキストから画像に変換するOptical Reasoningを解説。タイポグラフィ型・グラフィカル型の2方式で言語タスク28.57%、マルチモーダルタスク16%のトークン削減を実証します。
知覚と推論を分離するフレームワーク「MemDreamer」が、全文入力の2%というコンテキスト量で長時間動画理解の精度を12.5ポイント向上し、4つのベンチマークでSOTAを達成しました。
世界シミュレーターを外部ツールとして呼び出し「未見視点の画像」を生成してから推論するVLMフレームワーク「Astra」を解説。2段階の強化学習でMMSI-Benchの精度を+9.0点改善した仕組みを紹介します。
視覚言語モデルの動画イベント予測に、言語トークンと視覚潜在スパンを交互生成する「Future-L1」を紹介。FutureBenchでQwen3-VL-8Bを61.0→85.4(+24.4点)に改善した手法の仕組みを解説します。
複数の専門エージェントが役割分担して科学図表を自動生成する「Crafter」を解説。従来手法比+39ポイントの性能向上と、ラスター画像をSVGに変換するCraftEditorも同時公開。
VAEを排除し、デコーダが視覚表現を自己回帰的に予測するRepresentation Forcing(RF)。画像生成でVAEベース手法と同等スコアを達成し、理解タスクでも8指標中6指標で上回った。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム