4Bパラメータの画像生成・編集基盤モデル「Mage-Flow」を解説します。軽量トークナイザMage-VAEとネイティブ解像度Transformerにより、1024px画像を0.59秒で生成しGenEval 0.88を達成した仕組みを紹介します。
コーディングエージェント自身の隠れ状態から不要な行を判定するSWE-Pruner Proを解説します。最大39%のトークン削減とSWE-Bench Verified解決率+3.8%を両立した仕組みと実験結果をまとめました。
マルチモーダルLLMで動画の時間的証拠を特定する「TimeLens2」を解説。時間的Wasserstein報酬と93K件のデータセットにより、8Bモデルが397Bを超える性能を7つのベンチマーク全てで達成しました。
Tencent HY Teamが提案するHiLS-Attentionは、LM損失でチャンク選択を学習するスパース注意機構です。訓練長8Kから512K(64倍超)への外挿で90%超の検索精度を維持し、推論速度は全注意比最大15.7倍になります。
物体検出・OCR・深度推定など多様なCVタスクを単一モデルで解く「SenseNova-Vision」を解説。タスク専用ヘッドなしで、テキストと画像の生成空間に統一再定式化することで、専門化モデルに匹敵する性能を実現しました。
ロボットの実機評価コストを削減する動画世界モデルの活用法を体系的に研究。7種のモデル・32万件超のロールアウト分析から、実世界との一致には「映像美」より「長期アクション忠実度」が重要と実証しました。
スコアリングトークンのlogit分布から連続スコアを算出し、検証を第三のスケーリング軸とする汎用フレームワーク。SWE-Bench Verified 78.2%・RoboRewardBench 87.4%など複数領域でSOTAを達成します。
NVIDIAが提案するAudexは、音声認識・翻訳・TTS・音声生成を単一のTransformerに統合しながらLibriSpeech test-cleanでWER 1.4%を達成。Cascade強化学習とオンポリシー蒸留でテキスト推論能力の劣化を防ぐ設計を解説します。
FLUX.1・Wan 2.1など主要な拡散モデルを、サンプルデータ不要でW4A4・W2A4量子化する手法OrbitQuantを解説します。RPBH変換で活性化分布を安定化し、W2A4で唯一実用的な出力を維持した点が大きな特徴です。
LLM強化学習の根本的問題「目標不一致」を初めて体系化。訓練ではなく推論ポリシーの単調改善を保証するMIPI原則とアルゴリズムMIPUを提案し、PPO・GRPOの設計方針を再考させる重要研究。
LLMエージェントの長期タスクでコンテキストが肥大化する問題に対し、3層の有界メモリと型付き検索で解決するAgenticSTSを解説します。Slay the Spire 2上のベンチマークでエージェントの勝率を3/10から6/10に改善しました。
LLMエージェントのメモリ管理を「学習可能な認知スキル」として定式化したAutoMemフレームワークを解説します。スキャフォールド最適化と習熟度トレーニングの2段階で、Qwen2.5-32BモデルがClaude Opus 4.5と同等水準に達しました。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム