スタンフォード大学発スタートアップWindBorne Systemsが、欧州気象機関ECMWFの予報精度を上回るAIモデルを発表。400機の観測気球と独自AIで1時間更新・3km解像度の高精細予報を実現しています。
VAEを排除し、デコーダが視覚表現を自己回帰的に予測するRepresentation Forcing(RF)。画像生成でVAEベース手法と同等スコアを達成し、理解タスクでも8指標中6指標で上回った。
NVIDIAがGTC Taipei 2026でWindows PC向けプロセッサ「RTX Spark」を発表。Blackwell GPU+128GBユニファイドメモリで、LLMのローカル推論環境を一般PCで実現します。
MetaとPrinceton大学が提案するVLM3は、焦点距離統一・テキストでのピクセル参照・データスケーリングの3要素のみで、深度推定δ₁精度0.90・カメラポーズ推定AUC94%など多様な3Dタスクを専門モデル並みに解けることを実証した研究を解説します。
NVIDIAが世界生成・物理推論・行動生成を単一モデルに統合した初のオープン統合AIモデル「Cosmos 3」を公開しました。
知識グラフのランダムウォークと検索軌跡を訓練データとするRL手法「LongTraceRL」が提案されました。ルーブリック報酬で推論の質を直接最適化し、4B〜30Bモデルで5つの長文脈ベンチマークを上回る性能を達成しています。
Hugging Faceが公開したAIエージェント用語集では、「ハーネス」「スキャフォールド」など開発者間で混乱しやすい13の基本概念を定義。Claude CodeやOpenAI Codexとの用語の違いも明示し、共通言語の確立を促す実用的な内容となっている。
BaiduのERNIEグループが提案するNAVAは、音声と映像を専用空間で対応付けてから文脈条件付けを行う「Align-then-Fuse」方式を採用し、6.3Bパラメータで大規模な既存手法を超える音声映像同期精度と映像品質を実現します。
GitHub Copilotが6月1日より定額制からトークン消費量ベースの従量課金制に移行しました。一部ユーザーで月額29ドルが750ドルに急騰するケースが報告され、開発者コミュニティで強い批判が相次いでいます。
DeepSeek V2/V3で注目されたMLA技術をビデオ拡散に初適用した「VideoMLA」を解説します。KVキャッシュを92.7%削減しながら分単位の長尺動画生成を実現し、VBenchで最高スコアを達成しました。
SoftBankがフランスのデータセンター建設に最大750億ユーロの投資計画を発表しました。欧州最大規模のAIインフラ整備の詳細と、その背景にある国際的なAI基盤競争を解説します。
テキスト・テーブル・知識グラフを各形式のまま横断検索する「OmniRetrieval」を解説します。13データセット・309知識ベースで検証し、既存RAGの均質化問題を解決した新フレームワークです。
Agents-A1とは?35Bモデルで1兆パラメータ超の性能を達成するエージェント水平スケーリング
Mage-Flowとは?4Bで1024px画像を0.59秒生成する基盤モデル
プロンプトエンジニアリングとは?主要手法の仕組みと使い方
LLMはなぜ日本文化に偏る? 欧州研究が明かすAIの隠れた文化バイアス
PP-OCRv6: わずか34Mパラメータで235B超の大規模VLMを超えた軽量OCRシステム