AI を部屋から出してダイナミックな世界へ: MineExplorer が最上位モデルを明らかに
あなたが見知らぬ森の一部に生まれたとしたら、太陽が次の山、阥肠蛋盋に来ようとしています、あなたの目の前には蜘蛛がいます。
このとき、一時停止ボタンを押すと、スクリーンショットがすべての上位モデルに送信され、「黄昏、有手机、黄金明是」と完璧に答えてくれます。
マルチモードの大規模モデルは、画像の読み取り、ビデオの分析、複雑なシーンの分析ができることがわかりましたが、リアルタイムの変化に放り込まれると、再び何が起こるでしょうか?
より深く調査するために、LongCat チームはそれを構築しました鉱山探検家——首全体における上下のすべての段階にわたる電気効果、大規模なモデルの体系的な評価には長期的な計画が必要であり、前提条件を隠すタスクに実際の機能が含まれています。
MineExplorer コアビュー:
- 一能電気の電気効果: システムのルールに一致する、人工検証の 813 個の高品質インスタンス (1 ホップから 4 ホップ)。
- 一造の方法論: マルチインテリジェントボディデータ合成プロセスの完全なコードは、トレーニングタスクを自動的に合成できます。
- 拡張可能なトレーニング環境: Minecraft 的沙盒に基づいており、テストフィールドとしても使用でき、練習場としても使用できます。
MineExplorer はもはや単純ではありませんが、一連の革新を中心に一連の革新を構築してきました。

イノベーションポイント一:完全な物理ルール、会動的なパフォーマンスによる世界の構築
MineExplorer では、モデルが Minecraft の 1 つのスクリーンショットを選択質問として表示することはできません。モデルは、リアルタイムで実行される 3D サンドボックスの世界に直面しています。評価では、各タスク インスタンスは 1800 の環境ステップを実行します。各ステップは 0.1 秒間実行され、これは 3 分間の連続インタラクティブ ビデオに相当します。つまり、この 3 分間では、環境は 1 つです。モデルが 1 つのアクションを実行するたびに、世界の状態が 1 回更新され、最新の画面に従って更新されなければなりません。
新代点二:長期マルチジャンプタスクの条件を非表示にする
これは MineExplorer の最も核となる設計であり、タスクは「ジャンプ数(ホップ)」で分割され、最終目標を完了するために必要な隠れたステップの数を表します。
- 単純な作業: ターゲットは明確なシングルジャンプタスクであり、知的体はシーンやタスクの説明に基づく必要はありません。
- 難しい仕事: 由2-4 暇安全交多自由电影。注文に指示はありません前のタスク。
私たちは、それぞれの複雑なタスクを単一の構造として定義しました。各複雑なタスクは単一の構造 Gτ、Mτ) として定義されます。q は自然言語コマンド、s₀ は初期状態、Gτ はタスク間ですダウンロード図(DAG)キーは次のとおりです。 ** コマンドは図内のすべてのノードに依存せず、知的体は環境から自己完結していなければなりません。

革新点三:知識解解——我们是は「一般的な探索」、「Minecraft Wiki に戻る」ではありません
これは、これまでの Minecraft の評価基準とは異なり、MineExplorer とは異なる重要な設計です。我们明的不是「AI会不会玩玩Minecraft」,しかし「AI能不是是游戏电影世界理世界釻探索世界釻是」

高品質の長期タスクのベンチマークを構築すること自体が難しい問題です。

全体のプロセスは初期化と議論(ディベート)の2段階に分かれており、最初の草案が生成され、専門家や検証者が問題点を見つけて改訂する。
如以下に示す人為的な評価結果は、よりインテリジェントなプロセスの効率が約 30% 向上することを示しており、最も困難な 4 ホップ タスクの利点は特に明白です。最後に、手動検証を通じて高品質の複合タスクの 813 例を保存しました。

MineExplorer 借量 ReAct 范式,把图像世界机拆解成三大能力维度,共 14 锘美粒度能庛能
- 歌詞(認識): 空間、タイミング、エンティティ、状態、リソース。
- 推理(推理): 親しみ、偶然、関係。
- 電影(アクション): 移動、ジャンプ、収集、ドロップ、合成、攻撃。
示されているように、最終的なベンチマークは 3 つの大きな次元を十分にカバーしており、その中で空間認識、移動、収集などの基本的な能力が最も高い頻度で表示されます。

MineExplorer は試験タイトルを定義するだけでなく、18 の上位モデルの実際のスコアも提供しました。以下に示すように,これはクロード、GPT、ジェミニなどのモデルです。

たとえ最高のパフォーマンスが Claude-Opus-4.6 だったとしても、全体の成功率はわずか 41 分です。
| 洞察一:单迷尚可,多跳崩盘——问题可以下下載前置计算
図に示すように、最強モデル Claude-Opus-4.6 のパフォーマンスは、1 ジャンプ タスク 77 分から 4 ジャンプ タスク 12 分まで続きます。


| 洞察二:会見、但是想 —— 居住上の成動
テストされたほぼすべてのモデルで、同じ法則が観察されます。性生生 > 電影生生 > 滞在生生以下に示すように、Claude-Opus-4.6 の例では、最も優れた部分は 61.9 1、割り当て部分は 54,71 です。

| 洞察三:失敗の6割近くは目標に達していないから
私たちは、-Opus-4.6 のストーリーシナリオ中間のストーリーシナリオを紹介します。以下に示すように,ナビゲーションの失敗はエラーの最大の原因です,占比近60%。

| 洞察四:薬ではなく、より多くの情報、より多くの記憶を与えてください
我们电影电影下載融装置,说是モデルの失敗はリソース不足のせいではありません。
- ステップ: 写真に示されているように、能力官方、解解在在解出了;解不足、電送1800秒解解の善解不足。

- メモリ: 図に示すように、過去の画面フレーム数がある程度増加すると、過去の観察が現在の状況の判断を妨げる可能性があるため、パフォーマンスが低下します。

重要な結論: ボトルにはリソースがなく、モデルも利用できません。
MineExplorer は、感情を隠す能力の断片を明らかにしました。現在のマルチモードの大型モデルはすでに良好な知覚を備えていますが、動的な世界で継続的なアクションを検索する能力が著しく欠けています。
これについては、急速な昇温具身知性赛道の中にいくつかの直接的な啓示があります。
- 基本的には認識層が基盤であり、計画層がボトルネックとなります。モデルには環境が見えますが、その認識によって成長が変化し、行動計画は前面に隠されています。
- 業界は、実際の複雑さの評価基準に近づく必要があります。
- 評価だけでなく、タスクの自動合成のためのオープンソースメソッドやトレーニング環境も提供します。 MineExplorer は静的な質問のセットではなく、自動合成の長期タスク プロセスの完全なセットと、トレーニングに直接使用できる Min ecraft 環境も付属しています。評価、構築、トレーニングは同じインフラストラクチャを使用します。
MineExplorer は、新しいソリューションである大量のベースラインを提供します。
変化する世界では、押し続け、押し続け、押し続けます。これは AI が現実世界に移動しているため、最初にそれを越えなければなりません。 MineExplorer は完全にオープンです。オープンワールドへの挑戦を歓迎します。
🚀 リンクを開く