下一代電影下載语是标册!美团开源LoHoSearch,用研究图谱内容AI能力名理 | 美团・テクノロジーチーム

0
下一代電影下載语是标册!美团开源LoHoSearch,用研究图谱内容AI能力名理 | 美团・テクノロジーチーム


過去 1 年間、BrowseComp によって検索エージェントの能力が評価され、最上位モデルの精度が初期の 30% 台から 90% 以上まで急速に上昇したことを私たちは目の当たりにしてきました。

下一代電影下載语是标册!美团开源LoHoSearch,用研究图谱内容AI能力名理 | 美团・テクノロジーチーム

BrowseComp のタイトルは人工的に設計されており、入札者が知っているエンティティと関係に基づいてのみ構築できるという制限があり、グローバルな知識ネットワークの観点からは判断できないという制限があります。どの条件が本当に検索が難しいのか?能不是设计電影来出题?

美团 LongCat チームは最新の論文で LoHoSearch ベンチマークを提案したため、この可能性は現実のものとなりました。

  • 自動化構造に関する知識。 人為的な出口タイトルの代わりに、762万维基百科百科百科の百科百科の题目をカバーするための基礎として题目を自動的に生成します。
  • 双维度の制御が難しい。 名前は、テレビでは、テレビの電気効果とアプリケーションストアに割り当てられています。
  • 現行モデルの性能性能。 巺语星门设计では、GPT-5.5 の正確率は 34.74%、LoHo Search 上の携帯電話の時間分率は 6.8% で、BrowseComp の 14.03% よりも低いです。

マシンの前提は、マシンにグローバルなビジョンを持たせることです。建設プロセス全体は 4 つの部分に分けることができます。建图 → 难度の制御 → 品質握关 → データ分析電気効果は一つずつあります。

LoHoSearch の最初のステップは完全な英語からです。

  • 762 万个公司
  • 26.5億
  • 有限会社のウィキデータ P31 からの多数の入力が公開されています。

この张图谱は、その後の世界的な観点からの「难题」の選択の基礎となります。

図2:LoHoSearchのデータ構造処理フロー(知識画像→子画像サンプリング→QA生成と天天→後置フィルタと発行核)

图谱を取得した後、次の質問は次のとおりです。「难」はどのようなタイトルですか?

困難の探索の核心は2つの次元を持ち、それぞれは人工的に生成されます。

  • サーチスペース: 候補エンティティの条件のいずれかを満たします。
  • 複雑な構造条件が多ければ多いほど、噛み合いが激しくなり、要求が長ければ長いほど、これらの解決策が考えられます。

これら 2 つの側面に対して、LoHoSearch は 2 つのサブプロット構造を設計しました。

  • ツリー構造難易度は主に「探索空間」の拡張によって生み出されます。
  • 構造図则在安全電影电影、循環依存性と相互制約を導入することにより、さらにワンステップスタッキングと複雑なスタックを実現します。

子图のサンプリングが完了したら、読みやすい自然言語のタイトルに変換する必要もあります。

  • 题目世代:从子图握性维基記述、自然言語問題に合わせて書き直します。
  • 自動検証:方法问题问题設計図子図に関する,今電影電影体データ标標準答案成成案成桀朻
  • フィルター:多案および易案、さらに電気的影響。

3 層のスクリーニング後の自動化プロセスの全体的な品質は次のとおりです。質問の 75.5% が直接 2 を通過します。深刻な問題のうち破棄されるのは 2.2% だけです。

LoHoSearch தியுக்க்குக்கு 544ウェイ ツリー構造とマップ構造を比較すると、マップ構造が明らかにより高密度であることがわかります。つまり、より多くのノード、エッジの数が前の構造のほぼ 2 倍であり、これはより高い構造の複雑さに対応します。タイトルのコンテンツには、音楽、地理と場所、映画とテレビ、スポーツなどが含まれます。

表1:LoHoSearchデータ統計

図3:LoHoSearchのドメイン分布

表2:LoHoSearch上のダウンロード手机の電視台(%)

最強モデルのGPT-5.5の正解率は34.74%に過ぎず、DeepSeek-V4-Pro、Claude-Opus-4.6、KIMI-K2.6は15.53%~15.99%に集中しており、その他のモデルはいずれも14%未満です。これと、BrowseComp で 80% を超えるパフォーマンスは非常に困難です。

探電影比上位電影の基礎として DeepSeek-V4-Flash を使用:同じモデル、BrowseComp 上で 58.84%、LoHoSearch 々上で 2。

図4:BrowseCompとLoHoSearch正生電費のプロジェクトのダウンロード

LoHoSearch の正解率は、平均 35 回から 61 回 (+74%) に使用され、中位数は 26 回、中位数は 26 回でわずか 8.01% であり、ツリー構造の 11.89% よりもはるかに低いです。

DeepSeek-V4-Flash は 16 個の独立した回答をサンプリングしました。結果を図 5 に示します。

図5:上行手机下 pass@N及电影答案電視の電視

pass@N は N=1 の 9.3% から N=16 の 38.3% まで上昇しており、リピート サンプリングの収益が見られますが、38.3% は依然として低位です。

ReAct 標準によれば、テストの Summary と Disard-all の 2 つの戦略があり、Verification モジュールが追加されています。

表3:DeepSeek-V4-Flashベースの天生電影電影消融成電電影

ハンドマシンの最適な組み合わせ(すべて放棄 + チェック)は、電気効果が 10.02% から 16.82% に上昇し、故に流れが 6.8 分点を達成しましたが、ハンドマシン戦略は BrowseComp 上で 14 分点の利益を獲得できます。 Sear はより長い思考連鎖を必要とし、単純なトラックの圧縮や再起動では長期検索における情報損失の問題を解決できません。これにより、Sear は次世代のコンテキスト管理テクノロジのより価値のある実験場となります。

「非表示のエンティティ」の特性は、2 つのベンチマークを比較することでわかります。

図 6:定乐公司の分析 (a) 隠された定日の入度内容、(b) 明は電視空電影空に関する流速下である

その一、BrowseComp の隠れたエンティティの人気は明らかに高く、エンティティの人気を正確に制御することは人為的に困難であり、

その二,人気が同じレベルで制御されているとしても、LoHoSearch の検索空間との関係は依然として大きく、エンティティは BrowseComp よりも高いです。

これは、既存のシステムの限界を人為的に構築することを説明するものであり、システムの知識が構築のシステムです。

LoHoSearch の価値体电影三长どのように貢献上:

  • ナレッジダイアグラムに基づいた自動構築プロセス。 7 億 6,200 万のエンティティをカバーする知識マップに基づいて、質問が自動的に生成され、システムは検索スペースと構造の複雑さを制御し、人工的な難易度の上限を突破します。
  • より詳細な評価基準。 最高モデル GPT-5.5 の精度率はわずか 34.74% で、必要なツールを正確に追跡し、呼び出し数は BrowseComp の 1.7 倍で、HoSearch はより詳細な分類を確立しました。
  • コンテキスト管理研究の挑戦的なプラットフォーム向け。 最良の戦略は 6.8% の増加にとどまり、BrowseComp の 14.03% の増加よりもはるかに低く、LoHoSearch が次世代のコンテキスト管理テクノロジ研究を促進するための理想的な実験場になり得ることを示しています。

LoHoSearch は完全にオープンで、フィールドのすべての大型モデルを歓迎し、「长程电视」大考を受け取ります。

Leave a Reply

Your email address will not be published. Required fields are marked *