September 15, 2026

《エージェント识殹白皮书》系统01:エージェント讯殹全解 | 美团・テクノロジーチーム

0
《エージェント识殹白皮书》系统01:エージェント讯殹全解 | 美团・テクノロジーチーム


過去 3 年間で、2 つのトレンドが同時に発生しました。

一はベースモデルの継続力、それがもたらす結果はユーザーのリクエストです。初期の段階では、出力形式に従ってモデルを安定させるには、ツールを正しく選択し、プロンプトを繰り返し、さまざまな種類を設計する必要があります。現在、これらの機能はモデル自体によって担われることが増えています。

二是 エージェントフレームワークの機能が豊富初期の段階では、プランニング、メモリ、ツールの登録、状態管理を実現する必要がありましたが、現在のフレームワークとプロトコル層に至るまで、これらの抽象化は標準コンポーネントとなり、1 つのツールを接続し、1 つのスキルを追加することで、作業負荷が目に見えて軽減されました。

2 つの時間が追加され、結論は非常に直接的です。エージェントの落地シーンは 1 年間減少しています。

2022 年の ChatGPT (GPT-3.5 ベース) のリリース以来、市場にはエージェント プロジェクトが 1 つずつリリースされてきました。

昨年、エージェントプロジェクトのほとんどが消滅しました。彼らの失踪にはいくつかの理由があります。

  • 停止デモ:プレゼンテーション効果は非常に優れており、実際の流れがカバーされていないことが判明すると、ユーザーの質問の法則、データの内部混乱、シーンの境界は予想をはるかに超えており、チームの心はいっぱいで、最終的には消えてしまいます。
  • 卡在拡張チームは、問題はすでに発生しているが、変更は完了しているため、大きな変更はできないと述べています。
  • 说不清のビジネス価値:モデルは数日間変更されました。すぐに反復し、チームは変更されたと感じますが、証拠はありません。リソースに達すると、プロジェクトは継続的に投入されますが、「プロジェクトが最後に何をもたらしたのか」には答えることができず、最終的には投資が停止されます。

これら 3 つの種類の死亡法は異なって見えますが、実際に調べてみると共通点が見つかります。チームには信頼できる判断メカニズムが欠けている現在のバージョンがわかりません。

ハンドル二件事放ビデオ看,会可一月割装的图景:エージェントの安全性を高レベルで組み合わせ、エージェントの電気の名前を午前中に使用するまた、異なるシナリオに直面した場合でも、限られた評価知識では、心から同じ強さは得られません。 ChatBot のエクスペリエンスを、長期的なエージェントになるためにシームレスに一般化することはできません。そのため、チームがこれまでの2年間で多くの業種で培ってきた評価の知見を体系的に皆さんに共有し、皆さんが少しでも手助けができるようにしたいと考えています。

少し前に、江江の核となる方法論を紹介するブログ「Agent 江江漫谈」を公開しましたが、その答えは「江江とは何か、なぜそうなるのか?」でした。

そのため、やりたいことはやってからやるつもりです。

《エージェント识殹白皮书》系统01:エージェント讯殹全解 | 美团・テクノロジーチーム

Agent 本系统blog电影Agent、または手元のプロジェクト カードがどこかの段階で動いていないので、これが動いていないことを願います。

ここでも強調する必要があります。毕明一実践科学、このシリーズで紹介するプラクティスは、米国のさまざまなビジネスにおける評価チームのプラクティスに基づいており、それぞれのシナリオで効果的であることが証明されていますが、新しいシナリオに移行する場合は、ビジネスの特性と組み合わせて調整する必要があります。

第一弾《电影全記》の目的は、誰もが評価の構造を体系的に理解できるようにすることであり、業界内でまだ散在し、複雑に絡み合っている概念を理解するために一連の統一言語を使用し、コールドスタートアップ、拡大、自己開発を可能にするために一連の物語ロジックを使用します。4 つのモジュール、3 種類の機能、2 つのループ、1 つのアセット

評価の主な目的は、次の 2 つの質問に答えることです。エージェント好不好?少區哪里好、哪重不好前者は電気効果、後者は金融を指します。

在《エージェント比是漫谈》文中,我们上是每是是一個“实方量具”,代生类比可包廪完廪廪完廪:量具”

  • 量具要圆(方差小才置信): 同じサンプル、異なる人、異なる時間、人と機械、得られた量の結果は一貫している必要があります。これはブログ手法における「人は人に一致し、機械は一致する」と同じです。
  • 量具電影能定期校正: ビジネスの拡大後、ユーザーのイメージが変化し、エージェントの能力の境界が拡大し、ビジネスの目標が変化すると、元の構造は徐々に代表性を失います。これは、評価システム自体の反復能力に対応します。

第二の点は、現実のビジネスシーンでの話は、単一減少バイアスを排除するための重要な手段ですが、性感は最も独裁者の逸脱です。

理想的なレビュー システムは継続的な運用システムです。

第一个:设论机电影过代ループ(设殺演进)

エージェントが稼働した後、オンライン電気とオンライン監視が異常な信号を継続的に生成し始めます。これらのシグナルの背後にあるオンラインの実際のサンプルは、ケースマイニングがケースプールに追加された後、再び归因判断の問題の性質を経て行われます。それ自体で。このループにより、人為的なスタートアップからのフィードバックが許可され、実際のユーザーからのフィードバックが徐々に閉じられ、ブログで言及されているバイアスが徐々に排除されます。

第一条:Agent 迭代 Loop(エージェント演进)

同様に、このバッチはオンラインの実際のサンプルであり、ケースが発掘されて返された後、エージェント自身の質問に位置付けられます – 题点过 – 题炯、位置付けが十分に明確ではない、スキルの説明が間違ったルートにつながる、管理コンテキストが重要な情報を失っているか、モデルの能力が本当に不十分です。エージェントの能力は増加し続けますが、増加するたびに既存の能力が犠牲にならないことが保証されます。

採掘の場合に加えて、実際には、第 2 の難問、电汉安全 (电汉集) があります。ループの評価システムがより完全になりました。

把二条Buclă放電影看,完完的比昺机要要上沙沉设昺三

设殹集

これら 3 種類の機能が稼働すると、それらは再利用可能な資産になります。

  • 評価基準(指標とルーブリック):「好」の共評価を月形式化、可量化して、レビューの曖昧さを排除します。
  • サンプル評価黄金集は「好影響下限」を定義し、错問集は「「規定を定義している」内に「能力のこれを定義している」。その価値は、それが返されることです。これまでに間違いを犯した人は、二度と間違いを犯してはなりません。

しかし、この意味からすると、「何と言ったら良いか」の評価と「光坑を通る」の小さな会議は、ストーリーよりも先に評価される可能性があります。ビジネス品質に対するチームの隠れた認識を、定量化可能、再利用可能、移転可能、移転可能、定量化可能に変換する

評価システムの観点から見ると、4 つのモジュールに分類できます。

モジュール分割の説明

リモート評価の業界と分野の定義は非常に明確であり、オンライン評価とオンラインモニタリングの定義も明確です。

業界には統一された概念分割が存在しないため、以降の議論で概念の調整を容易にし、コールド スタート、拡張、自己発展のための一連のフレームワークを使用できるように、これら 4 つの大きなモジュールに分けて説明します。

一诇穿全文の例

以下の議論をするために、实感,我们先约定一诇穿全文的分分——商家电影分滏营分Agent(発行别分家的商家爪痕)。

このシナリオは、典型的な長期エージェントによって特徴付けられます。複数のステップ、複数のスキル呼び出し、中間生成物、環境との頻繁な対話、そして固有の正解がないということです。

オフライン評価の中心となる機能は、エージェントのバージョン変更後のバックテストであり、フロントゲートとして使用できます。それは以下に依存します: 固定の評価セット (固定のサンプルと固定の評価基準)、本番環境の固定の実行環境に可能な限り近い。

Agent Harness の一部が変更された場合 — モデルのアップグレード、即時調整、ナレッジ ライブラリの更新、スキル エージェント

なぜ「固定」を強調するのか

テストの性質は、比較変数を制御することです。エージェントのバージョンのみを変更し、他のすべては変更しないで、スコアの差をバージョンの変更に戻すことができます。

実際には、最も被害を受けやすいのは実行環境です。たとえば、評価時にテスト環境が呼び出されますが、テスト環境のデータと本番環境が一致していません。または、エージェントはユーザーの履歴と履歴を持っていません。

実用的なテスト方法: 同じバッチのサンプルを取得し、環境とライン上のムービー フローで別々に実行し、両側の結論が同じかどうかを確認します。差が大きすぎて、環境が十分ではないことを示しています。

素晴らしいデザイン集質問、参考回答、評価基準)三元组技术、主他问题 – 参考回答エージェント

ただし、エージェントが ChatBot 演进型长程エージェントから形成されると、この三元構成の具体的な意味も発生します。

この移行の背景には、エージェントのフィードバックが「回答応答」から「行動評価」へという根本的な変化があります。短期的なシナリオでは、参照回答は相互に照合できる文字列です。長期シナリオでは、参照回答は、実行プロセス、エージェントがたどったパスが期待を満たすかどうか、環境の最終状態が目標に到達するかどうかの説明になります。

Anthropic《AI エージェントの解雇評価》文中对长程 Agent 课明 Task Agent

設定ポイントを使用すると、昼休みを読む定行の 3 つの要素が実行されている 1 つのタスクを確認できます。

公共のタスクには電気的な入力、例:クエリ/応答、またはプロンプト/期待される動作が必要です。電気的な影響はメトリクスとルーブリックによって区切られており、最小限の説明です。

完全なタスクはおおよそ次のとおりです。

《エージェント比显漫谈》中可能的二元化 Rubric思路是电影的:「このPPTは得好不好」というような漠然とした判断に対して、次のグループへのドリルでは、特定の検査項目である「峆查长」に「はい」または「いいえ」で答えることができ、グループの中から問題は何かと答えることができ、意見の相違を可能な限り排除します。人一致率や人機一致率の向上は、本来、このような訓練から生まれます。

毕明集全体は 2 つのカテゴリに分類できます。端から端までの諺明集と推进进明集上述の三要素技術をすべて説明することができる。

エンドツーエンド評価とプロセス評価については、常说的黄金集、必过集を確立できます。これら 2 つの概念は互いに独立しており、矛盾しません。

なぜ必要なのですか?端から端までは見られる最高の電影、在線電影です」仕方が無い”;プロセス毕明集看正解最好,電影的是”途中で問題が発生しましたビジネス分析の例に戻ります。「100のタスクには68のPPTタスクがある」ということが分かります。ビジネスにおいて最も重要な数字は納期です。この数字が68から55のとき、スキルは95%から70%です。能力の成功率はありませんが、「データと正解率を組み合わせたもの」が低下すると、問題は裏側にあります。評価プロセスの指標が変動しないのに、納期が低下する場合は、未知数であることを意味します。異常が発生したため、さらに掘り下げて戻り、評価セットを反復する必要があります。

実践的な経験:端到端语是集回答“要不不要拉响電影”、端集回答“警報寓了语找谈”を処理します。ターミナル内でのみ「生是坏了但安全哪坏了」の罠に陥ることになりますが、プロセス内でのみ「すべてのモジュールは標準を満たしているが、ユーザーは満足していない」という罠に陥ることになります。

繰り返しになりますが、エージェントの機能が徐々に増加する場合、エージェントの機能に応じて異なる機能モジュールを確立する必要があります。エージェントの機能モジュールである门店電影は、いくつかのスキルで構成されるコア機能モジュールです。 门店百科もコア機能モジュールであり、スキルと门店知識ライブラリで構成されます。この状況は別途確立する必要があります。

評価プロセスを継続することもできます。たとえば、ナレッジ ライブラリ内の関連する質問は、ナレッジ ライブラリの評価セットとして個別に作成できます。特定のスキルは関連する質問を呼び出し、スキル レビューで継続できます。

语昼集要资料電影電影の上海、评论の電影のダウンロード而之是化化。販売者の電子ビデオの前に、次のようにすることができます。

拆解技術术一使用是是明確な責任評価・分析のプロセスが完了し、組織が分割されると、ある層の人数が減り、対応する担当者が直接見つかるため、「誰が問題なのか」を判断する必要がなくなる。

拆解的设计:不过过早拆得太经

《エージェント毕明漫谈》ブログには、評価は実践科学であり、その設計精妙な評価システムにより、最初にコアシーンを把握する方が良いと明記されています。

正しい順序は、次のとおりです。 解像度は、実際の解像度によって駆動されるようにします。完全な不安によって引き起こされるのではなく、問題を抱えています。これは詳細です。

エージェントが変わると、評価セットがゲート コントロールの役割を果たします。バックテストを通じて、変更前後のコアリンクとコアインジケーターの一貫性を保証できます。しかし、「1 回限りの評価セットを実行する」と「効果的なバックテスト メカニズムを確立する」の間には、まだ距離があります。いくつかの重要なエンジニアリング上の考慮事項:

  • 複数回のトライアル(Trial)で安定した結論を得る大規模なモデルの出力には当然ランダム性があり、同じタスクが 2 回実行される可能性があり、結果が異なる場合があります。
  • 分山门禁安全性クラス、データ精度クラスのチェック項目は「一票か新しいか」である必要があり、単一の項目をリリースすることはできません。経験クラス、追加時間によりしきい値を設定できます。
  • 手机電視设计才有管理力本当に効果的な方法は、CI/CD の埋め込みをテストするか、プロセスをリリースして、自動的に実行する 1 つの方法にすることです。ドアの流れへのアクセスはなく、本質的には単なる提案です

電線语の固有の制限

このクリアー安全衛生は、既知の問題、すなわち、セグメントに存在しない内容を見つけるだけであり、存在しないものである。

たとえば、ビジネス分析のシナリオ: レビュー テスト セットが「PPT 制作」タイプのタスクである場合、ユーザーが「3 番目のホームセンターのデータの比較を手伝ってください」という新しい要求を大量に送信し始めると、固定回線のテスト テスト セットでは明らかに新しいケースをカバーできません。

まさにこれが、レビュー システムに未知の発見を担当するオンライン部分、つまり离線安全守住全了を含める必要がある理由です。

简線電影為名得微微微心電影,是此电影下載下載,老生电影可电影电影电影电影,制况开说この电影

オンライン評価とオンライン監視は、実際のオンライン運用の品質監視です。

  • オンライン評価これには、実際のオンライン環境でエージェントの効果を観察するために使用される、AB、影子モード、巡工が含まれます。
  • オンラインモニタリング则电影 スキル/楽器の成功率、失敗率、トークン消費量、異常変動など

一つの直談:オンラインレビューテストの回答」システムの動作が悪い「,オンライン監視回答」システムが正常に動作していません前者は品質の観点、後者は観点です。スキル呼び出しの成功率は 100%、間違ったデータが返されるたびに、監視は緑、フィードバックは赤になります。

三论は二词全線:影子電影在上電影全电影兜底、AB在上電影事業価値を確認、巡巴在电影电影电影电影盘。

オンライン レビューとオンライン モニタリングのやり取りにおける中核的な機能は、オンライン エージェントのパフォーマンスの安定性を継続的に監視することです。最も一般的なプラクティスは、タスクの代表的な部分をリモート モニタリングから抽出することです。

  • 評価属性:これは、ある種の設計が、電気効果、電気効果の設計であることを確認します。これは倂です
  • モニター属性:把握電影電影、失敗サンプル、異常傾向沉三下載、フォローアップ事例としてマイニングして入力しました。これが結果です。

ビジネス分析の例に戻ると、合理的な検査は次のように設計できます。

オンライン モニタリングは実行インジケーターに関係しており、プロジェクトで一般的な多数の安定性インジケーターがオンライン モニタリングの範囲内にあります。一般的な監視パラメータは次のとおりです。

  • 可用性:スキル・道具使用成功率、失敗率、超時界、異常タイプ分布。
  • 料金:トークン消費量、シングルタスク平均ステップ数、平均消費時間。
  • 行動制御: タスクの種類の分布、スキルの呼び出し頻度の分布、平均会話サイクル。この層の価値は、ユーザー構造の変化を発見することです。何らかの新しいタスクの速度が急速に上昇する場合、多くの場合、評価セットを拡張する必要があることを意味します。

インデックスの安定性とモニタリング クラス インデックスの動作を組み合わせることで、有意義な結論を導き出すことができます。たとえば、タスクの完了率が 5 ポイント低下し、スキルの失敗率が 2% から 15% に増加した場合、その確率は高いという結論になります。

マイニングケースは主にオンラインフィードバックとオンラインモニタリングに基づいており、オンラインフィードバック、実際のサンプルサンプリング、ビジネスルールによって選別されたサンプルも受け取ります。

責任分工上:ケース電影電影把报電影收蛛ケース池,归因電影電影在往下机,電影エージェントプロセスフロー

このモジュールはシステム全体の中心であり、現在の「エージェント自己処理」の中核でもあります。

四米方式は「不感地帯」が異なるため併用する必要があるオンラインフィードバックによってのみ、ユーザーが喜んで抱えている問題だけを確認することができ、監視することによってのみ、監視することによってのみ確認できます。ランダムサンプリングは、コストが最も高くレートが最も低いものの、「問題について考えもしなかった」ことを発見する唯一の方法ですが、省略することはできません。

サンプルを掘り出した後、Case プールに入力すると、さらに Good Case と Bad Case にそれぞれ分類されます。

错题集は电影最最是一安全集その論理は非常に明確です。誰もが一度は犯罪を犯したことがありますが、二度目に犯罪を犯すべきではありません。

一方で黄金コレクション、その価値は過小評価されやすい最悪の場合、どこにいるのかも教えてもらえませんが、「どの範囲まで」も教えてもらえません。

悪いケースは、「ここに問題がある」という説明しかできず、「なぜ問題があるのか​​」も理解できません。

どのリンクで問題が発生したかを判断し続ける必要があります。一般的な方法は、エージェント プロセスを実行して、全金全量釺节ログ ログを段階的に問題点を特定し、このプロセスとソフトウェアの問題をログで確認するプロセスでバグの高さを確認することです。

操作可能な归因分团は、おおよそ次のようになります。

归因がクリアになった後は、通常、肯定的なケースは 2 つの異なるパスに入ることができます。

  • エージェント効果ループに入ります—修復、回昺、上線。これがループエージェントです。
  • 女子校生ルブリカ、現在のルブリカが正確な刻画電影を持っていない場合、小は代用ルブリカ、同時に将Caz流入错集。

多くのチームは最初のパスのみを通過しています。デフォルトでは、「语是说不行是エージェント不行」です。このデフォルトの仮定は、隠れた問題を引き起こします。エージェントは「感足电影电影電視」ではなく「迎合窶内机手机」として最適化されます。評価基準自体に乖離があると、最適化に手間がかかり、本当の需要が遠ざかってしまいます。 「評価制度が間違っていないか」を定期的に点検することは、評価制度の自己校正として必要な行為です。

《エージェント比显漫谈》里には朴素の行動があります:ビデオ电影を安定的に解決することはほぼ不可能ですこれはエージェント R&D の正式版です。観察 + 识明 = 可代「中、観察は第一に理由に置かれます。

エージェントの一正視是一长陷:ユーザー入力 → 意图热名 → タスク計画 → ツール/スキル 调亯入 → 纯入 → タスク計画中間結果処理 → 戦略調整 → 最終出力。いずれかの層に問題があると、最終的な効果が低下する可能性があります。ただし、問題がある場合は、最終的な効果が低下する可能性があります。痕跡—— 将黑羒黑美活理治疗进口全电影、安全论论论了设記起路起起起起起起起起起立起起起立起起起起起起起起立起起起立起起起立起起起立起起起立起起起立起起起立起起起立起起起立起起起立起起起立起起起立起起起立起起起立起起起立起起起立起起起立起起起立起起起立起起起立起起起立起起起立起起起立起起起立起起起起

Trace SDK から、OpenClaw、Claude Code、そして Trace Plugin に統合されました。

結果ハンドマシンの主记,好是标宝完备是机最机的家度基建,少なくとも次の例妈基建を備えているべきである

Agent Harness は迭代太快、公怕是开源社区的であるため、関連する基地の建物も需要に遅れています。観察は基礎となりますが、プロジェクトの開始時に完全なシステムを確立する必要があるという意味ではありません。実際の接地プロセスでは、基礎建物の観測と基礎建物も需要に応じてリバースデザインする必要があります。シンプル:「自動で判定したいけどデータがない」というときは

実際の構築の観点は次のとおりです。先设计「最小限の可归因」—— 少なくともコール入出力とスキルコール記録の完全なモデルを取得できれば、Bad Caseで何が起こったかを追跡できます。

実際には、各ビジネスの最も一般的な 3 つの「部分的に完了した」形態が観察されます。

3 番目のフォームは、最も「完全」に見えるため、最も注目に値します。これには、すでにレビュー セットと監視委員会があり、データは報告時点で非常に完全です。なぜまだこうなっているのですか「的〰样的都用、なぜまだこうなのです」の〰样

最後に、これまでの議論をそのまま利用できるセルフチェック表にまとめました。ポイントを比較して、あなたのビジネスにとって最短のボードを見つけることをお勧めします。

この张表の使い方

異なる適切な水位に対応する異なるビジネスステージ:L3 まで冷却 L3。 異なる適切な水位に対応する異なるビジネスステージ:L3 まで冷却 + L3 比推集 L1 + 回帰门禁止 L1 は最小の閉円をサポートするのに十分、拡大段階、評価基準とオンライン評価に焦点を当てるプッシュ アンド プッシュは、プッシュ L3 で、安全 L3 の自動化とスケーリングに影響を与えます。

ケースマイニングはまだ L0 (靠电影投诉) にあり、その後、精密機械のレビューは既知のサンプルの反復評価のみにあります。入力は花齐マイニング能力に向けられる必要があります。システムの容量には上限が定められています。

元の問題に戻る4 つのモジュール、3 種類の機能、2 つのループ、1 つのアセット

  • 4つのモジュール: 回線電気安全局の主拠点、オンライン評価と監視安全上の拠点、事件の発掘と責任ある測位と分別、観測基盤の構築。
  • 3つの能力: 問題を見つけ、特定し、進歩を推進します。項目が 1 つある場合は、対応するリンクでシステムが固定されます。
  • 两条ループ:エージェント迭代ループレットの容量は向上し続け、毕昺システム迭代ループレット量は継続的に校正されます。
  • 一つの財産: Covering Agent 各安全電子効果の末端および電子効果をカバーするエージェントです。

この张全景图は「起点」ではなく「终局」であることを強調しておく必要があります。どのチームもプロジェクトの最初から最後までこの张図に従ってはいけません。

《エージェント比昼漫谈》ここで繰り返す価値のある文があります。評価エージェントは実学であり、「複雑な評価システムを設計する」ことよりも「データを飛ばして高効率に実行する」という意味を持っています。全景図の価値は、各段階で、自分が今どこにいるのか、次のステップはどこなのか、どのブロックが最も多くの利益をもたらすのか、一時的に完了していないブロックのコストはいくらなのかを知らせることです。

では、ポイントはどこにあるのでしょうか? 在一緝二白、評価セットのコールドスタート段階がありません。評価フライトの最小閉円を実現するにはどうすればよいですか?これはまさに次の記事《冷加篇》で答えられる質問です。

Q: エージェント离線上语昺集可用在回昺吗,なぜ大きなモデルに従ってはいけないのですか?

この質問には、エージェントのレビューと大規模モデルのレビューの核となる違いが含まれており、2 つの側面から答える必要があります。

1、エージェントが基本モデルと同じではないのはなぜですか?基本モデルは、一連の一般的な機能に分類できる一般的な機能を提供します。皆さん、大規模モデルの評価自体も業界の非常に特殊な分野であることを思い出してください。

2、電影明集は必过セットとチャレンジセットに分けることができます。明らかに、垂直ビジネス分野では、チャレンジ セットの構築は非常に困難ですが、エージェント バージョンの関数を反復するのは非常に簡単です。また、必須のサンプルはエージェントのコア機能に属しており、既知の問題については、ラインに投入する前に可能な限り解決する必要があります。そのため、日常業務において「必过集」が二度と現れない状況が頻繁に発生します。

读上,エージェント离線昺更多是用在回昺電影,電影坏是電影電影电影線上悠影庿上AB

補遺: チャレンジ セットを設定する場合は、オンラインの現実世界のシナリオの配布を時間に合わせて更新する必要があります。そうしないと、レビュー テスト セットが作成されません。

Leave a Reply

Your email address will not be published. Required fields are marked *