Agent 识气漫谈 —— 由浅入深讲解Agent 识气 | 美团・テクノロジーチーム
本篇ブログは一科大衆文章,浅入深下下載エージェント维外。そのうちの最初の 2 章では、評価制度について、評価制度とは何か、評価制度の確立方法について紹介しました。
このブログは社内で公開されてからさらに注目を集めるようになり、エージェントのレビューに対するみんなの熱意が非常に高いことがわかったので、社内ブログを公開することにし、これらの経験をより多くの学生と共有し、すべての人にインスピレーションを与えたり、助けたりしたいと考えました。
評価の中心的な目的は、次のことに答えることです。 エージェント好好好?可以全哪金好,哪重不好? したがって、次の反復が将来の方向性になります。
このため、エージェントをデモのパフォーマンスだけで評価することはできません。
エージェント识昺の基石は性である、我们電影了エージェントの生性公式 —— である + 比昺 = 小明迭
AI の形状変化は大きく 3 つの段階を経ました。

不動産屋はこう答えます。
モデルを実際のシステムに導入し、プロンプト、スキル、ツールチェーン、メモリ、ステータス管理、ビジネスプロセスと組み合わせると、安定して良好な結果を生み出すことはできません。
これは、エージェントの評価対象が単一のモデルではなく、「モデル + システム + ツール + フロー」の複雑なシステムであることを意味します。
実際のシナリオでは、2 人のエージェントが最終的に「做对了」になる可能性がありますが、プロジェクトの価値はまったく異なります。
- 明確なパス、安定したツール、時間がかかり、繰り返し可能
- 一语试错、電影電影、靠心命命中结构、支得天時
最終的な答えだけを見ると、両者は同じレベルであると誤って判断されます。しかし、スケーリング、コストの最適化、ユーザー エクスペリエンスの観点から見ると、その違いは非常に大きくなります。
したがって、評価エージェントは少なくとも 4 つのコンテンツ層をカバーする必要があります。
- 結果レイヤー: タスクが完了したかどうか、出力が利用可能かどうか
- プロセス層: 計画性があり、ステップが安定している
- 効率層:時間、トークン、工作活動電子影ダウンロード可電影
- リスク層: セキュリティリスクの有無、誤った操作がないか、セキュリティリスクの有無
この意味から、2023 GPT以降、エージェント開発はChatBot形式の急速開発からCloudCode、enClawなどの多機能エージェントとなり、エージェントの機能はより強力になり、エージェントのレビューは「回答からレビューへ」から「血浰向」へ移行しています。
明確な理解があります。エージェントは広範な SaaS レイヤーに属し、大規模なモデルはエージェントの一般化能力を与え、ユーザーは依然としてランダム性の問題を期待しており、ユーザーは依然としてランダム性の問題を期待しています。 ビデオ电影を安定的に解決することはほぼ不可能です。
通常、エージェントの最初の実行には次のリンクが含まれます。

いずれかの層に問題があると、最終的な効果が低下する可能性があります。安定した結果を得るには、安定したプロセスが必要です。Case 午電影没打手机を見たい「この単純な問題に対して、業界はトレース システムを開発しました。ブラック ボックス内の論理推論プロセスによりパス全体が明らかになり、モデルの出力に影響を与えるすべての入力情報が記録されます。
エージェントのあらゆる「隠された行動」を正確に観察することは、「確率的生成」から「産業グレードの信頼性」への道の実現です。
テキストを渡した後、エージェントが回答するのが苦手であることがわかり、フィードバック自体は結果 (回答) だけでなく、プロセス (トレースまたは軌跡) にも関心があります。
学生の中には、なぜ「道桥」をしなければならないのかと疑問に思う人もいるかもしれません。エージェントの評価制度は、事業価値と評価指標の解釈可能性を追求する必要があるからである。エージェント評価の難しさの 1 つは、モデルの能力指数とビジネス結果指数の間に当然のギャップがあることです。

これら 2 種類のインジケーターは直接マッピングできません。間にタスク システム用のブリッジ インジケーターの層が必要です。

AI 検索を例に挙げると、企業は DAU、留心およびクリックを気にすることができ、検索システム自体も DAU、留心およびクリックを気にすることができます。
これらのレベルを統合することによってのみ、「なぜ経営指標が変化するのか」「経営指標が変化するモデル」「何が経営収益をもたらさないのか」を真に答えることができます。これは実際の人のビジネスの流れに依存するはずです。
多数のユーザーが評価するエージェントには大規模なモデルの評価方法があり、一般に、カスタマー レビューとレビューに分けることができます。

したがって、通常は、より現実的な方法は次のとおりです。
- 用客观语星国际高长、好生化、全線上设计全土
- 主ビデオの使用は、オープン性、高価値、複雑なビジネス シナリオに起因します
- 主观语昺实方客观语昺とAI毕昺を使用し、再分化部品取引自動化システム
「好好好」はメイン ビューの問題です。メイン ビューの標準と一致する必要があります。一致しないと、特定の反復後にインジケーターのシェイク動作が改善されたのか、実際の効果が改善されたのかを判断できません。
評価の実践において本当に難しいのは、「誰の評価も同じではない」ということではなく、「人の評価は同じではない、機械と人の評価も同じではない」ということです。昨年、BP のビジネスが深化する過程で、複数のチームが同じ穴に足を踏み入れたことに気づきました。
图灵毕是官方蓄積された重要な知識は「人人对齐と人机对齐」として要約できます。具体的には次のとおりです。
- 人人全員一致:1个「独裁者」好过10个「民民者」。単一の強力なキャラクター、拉齐製品、运砐营倏倏、単一の強力なキャラクター、評価基準を必要とし、同じ一連の評価システムに従い、誰もが独自の政治を行うことを避けます。

- 人間机電影: 機械の評価結果と人間の評価結果が一致していなければなりません。そうでないと、より大きなビジネス フローに対応するために、人間と機械のマッチングの意味がスケールアップされます。
やり方は?ベスト プラクティスは、あいまいなインデックスをより微調整された評価ルーブリック (または叫是是维度: 評価の次元とルーブリックの評価ルールに関する学術コミュニティの言説はまだ統一されていません。オープンソース プロジェクト Arize AI とともにここにいます) までドリルダウンし、各ルーブリックをできる限り作成することです。次の:
- 指標:握る「大而新」コンセプト下握拆解成技术安全维度
- ルーブリック二元化:握打分官方技术收海成是/否/不明、0/1/不明
- 継続的な:用不明占比来反查 ルーブリックが合理的に定義されているかどうか、十条ルーブリック人人一界、人机一番以信閾値(例:85%、90%)まで
この分解方法の価値は、「視聴者の漠然とした認識」から「事実に基づいて判断できる」ことです。次のドリルを使用して曖昧さを軽減し、それによって人と人、および人と機械の間のギャップを縮小します。この一連の方法を適用すると、デジタル ステーション マネージャーのヒューマン マシン一致率は 99% に達します。
以下に 2 つのケースを紹介します。
ケース 1: 初中生作文好坏をどう評価するか?(满分40分)

ケース 2: 以手外呼情在在在来计可以“口语化”下の例
典型的なエラー例 —— 大型モデルの解答が中国語でない場合は、0 ~ 10 分打分に従って判断してください。
ダウンドリルと二元素化による電気効果:
- 以您指代骑手;
- 电影下載下載“甭客气”、“明儿见”等非公式文书的口语会语词汇;
- モデル出力に「吧」、「呢」、「那州」などが含まれるかどうか。
補足:ラベリングと評価の関係は何ですか?
このうち、ベンチマークはアクションの一種であり、評価は目標に向けた一連の判断プロセスです。
リンクの実行から、エージェントのレビューは 5 つの主要なリンクに分けることができます。
- 集める: オリジナルのタスク データをオンラインまたはボックスで収集
- クリーニング:去重、归类、花图了、去生脏脏合生
- 評価: 人工評価、AI評価
- 検査: ベンチマークが安定しているかどうか、ベンチマーク結果が信頼できるかどうかを確認します
- 分析/归因: 問題を位置づけ、最適化の提案を作成し、タスクを返す
オンライン AB とのこれら 5 つのリンク、継続的な観察は、共同してエージェント反復のデータ フライホイールを構成します。
新しいエージェント評価チームのほとんどは間違いを犯しています —— 多方调研电影电影的一線精妙的精妙的精線上表是電影,而超新上的線上设设计的自己,而足越線上设计的線上设计塾乽饊钧衹任
エージェントのレビューは実践科学です。起步電影「设设计飞轮高故设起来」的性设的设计「设计一电影精妙的性是的最新作」。。
したがって、エージェント評価指標システムのベスト プラクティス パスは次のとおりです。
- 高コアシーンの起動、最初にいくつかの重要な指標を定義します
- 本番環境から悪いケースを収集する
- 沉超高品質の良いケース、技全什么叫「好」
- 良いケース/悪いケース
- プロンプト、スキル、戦略とモデルの最適化など
- さらに新新電影電影里からの連続サンプリング、次のサイクルの形成
その中で、Bad Case の価値が高くなることがよくあります。これは、バウンダリーとシステム ショート ボードの能力を明らかにするのが最も簡単であるためです。また、Good Case の効果は、チームが高品質の完成モデルを定義するのに役立つことです。
成熟した評価チームの核となる能力は、最初から完璧なシステムを構築することではなく、オンラインの問題、失敗したサンプル、曖昧なフィードバックを構造化された評価資産に継続的に変換できることです。 Bad Case、Good Caseを通じて評価制度の目標を見直し、「個人」と真の目標とのマイナスの乖離を徐々に修正していきます。
GPT 3.5からこれまでリリースされてきましたが、ベース容量は大幅に変更されましたが、モデル容量はついに100%ではなくなりました。過去 3 年間のエージェントの実践で、私たちは多数の「希望的観測」の要件に遭遇しました。大量のパラメーターの下で使用される流月的节生ですが、モデルの能力の向上は依然として言語素材の入力、特に高品質の言語素材の入力に大きく依存しています。初期の RLHF であっても、今日の DPO、GRPO などのアルゴリズムであっても、トレーニング構造は常に簡素化されていますが、高品質のコア データへの依存は決して変わりません。
たとえば、byte は地理、コード、法律、医学などの専門家向けに Xpert プラットフォームを特別にセットアップし、地理、コード、法律、医学などの分野で高品質のデータを生成し、豆包基庋モデルの反復トレーニングをサポートしています。基庋モデルの能力は向上しており、1 つの垂直分野でのパフォーマンスがますます良くなっていると誰もが直接認識しています。
したがって、特定の分野でビジネス知識が不足している (または公共ネットワークに高品質の公開データがない) という課題に直面した場合、モデル/エージェントの能力を埋めるために業界の専門家のインプット知識を導入することが、特にプロジェクトのコールド スタート段階において、大金を稼ぐ鍵となります。

呼出前、電影は「エージェント好不好」、では誰が「好不好」を定義できるでしょうか?
この章では、图灵最是共山约のプロジェクトの物語と、この 1 年間の BP 社のさまざまなビジネス側面、沈没方法の核心について説明します。
よくある質問
Q1: 「独裁者」は 1 名で行う必要がありますか、それとも 1 チームが共同して一連の評価仕様に従う必要がありますか?
まず第一に、チームは同じ一連の評価システムに従う必要があります。
Q2:每明最机下載“独裁者”、存最作设计在在中?
評価制度は常に進化しているという事実を認識していただきたいと思います。事業の立ち上げからAI愛好家が拡大していく過程で、ユーザープロフィールも変化していきます。そのため、事業の拡大に応じて評価対象は常に調整されます。家は改造され、運転されます。
Q3:冷电影电影はシード レビュー用に設定する必要がありますか?
コールド・エフェクト・ダウンロード・ダウンロード・ダウンロード・デザイン・エフェクトは、これらとトレードオフの関係にあります。
シードを設定することをお勧めする理由;:大規模なモデルにはランダム性があります,コーナーケースではエージェントの経験がオフセットされる可能性があります。そのため、回性、例作Baod Case Case来拓宽エージェントの能力境界を通じてエージェントベースラインの能力を保証する必要があります。
スモールフローオープンホワイトの戦略について:ビジネスシナリオが高い場合、または高品質のシードの構築、オンライン試行エラーのコストによって引き起こされる負のフィードバック、オンライン事例の収集を試みることができます。
推奨されるソリューション:少量の評価で人為的に生産後、AIを活用して生成または拡張し、低コストで完成
Q4:「良い」の定義が業界の専門家と意見が合わない場合はどうすればよいですか?
答:最もシンプルで効果的な方法は、業界の専門家を集めて「良い」基準を定義し、建設評価システムの共通部分を採用することです。たとえば、優れた販売 SOP を定義するために、ゴールデン カードの販売を招待します。
では、非共有部分には価値がないのでしょうか?そうではありません。専門家の意見が一致しない部分については、企業自体がさまざまな優れた戦略を持っている場合が多い。これらの違いを、エージェントのさまざまなスタイルや戦略分岐に変換し (例: AI 電気チェーン、老線激进派対細水長流派)、さまざまなテスト セット (ベンチマーク) での独立した評価を可能にします。
2023年GPT爆火、2024年工作流下載、昨年クロードコードリリース、更なる龙虾热、愛情马仕热、ロング程エージェントは徐々に公開ビジョンに入りました。エージェントハーネスも完全にロング程エージェント時間に入りました。
长程エージェント(Long-horizon Agent) 短程エージェントとの違いは、「期間とそれによってもたらされる複雑さ」をどのように処理するかです。

この違いは観察や評価にどのような変化をもたらすのでしょうか?
ChatAgent 時間の電子効果の一般的な入力および出力形式は次のとおりです。Query -> Answer。
このタイプのシナリオに共通する特徴は次のとおりです。 エージェントは、「オペレーティング システムに入って実行する」というよりも、「質問に答える」ことに多くを費やし、少量のシステム操作を実行します。

過去 1 年間の開発で、图灵は人工評価、機械評価を含む成熟したソリューションを形成しました。いくつかのケースは次のとおりです。

3.2.1 长程エージェントが変化をもたらす
長期エージェントの変更は「単一の質問に答える」のではなく、「複雑なタスクを完了する」ことです。通常は以下が必要です:
- タスクには複数の手順が必要です
- その過程で、ツールまたはスキルを呼び出す必要があります
- 中間結果を読み取り、戦略を動的に調整する必要がある
この目標を念頭に置いて、一度の観察とレビューで目標を見直してみましょう
- 目標観測:シーンを復元し、正確な位置を設定し、「ログブックを見つけてでもケースを見たい」という問題を解決します。
- 目標評価: 回答エージェント好不好,设计连代留语

3.2.2 スキル評価
スキルレビューの前に
谁在是以龙虾とスキルの復習テスト要件(2月龙虾/スキル热潮ユーザー写真)?
現在のスキル関連の要件を要約します。

ユーザーの規模は、少数の専門職から大規模なグループへと拡大しています
- 商家下来最好和试段階,限定的規模
- 公司全電影AI in Workシステムの龙虾(または他の長程エージェント)融合更广、ユーザーは生産、运、研、五等褚甀等多因線をカバーします
- スキルの開発はますます低くなっており、AIの助けを借りて生成することもできます
これにより、次のような直接的な結論が得られます。
あまり電気に興味のない人で、少し前に研学院を利用したのではなく、実際に新しい人を見つけました。
このレビュー システムでは、次のような新しい要件が提示されました。
- 十分にシンプルです
- 要要记安全前化
- 十分な自動化
- 開発およびリリースのプロセスにアクセスする最良の方法
現状
本質は——大家下載的是可写好Skill,也这个对Skill全生士单了最作発表的巂
皆様の理解を容易にするために、スキル全别生学单事拆解を次のように使用します。

读上、スキル生成機の全体的な痛みは 3 つの側面に分類できます。

タスクのテスト
2026年1月9日,Anthropicはブログ「揭秘AIエージェント評価」を公開し、このブログで初めてタスク指向の長期エージェント評価について言及しました。タスクのテキストは、「明確な入力と成功基準を備えた単一のテスト」として定義されます。
我们安全了Anthropicおよび开源software对タスクの定義は、次のように簡略化されています。

プロンプトは問題/诉求を定義し、期待される動作はエージェントの期待される動作を定義します。正式な環境またはテスト環境でエージェントにプロンプトを送信すると、トレースを通じてエージェントの実際の実行パスを取得できるため、short程Agentの(クエリ – グラウンド_トゥルース – 回答)と同様に(プロンプト – エクスペテッド_動作 – トレース)三元结を取得し、それを評価できます。
3.2.3 长程Agent识昺と短程Agent识昺の違い
2 つの違いは次のように要約できます。

最も重要な変更点は次のとおりです。
ChatAgent 毕明内容「说得好不好」、長程エージェント毆昼旆内「結果挙成無し、性的性質做」。
3.2.4 人识生了机机识生了
ChatAgent Times の一般的なフローは次のとおりです。核心评测员对齐 -> 外包对齐 -> 机评对齐
Long 程エージェントのシナリオでは、このリンクは明らかに短縮される可能性があり、明らかに短縮された外包对雴包对雴にジャンプすることさえできます。核心评测员对齐 -> 机评对齐 -> 规模化扩展
その主な理由は次の 3 点です。
- 长程 エージェントの実行トラックがより豊富になり、情報密度が高くなります
- スキルの生産速度は低く、量の増加は非常に速く、人為的な大規模ベンチマークは持続可能ではありません
- ベースモデルの能力の継続的な進歩
これは人為的に重要ではないという意味ではなく、次のことを意味します。
- ハンドマシン設計と Rubrica 对齐を組み合わせた高品位な作業が可能です
- 大規模運用、初期審査、返品検証にはAIの方が適している
- 平台更多了沉沉洉、回放、告警および归因联合
名詞话说、AI 比明電影要分的、「機械打分」そのものではなく、コアの「比明大是分员是分」そのもの
3.2.5 长程エージェント小明基建は少なくとも必要な機能を備えている必要がある
将来的に会社の大規模なエージェントとスキルのエコロジーをサポートする場合、インフラストラクチャの評価には少なくとも次のものが含まれることになります。
- 全节回放: 入力から結果までの 1 回のタスクの完全なプロセス
- 管理ケース: 統合保守タスクサンプル、コンテキスト、制約、Rubrica
- 実行する:按可读、可写、高金展会安全分地分电成最好
- AI枎:手机 首方運転人間機械 对齐および電影判分、安全安全易用、時限天天技能生便天天技能生および多多発行容易用
- 報告: 計画、ツール、環境、スキルに問題があることを指摘できるだけでなく、
- メカニズムリターン:電視劇方後後自動的に履歴をトリガーします ケースリターン
- 地入地出门禁:握り投论机技术開発、リリース、運用プロセスを組み込む
これらの能力が欠けていると、評価が「単体分析」や「プロジェクトシステムのサポート」レベルにとどまりやすく、真の意味で本番システムの一員となることができません。
全体として、モデルの能力の強化とエージェント ハーネスの継続的なパフォーマンスにより、エージェントの評価のパフォーマンスを向上させることができます。
まず、テストオブジェクトが変更されました
昔は「解答」として評価されていましたが、今は「課題系」として評価されています。
したがって、私たちは、それが単なるコンテンツ自体の出力ではなく、リンクの完全な実装の能力、安定性、効率性、およびリスクを懸念しています。
第二に、評価方法が変わりました
過去が主流 Query -> Answer 的電視全部分设计,今は徐々に回転しています Prompt -> Expected Behavior 行動の評価。
定番の答えが唯一のものではなくなり、プロセスの質、タスクの完成度、トラックの質が新たな答えとなる
したがって、未来は本当に重要であり、何度も評価できないだけでなく、構築することもできません。見得問題、说得清標準、実行スケール、プロセスに従ってください、带得动连代エージェント評価システム。
香:长程Agent设明开源在在電电影考研
- タスク(タスク、別名問題またはテストケース):明確な入力と成功基準を備えた単一のテスト。
- 得点者(Grader)は、評価エージェントのパフォーマンスの特定の側面のロジックです。 1 つのタスクに複数のスコアラーを含めることができ、各スコアラーには複数の文 (チェック チェックとも呼ばれます) が含まれます。
- 記録(Transcript、名称Trace または Trajectory): 出力、ツールの呼び出し、保留、中間結果、および誰でも呼び出せる人を含む、テストの完全な記録。
- 結果(結果):テスト終了時の環境の最終状態。フライトの予約は最後に記録することができます。 「あなたのフライトは予約されました」と言います。
- フレームワークを評価する(評価ハム): 端末端末端末の電気効果を評価するインフラストラクチャ。指示とツールを提供し、タスクを同時に実行し、すべてのステップを記録し、出力をスコアリングし、結果を集計します。
- フレームワークエージェント(エージェントハーネス、またはスキャフォールディング):モデルをエージェントとして実行できるようにします。入力を処理し、ツールを呼び出し、結果を返します。
- 評価キット(Assessment Suite):通常、タスクは広範囲のタスクを共有します。

2026 年 2 月、龙虾爆火時、社区涌月出最好龙虾成星の开源ソフトウェア: