美团智播——电影人电影电影电影与是電影
はじめに
ビッグ言語モデル、AI生成、マルチモードインタラクション技術の急速な発展により、デジタルライブブロードキャストはすでに初期の堅固なイメージを打破し、インタラクションが単一のボトルネックとなっており、地域生活、電気事業、文芸エンターテインメントなどのエンターテインメントと商業的可能性の分野で活躍しています。ローカルな生活シナリオ向けの AI デジタル ヒューマン ライブ ブロードキャスト ソリューション、大型モデル、デジタル ヒューマン、マルチモーダル インタラクション テクノロジの統合は、豊富な業界独自のデジタル ヒューマン画像テクノロジを提供します。1:1 レプリカと门店实景のカスタマイズ、ライブ ブロードキャスト素材の生成に 30 秒、ブロードキャスト設定の完了に 3 分、7 × 24 時間の安定したブロードキャスト。過去1年間、生成されたAI技術に基づいて、30日間のG TVでのデジタル生放送は82.12%増加し、163.44%増加し、オープニング放送分野の11倍となり、ローカルビジネス環境におけるAIデジタル生放送の真の価値が十分に検証されました。
2026年7月8日まで10日,美团智播上中国上海大学上电影首秀名秀,以“リアルタイムインタラクティブデジタルピープル+ライブ放送带货南人」の亮相科技电影展区。会者者発行者会者参加者者発行会者参加者者発行者不出是名团智播的電影——以亮相着美团智播衏帰行丰季式衏志着美团智播

デジタルピープルのライブブロードキャストを真人レベルのパフォーマンスパワーに到達させ、大規模な商業化の要件を満たす方法このテキストでは、スマート ブロードキャスト システムの中核機能について説明します。このシステムは、高レベルの画像生成、自然な動きの駆動、音声ハンド調整、効率的な展開、システム アーキテクチャ設計をカバーする、製品をサポートする主要な技術的ブレークスルーを紹介します。これらのテクノロジーは合わせて、「能用」から「好用」、そして「大規模制作」に至るデジタル放送の完全なテクノロジーを構成します。これらの技術の蓄積により、2026 年の「中国マルチメディア企業イノベーション技術賞」は、中国コンピュータ協会 (CCF) と中国グラフィック芸術協会 (CSIG) によって設立され授与され、中国マルチメディア会議 (ChinaMM) によって設立および授与され、デジタル放送分野における英国の独立したイノベーション能力が業界で認められるものです。

1. デジタル放送の背景と課題
1.1 事業背景:10万人のビジネスマンの「費用対効果」の経験
美团は数下家その家と数丿消費者を結び、デジタル ライブ ブロードキャストはビジネスの日常業務への浸透を加速しています。
- 分入门黄高高:下載下載人影後安全活動量十分、7×24時間 真人主播技术计の人力最媒体中心商家の之重入
- 所要時間:限られた時間数秒、突然のホットスポット、突然の天候の変化など。現地のライフスタイルシーンでは、生放送コンテンツの「分単位」の対応が求められ、従来の真人主放排班やコンテンツ制作サイクルではリアルタイムのマーケティングリズムに対応できません。
- その後コンテンツと同化:多くの企業が一般的なデジタル人物テンプレートに依存しており、メイン放送画像は千篇一律であり、ブランドと一致する特別感に欠けており、差別化された認知を確立することが困難です。
- 導入規模が大きい:数万商家同時放送、若每路独占、多数のGPU、コストは直線的に拡大し、デジタル人々の生放送。
より深いレベルの問題は、既存のデジタル ピープル プログラムのほとんどが一般的に「片目の偽物」、つまり顔の硬直、反復的な動き、手や会話で存在し、ユーザーが本物のホストよりも長く滞在することです。
1.2 技術的な課題: 高品質のデジタル ピープル ライブ ブロードキャスト
デジタル ライブ ブロードキャストは、上記の問題に新たな視点を提供しますが、実際に商業的に使用可能な規模に到達するには、単純なビデオ生成タスクとは程遠く、相互に関連する 4 つの主要な技術的課題に直面します。
チャレンジ 1: 南高保真,从“一眼假”图“电影美真人”
顔の硬さ、五官のズレは観客に一目でわかります。より高い要件は、ビジネスには 1 対 1 の真人のレプリケーションが必要であること、また服装や背景を変更するときにアイデンティティの一貫性を維持することです。リンク全体の生成と編集において、どのようにして高い一貫性と強い一貫性を確保するかが、画像生成技術の中核的な問題となります。
課題2:「木偶戏」から「真人感」まで自然に多様なアクション
7 時間×24 時間の生放送では、アクションの多様性に対する非常に高い要件が求められます。アクション ライブラリのループ再生が制限されているため、視聴者が疲労し、ドロップ率が高くなります。動的な番組生成には、品質の不安定さやつなぎ目の歪みなどの問題もあります。高品質と多様性の高いアクション生成を単一モデルでどのように同時に実現するかは、長時間生放送の大きな課題です。
課題 3: 音声調整
優れたプレゼンターの手は言語と高度に調和しています。現在のテクノロジーは、リズム(点头、流手)に同期した自発的な動きを生成することはできますが、言語に正確に結び付けられた調整された手を生成することはできません。
課題 4: スケールアップと効率化
デジタル ライブ ブロードキャスト システムはマルチ インテリジェント プラットフォームであり、品質とリアルタイムを確保する方法、品質とリアルタイムを確保する方法、品質とマルチ インテリジェンスを確保する方法、大幅に圧縮されたシングル リンク、デジタル ライブ ブロードキャストは最も収益性が高く、最も収益性が高いです。
1.3 技術的ソリューションの概要
上記の課題に直面しています,美团智播自研电影电影,時间电影人主播“长得真→アニメーション得圆→演得活→卖得好「全体的に車が上昇するように設計することができます。」
- 长得真:高保真真人电影電影与電影元元匘
- 動く:テキストは高品質のモーション生成テクノロジーを推進し、高度に制御可能で自然に流れる体の動きを生成し、モーションマイグレーションを通じて高性能デジタルヒューマンビデオを生成します。
- 演得活:语手銀座標生成技術、起越语解与语义鸿沟の语义鸿沟、
- 卖得好:大規模展開向けのトークン圧縮と滞空加速技術、マルチ知能体効率調整、効果調整、扇同、打鑚理加速技術を実現

二、讹AI主播「长得真」——高保真真真人电影电影与編集
2.1 製品と要件
企業には、デジタル人物画像の 3 つのレベルのニーズがあります。つまり、迅速な可用性 (3 分間でカスタマイズされた開口部)、高度にパーソナライズされた (真人の 1:1 レプリカ)、柔軟な編集可能 (服装や背景を変更しても同じアイデンティティを維持できる) です。これまでのカスタマイズされた画像生成方法は、アイデンティティと姿勢の結合、微調整に時間がかかる、編集によりアイデンティティ特性が破壊される、などの中核的な問題に直面しています。
2.2 ダウンロードの個別化と自動ダウンロード編集の結果を解決する
デジタル ID の生成と柔軟な編集という 2 つの課題を目指す、パーソナライズされた ID (SDIP) テクノロジー ソリューションと自己報酬型精密編集 (SREdit) テクノロジー ソリューション。
2.2.1 パーソナライゼーションの構造
SDIP (個人化構造から分離されたアイデンティティ) の中心的なアイデアは、将姿态、主要、全世界维度通过情动性性解解、两份态搫两七木です
- ダウンロードと姿态はモジュールを正確に分離します:拡散ベースのメインネットワークでは、残差構造を注入することにより、残差形式のアイデンティティ特徴を統合し、空間汚染を回避します。空間デカップリング損失、顔に焦点を当てると、アイデンティティ特徴の空間分布が明らかに制限されます。地域動的マスキング。さまざまな言語領域の機能の流れを分離します。
- 保真度強化モジュールの詳細: 詳細の欠如の問題を解決するには、視覚参照エンハンサーを使用して高周波のきめの細かい画像を参照します。
2.2.2 自己報酬の正確な編集
販売者の日常電影では、編集の前後でアイデンティティの特徴が一貫していなければならず、衣服から変更することはできない、という制約が一般的です。
この要求に応えて、チームは SREdit (自己報酬編集) を提案し、ACM MM 2026 によって承認されました。
- SIA 電影天生化:MLLM-DiT構造では、複雑な編集コマンドは原子レベルの操作単位に分解され、各原子は空白領域と編集言語に対応し、曖昧な言語による誤った識別情報の混入を回避します。
- スペース報酬: 編集領域の空間分布の動的調整に従って、報酬の重み付けが行われます。編集領域にはより高い編集品質の重みが与えられ、編集領域にはより高い保真度の重みが与えられ、「大胆な編集」と「丁寧なメンテナンス」でモデルを導きます。
- 認識: 同じモデルが編集者と査読者の両方であり、従来のプログラム編集者と査読者の分報酬ハッキング (編集編集者学乐欺陘置判器) を排除します。この 2 つが同じ一連の視覚的理解機能を共有している場合、最適化目標と実際の品質目標は内部的に一貫しています。
実験の結果、SREdit は公開データセット GEdit-Bench、ImgEdit-Bench、KRIS-B ench での編集精度が電気効果上で 2.5% ~ 3.8%、視覚効果上で上海の電気下ダウンロードで限界を超えた編集精度を示しました。

デジタル人物画像の生成と編集効果の例:

三、讹AI主播「动得圆」——テキストドライブの高品質アクション
3.1 製品と要件
デジタル担当者が 7×24 時間生活して製品を導入するとき、異なる製品には異なるスタイルのアクションの組み合わせが必要です。このアクション生成システムは、単一のアクション (流れ、性質、物理的理由) の品質を確保すると同時に、長いシーケンスの多様性と制御性を確保するという 2 つの課題を提示します。
3.2 MoTiGA:多级撃LLMアクション生成
美团智播智設計の多段階発生LLM果電影MoTiGA(Motion Generation by Multilevel Causal Transformers with LLM-Guided Alignment)方泫CVPR 2026新発,MoTiGAは大语の結果の自発的結果の結果を発表し,マルチレベルの面構造と偏好最適化を通じて実現する品質と効率の二重の向上。
- 因果関係のある RVQ-VAE:従来のRVQ-VAEは双方向ロールアップを使用しており、モデルはトレーニング時に「未来を見る」ことができ、回帰時にのみ自動生成できるため、トレーニングとロールアップの間に不一致が生じます。 MoT iGA では、すべてのロールアップが発生ロールアップに置き換えられ、動作の違いが根本的に排除されます。 FID 再構成が 0.114 から 0.031 になり、品質が 72% 以上向上しました。
- 遅れた因果関係の予測: 標準的な自己回帰型トークン生成のため、効率が低い。 MoTiGA は、RVQ の異なるサイズのレイヤー間にラグタイムがあることを観察しています。
- MHPO (人間の動きの好みの最適化): 生成されたアクション作品にヒューマン バイアスの最適化を業界で初めて導入しました。チームは、DPO と同様の戦略を使用して、HumanML3D 上に 101,490 のペアを構築し、バイアス データに基づいてモデルを直接最適化し、生成された結果が人間の「自然な動作」の判断とより一致するようにしました。
実験結果は、MoTiGA の FID が HumanML3D データセットで 0.041 (82.3% 減少)、KIT-ML データセットでの FID が 0.180 (64.7% 減少) であることを示しています。

四、讹AI主播「演得活」——语手手力調整世代
4.1 製品と要件
真人主播说”电影动萨用料非师足”時会张开双手比别量大,说”右のリンクをご覧ください” 指が右を向くとき、この種の声と手の連携は、視聴者にとって「デジタル人物が本物の人間に似ているかどうか」を判断するための重要なラインです。 、「比刳大学」などが調整しました;モデル設計では、従来のスキームはグローバルノイズ除去構造を採用しており、音声セグメント全体が一度に生成されるのを待つ必要があり、リアルタイムかつ無制限のライブブロードキャストシーンの要件を満たすことができません。
4.2 StreamingTalk: 流式共语语電視
StreamingTalk の核となる革新は、グローバルなノイズ除去プロセスをストリーム ベースの生成構造に再構築することです。これにより、非自発的で調整されたアクションのストリーム ベースの生成が初めて実現され、デジタル ピープルが話すときの同期した手の動きのリアルタイムで継続的な制御可能な生成がサポートされ、2027 年には同期した手の動きの制御可能な生成がサポートされます。その核となる技術革新は次のとおりです。
- 流れ出る生成構造: 下下ダウンロード時間を通じて、シーケンス全体が段階的な出力にノイズ除去され、各チャンクが個別に送信され、遅延は合計時間の長さとは関係ありません。アクティブウィンドウは双方向のアテンションを使用してアクションの詳細を絞り込み、以前に送信されたフレームをアンカーポイントとして使用して連続性を制約し、計算量は一定でシーケンスによって増加せず、ライブシーンのライブパフォーマンス「エッジトークエッジムーブ」を実現します。
- 長期安定保証:トレーニング段階では、自己強制クリーニングアンカー戦略を採用しているため、モデル自体が実際のアンカーポイントの置き換え、滞空、弥合訓練、および滞空の分布差をシミュレートする際の誤差の蓄積を予測します。同時に、尾部の偏ったサンプリングを導入し、トレーニング露出の終了フレームのウィンドウを増やし、スライディング ウィンドウの尾部の不十分なカバレッジを補償します。
- タイム台アクション制御メカニズム:各チャンクに独立したアクションタグを付けることができ、その境界で演奏スタイルを動的に切り替えることができます。音声機能は、クロスアテンション、手を制御するための言語条件としてのアクション タグを挿入することで节拍の同期を保証します。
StreamingTalk初回認証済み流式フローマッチング可能恒常演、恒常記憶下可以下用性攀术术活演

五、讹AI主播“卖得好”——高効率駐在改式万路上播
5.1 製品要件
美团智性のライブ ブロードキャスト シーンには、驚くべきスケーリング機能があります。100,000 以上の複数の企業が同時にブロードキャストする必要があり、各ライブ ブロードキャストにはリアルタイムの視覚的理解、インテリジェントなインタラクション、および画面レンダリングが必要です。従来のマルチモード大規模モデルのレンダリング方法によると、各ライブ ブロードキャストは大量のビジュアル トークンを処理する必要があり、単一の GP U 占用が高くなり、同時出力の量が 1000 レベルに達すると、大規模モデルの並列出力量が 1000 レベルに達すると、それが変換の根本的なボトルネックになります。したがって、制作の品質を維持しながらビジョンをいかに大幅に圧縮するかが製品改善の鍵となります。
5.2 Glance2Gaze:所見視合与注視去制
美团智播チームが提唱した Glance2Gaze 手法は NeurIPS 2025 によって記録され、革新的なビジョン トークン圧縮戦略を通じて、モデルのパフォーマンスをほとんど損なうことなく 75% のトークン圧縮率と 2.5 倍の高速化を達成しました。この名前は、人間の視覚システムの「スキャンビュー」メカニズムに由来しています。人間の目は、まずクイック スキャンを通じてシーン全体の情報を取得し、次に重要な領域に焦点を合わせて詳細な情報を取得します。
- グランスフュージョン:従来のビジュアルエンコーダ(ViTなど)は通常、視覚表現として最後の層の出力のみを使用し、中間層の豊富な情報を破棄します。マルチレイヤー機能融合メカニズムを通じて、Glance Fusion は ViT のさまざまな深さのレイヤーの機能を集約し、出力トークンの量を増やすことなく、より豊かな視覚表現を取得します。これは、「スキャン」段階でより包括的なシーン情報を取得することに相当し、その後の圧縮のためのより優れた冗長情報基盤を提供します。
- 視線を圧縮する: 従来のビジュアル エンコーダ出力とは異なり、独立した圧縮スキームが実行されます。ビュー圧縮圧縮モジュールは LLM デコーダ層に直接埋め込まれており、ビジュアル Ken の段階的な圧縮 (576 トークンから 288 トークンへ、さらに 144 トークンへの圧縮) を実現します。
この「組み込みプログレッシブ圧縮」設計には 3 つの重要な利点があります。圧縮プロセスでは LLM の言語理解能力を利用でき、どの視覚情報が冗長でどれが重要であるかをよりインテリジェントに判断できます。プログレッシブ圧縮により、1 回の大規模な圧縮による情報の損失が回避されます。 FlashAttendant-2 と完全な互換性があるため、既存の管理インフラストラクチャに直接導入でき、追加のエンジニアリングは必要ありません。

実験結果は示しています:Glance2Gaze は 75% の視覚トークン圧縮 (576→144) を達成し、さまざまな視覚理解タスクにおけるモデルのパフォーマンス損失は 2% 以内に制御され、思考速度が 2.5 倍向上し、同時にコストが 60% 以上削減されます。

六、システム構造:双発駆動智性技中台
単一テクノロジーのブレークスルーは基礎にすぎず、複数のテクノロジーを効率的に調整されたシステムに統合する方法が製品の成功の鍵となります。システム レベルでは、美团智性は「デュアル エンジン駆動」テクノロジー ミドルウェア構造を構築し、リアルタイム インタラクションとコンテンツ制作の二重機能を実現しました。
6.1 リアルタイムインタラクションエンジン
リアルタイム インタラクション エンジンは、「ユーザー リアルタイム インタラクション」シーンの中核コンポーネントです。放送室で視聴者が質問したり、インタラクションを引き起こしたりすると、システムは「言語理解→回答生成→アクション合成→画面レンダリング」という完全なリンク応答を非常に短い時間で完了する必要があります。
6.2 コンテンツ制作エンジン
事名业电影讲解、活動紹介等「企画コンテンツ」、美团智播团团智播国古亙亓同コンテンツ制作エンジン。エンジンは「創造・検索・思考・生成・検討」の五線设计段台搌検索・思考・生成エンジンを採用
- 創造的な知性: 商品の特性と放送スタイルの需要に基づいて、創造的なソリューションを生成します。
- 検索インテリジェンス: ナレッジベースから関連する製品情報、セールスポイント、成功事例を取得します。
- 考え: クリエイティブプランと検索結果の統合、ロジックとアクションスクリプトの完全なプランニング;
- 知性の生成:画像生成、ビデオ生成、デジタルヒューマンドライブなどのテクノロジーモジュールを変換し、完全なビデオ生成、
- 毕明電影体: 生成されたコンテンツの品質が評価され、フィードバックが基準に達していない場合、コンテンツが再度生成されます。
このマルチインテリジェントな相乗構造により、コンテンツ制作は「産業流水ライン」モードを実現し、一つの製品の生産時間を人為的に生産する時間数から分単位まで短縮でき、品質も安定します。

6.3 知識ベース支援システム「イメージ・アクション・シナリオ」
効率的に動作する 2 つのエンジンをサポートしており、次の 3 つの大きな知識ベースが美团智播によって慎重に構築されています。
- 穿魵美学库:沉洉上海上海结果下載美美学评论、服の選択とスタイルのデジタル人物画像搩和スタイル搇ガイド
- ライブ専門知識ライブラリ:汇集安全真人主播的讲解解技下載下載下載的影片,下載下載的电影的电影的影片的丶;业业容量
- AIが脳を操作する:海洋ライブブロードキャスト管理データに基づいて、インテリジェントな意思決定システム、ライブブロードキャスト指標のリアルタイム分析、動的な製品切り替え、割引トリガー、リズム制御などの戦略を構築し、データ駆動型の継続的な閉ループ最適化を形成します。
美团智播在電影电影上は、「画像-アクション-シーン」の三次元分離の中心原理に従っています。 、同じ一連のアクションを異なる画像に適用でき、同じシーンを異なるホストに素早く切り替えることができ、組み合わせて再利用することでコンテンツ制作の限界コストを大幅に削減できるため、コンテンツ制作の限界コストを削減できます。
7、総括と今後の展望
美团智播微在上电影在电影下載在電影较地、コアインデックスパフォーマンスは明るい目です:カスタマイズされたデジタルヒューマンモデルは、需要から上限ラインまでわずか3時間しかかかりません。従来のカスタマイズされた撮影効率と比較して、10倍以上増加しました。ビジネスレジャー時間の取引量は揹%易風幏で、7×24時間は効果的にトラフィックギャップを埋めることができます。休息;敐开播60%、AIは自動的に音声を生成し、ライブブロードキャストルームを装飾し、マーケティングアクションをトリガーし、商家からの繁民的直撣性を監視します
将来に向けて、美团智播は以下の方向で活動を続けていきます。
- 感情表現とパーソナライゼーションのインタラクション:最好电影人主播将手机情影安全攚む、さまざまなユーザーのフィードバックに直面して、
- 移動スタイルにも対応可能: 業界、ブランド、時代のさまざまなニーズに基づいて、デジタルホストが表現スタイルを自動的に調整します。
- 高性能のリアルタイムインタラクション:パイプラインの生成とレンダリングを継続的に最適化し、リアルタイムインタラクティブなプロダクトフォームの高性能化を推進します。
参考文献:
- [1] Chen X、Bao Q、Liu X 他人間の位置合わせによるマルチレベル因果 LLM ベースのテキストからモーションへの生成。 CVPR 2026。
- [2] Chen J、Liu H、Ao Y 他Glance2Gaze: 視線融合から視線圧縮までの視覚言語の効果的なパターン。 NeuroIPS 2025。
- [3] Wang Y、Bao Q、Ao Y 他SREdit: 画像編集に対する本質的に一致した批評家を備えた、自己価値のあるフレームワークです。 ACM MM 2026。
- [4] Zhang Z、Liu K、Chen Z 他InfVSR: 一貫性に基づいた超解像度の生成ビデオ ストリーミングに向けて。 ICML 2026。
- [5] Fang F、Yang S、Yang W. CoordSpeaker: ジェスチャ キャプションを活用して、調整されたキャプションを活用した共同音声ジェスチャを生成します。 CVPR 2026。
- [6] Chen X、Liu W、Bao Q 他慣性センサーと視覚センサーからのモーション キャプチャ [J]。マルチメディアに関するIEEEトランザクション、2026年。
- [7] Liu H、Bao Q、Chen X 他コンテンツベースのレイアウト生成のためのレイアウト画像の安定したレンダリング。 ICASSP 2026。