GeoRA: RLVR によって設計された LoRA—ACL 2026 杰出设计解析 | 美团・テクノロジーチーム
ACL (Association for Computational Linguistics Annual Meeting) は、計算言語学と自然言語処理 (NLP) の分野でトップの国際学術会議であり、CCF-A クラス会議であり、中国コンピュータ科学技術協会も自然言語処理の方向性を国内最高レベルのランキングに推奨しています。 18篇入选,美团履约报アニメーション最新作の《GeoRA:Geometry-Aware Low-Rank Adaptation for RLVR》もその1つです。
RLVR は大規模モデリングの能力を向上させるための重要なパラダイムとなっていますが、そのトレーニングはより高度であり、自然なテクノロジーであるため、LoRA はこのタイプのパラメーターを使用して RLVR を微調整します。ただし、LoRA とその亜種は、ほぼすべて SFT シナリオで確立され、検証されています。最近、一連のメカニズム研究により、RLVR と SFT の最適化几最適化几䜽期孬経 VR:制更多最受变受最最地电影字电影用红在在网电影,これはトレーニング前の重みの主な方向に傾いていることが示されました。したがって、SFT 用に設計された以前のテストは RLVR に直接転送され、幾何学的エラーが発生し、その結果、パフォーマンスの低下、能力の喪失、さらにはトレーニングの崩壊が発生します。
この問題に対して、美团と北京大学の研究者は、RLVR の更新領域に低チップを配置する GeoRA (Geometry-Aware Low-Rank Adaptare) を提案しました。 SVD(奇数分解)は、低チップの密な瞬間に圧縮する適応分解) 32B の Qwen と Llama モデル上で、GeoRA は数学、医学、コード三種の RLVR タスク上で安全に電気効果の低チベースラインを実現します。
この記事では、RLVR 向けに特別に設計された低レベルのトレーニング方法と、Agentic RL のビジネスにおける落地的ビジネスについて紹介します。
OpenAI o1、DeepSeek-R1が大規模モデルの代表格であり、RLVRは複雑なモデルを解く鍵となるモデルです。
電気効果手机操作勾配出口 SFT と RLVR の名前、これらの上の実際的なジオメトリ記憶化ジオメトリ記憶SFT: 重みの主な方向を書き換えることにより、新しい情報が目に見えて注入されます。RLVR は、一度制約された最適化に似ており、モデルを拡大するために報酬に起因するサンプリング バイアスに依存します。行動を合理化する。トレーニング前のウェイトを主方向に開きます。このイメージは安定性の更新にも敏感であり、クラスの境界内で戦略を更新する必要があります。
幾何学LoRA とその変更は現在の標準です。これらの間の重要な違いの 1 つは、どのようなテストが使用されるかです。LoRA は高レベルの全零初期化を使用し、トレーニング前の重みとは何の関係もありません。 PiSSAは本来のパワーとSVDを引き継ぎ、育成予算をメインディレクションに配分し、MiLoRAは尾部奇利ディレクションを担当します。たとえば、PiSSA は RLVR の部分部分空間と矛盾しますが、これも実験でより容易に崩壊する現象を予測します。
作品アプローチの 1 つは次のとおりです。RLVR はパラメーターのごく一部のみを更新するため、このサブスペースに対してのみ微調整されます。この方法は確かに更新モードの RLVR により適していますが、最新の GPU は非構造化計算には効率的ではなく、パラメーターの量を減らしても効率が向上するわけではありません。
計算は幾何学に優しい一方で、幾何学は不便です。 GeoRA は、これら 2 つのエラーを同時に解決したいと考えています。
GeoRA は 3 つのステップに分けることができます。
- 構築ジオメトリ: 谱先生と欧氏先生に基づいて、トレーニング前の体重スクリーニングから、より安定した、より柔軟なパラメータセクションパラメータセクション
- 低秩に近い構造器:幾何空間近似にはSVDを使用し、アダプターの初期化に使用します。
- 安全性差分: 性差活再刻組、安全電影可可可、内冷電影内容护护國局線〓不変
プロセス全体はトレーニングの開始前に 1 回だけ実行され、1 回限りの前処理に属します。
私たちは、フィルタ パラメータ領域の事前トレーニング重み行列 W からのボディ トレーニングのコード (マスク) を使用しており、両方とも同じ希釈線 ρ を共有しています。
- 先生 M_Spec は安定性を重視しています。 W を考慮して、そのうちの r の角分布 Ŵ_r を求め、次に比例位置の最小幅の Ŵ_r を選択します。
- 欧氏先生 M_Euc は可塑性を重視しています。 W の元の範囲に直接あり、ρ の最小比例位置です。これらのゼロに近いパラメータは、事前トレーニングでは「用量が少なく」、広いスペースを調整でき、トレーニングに十分な自由度を確保できます。
最終的な幾何拘束行列と 2 つのセット: W_Geo = W ⊙ (M_Spec ∪ M_Euc)。

2 つのパラメータ セットは似ていますが、実際に選択されるパラメータは非常に少数です。たとえば、実際に選択されるパラメータは非常に少数です。たとえば、ρ Qwen3 0.2 の場合、両方ともパラメータの 20.0% を選択しましたが、4.55% のみを選択しました。Jaccard の類似度はわずか 0.128 です。これは、相互に排他的で冗長な 2 つの異なるパラメーター領域をキャプチャすることを意味します。
W_Geo を取得した後、对是做 SVD:
W_Geo = U_Geo Σ_Geo V_Geoᵀ
前に奇数成分を取り、低秩行列を初期化します。
A_Geo = Σ_Geo[:r,:r]^(1/2) · V_Geo[:,:r]ᵀ
B_Geo = U_Geo[:,:r] ・Σ_ジオ[:r,:r]^(1/2)
电影 B_Geo A_Geo は W_Geo の最良の近似です
ここには無視しやすい点があります。GeoRA は、元の W が top-r ではなく、W_Geo の top-r の方向をとります。適応可能なオブジェクトの変更。これが GeoRA と PiSSA / MiLoRA の主な違いです。

この観点から、4 つの方法の違いは 1 つの文に要約できます。LoRA には電力がありません。PiSSA は 1 つの文に要約できます。LoRA には電力がありません。PiSSA は 1 つの文に要約できます。「看尾方向」、GeoRA は最初により適切な一致するオブジェクトに変更し、次に主な方向をとります。
最後のステップは、LoRA に従って残高マトリックスを計算することです。
W_res = W − (α / r) · B_Geo A_Geo
フロントが送信されると、W_res はブロックされ、アダプターのみをトレーニングできます。
h = W_res x + (α / r) · B_Geo A_Geo x
この設計は 2 つの特性をもたらします。 1つは初期化時の関数は変更されません,2 つの部分は W x に等しいため、トレーニングの開始時にモデルの出力は変更されず、初期段階の戦略が回避されます。これは RLVR の立ち上げにとって非常に重要です。名合了报用官方: オプティマイザはA_Geo、B_Geoパラメータ化されたフロー形状でのみ更新でき、W_resは安定したアンカーポイントとして、トレーニング前の表示が破壊されるのを防ぎます。
主な実験は、Qwen3-8B および Llama-3.1-8B に対して GRPO アルゴリズムを使用して RLVR 計算を行う DeepMath-103K です。比較対象には LoRA、PiSSA、MiLoRA、稀疏微谢(SparseFT) および全参微谢(FullFT)が含まれます。同時に、4B と 1.5B GSM8K唨の間でスケール検証が行われます。

- 分布 (ID) の数学的ベンチマークによると、GeoRA は 2 つの骨干モデルの中で最も強力な総合パフォーマンスを達成し、これは低秩ベースラインの主要なベンチマークと同じです。
- Distribution(OOD) の結果はさらに注目に値します: 全参微调在 IFEval、TruthfulQA 上都电影上都电影回退Geo、茀基度無通、HumanEval 反而76.83 から 82.93。
これは、対象領域の能力を向上させ、同時に既存の能力の損失を減らすことができる幾何学的空間の更新を説明します。
利点が数学に限定されないことを確認するために、医療シナリオとコード シナリオで拡張実験を行いました。

2 つの分野の結論は同じです。GeoRA は安定して下位ラインよりも優れており、分野全体と比較しても遜色ありません。

- より高い効率トレーニングにおいて、GeoRA は時代を先取りし、高いパフォーマンスに達しています。
- 超参鲁棒性更强以下は学習率の例です。GeoRA は非常に広い領域内で高い報酬を維持しており、大きな学習率を実現する他の方法は明らかです。これについて詳しく説明する必要はありません。

全参微调と比較して、GeoRA はトレーニングパラメータを 99.5%、单步思時 19.9%、月唨占罔低 28.5% 削減できます。 SparseFT のデータと比較すると、より明確に見ることができます。パラメータは 68.0% 削減されていますが、パラメータは 10.8% 削減されています。 GeoRA の主要なエンジニアリング価値は次のとおりです。握りgeometrie先生落成分研密低秩设计したがって、効率パラメータは実際に速度と収益に変換できます。
さらに構造分析を行います。W_Geo は行列であり、それを r の形式に圧縮します。なぜ損失は管理可能でしょうか?

- 稀疏自体が低い秩性をもたらすわけではない比較として、まず密度の異なる 2 つのランダム ノイズ行列を構築しました。
- W_Geo の特性が低い図中のGeoRA重み(W_Geo)の調整は事前トレーニングと再構成であり、エネルギー集中の大部分は少数のフロントエンドユニットに集中しています。この記述は、選択された領域が構造を継承し、圧縮できることを示しています。
- 全部参 RLVRの実アップデートも少ない私たちは、ΔW = W_FullFT – W_Pretrain を電気的に影響し、上に含まれる可能性のある重み付けにも電気的に影響を与えました。
三組ハンドマシン結合電影了头了 GeoRA の構造は以下に基づいています: 低秩特性は RLVR ハンドマシンです。内在属性これは、GeoRA がパラメータの 0.5% のみをトレーニングする理由も説明します。
GeoRA におけるこの仕事の出発点は、論文ではなく、実際のビジネスにおける高効率な学習の要求です。エージェントは積極的に候補者にアプローチしてフォローし、複数回のコミュニケーションの中で候補者の要望、懸念事項、意思決定のポイントを特定し、的を絞った方法で次の戦略を策定し、候補者を徐々に面接と採用プロセスに進めます。このプロセスでは、販売、戦略、言語スキル、トライアルに対して同様のアプローチが必要です。目標と結果は明確で検証可能 (约面/入請/ROI) であり、RLVR による最適化に非常に適しています。そして、この垂直フィールドのシナリオには、特別なトレーニング要件の組み合わせもあります。
- 基模大、基方长このエージェントには、基本的な知能と長期的な能力に対する高い要件があります。大規模な基本モデルに基づいて構築する必要があり、単一トラックのコンテキストは長く、研究のリソースを開いて表示できます。
- 增量资料在線上不大垂直領域には追加の知識と能力が必要ですが、規模は通常大きくなく、トレーニング データは基本モデルよりはるかに少なく、低レベルの適応の容量は基本的に十分に実行できます。
一方で、トレーニングはオープンであり、キャパシティが小さいため、RLVR 向けの高効率トレーニングが使用されます。実際、「SFT向けに設計されたRLVRのレベルが低い」と最初に疑うのは、ビジネストレーニングの感触でもあり、LoRA、PiSSA、MiLoRAでは明らかに効果が異なり、学習率が不安定になり、崩壊することさえあります。 GeoRA は AI シナリオに取り組んでいます
効果:与全参结結果会了,LoRAと比較して、約12%の増加です。

効率: 与 LoRA 使用,月存存全参会生在下載 54%,若影片QLoRA 等量化核性可进一歎〙降

目に見える、GeoRA 用 LoRA の設計設計全双の最適化効果、これはまさにその適用価値です
落地時は交差点時、また、電影電影電影電視での想念
- ランダムなSVD初期化SVD の初期化は 1 回限りの前処理であり、前の奇数成分だけを必要とするため、前 SVD の加速のみが必要なため、高速化が可能です。つまり、複数の電気効果を使用して複数の技術を起動することができ、72B モデルの処理でも 1 分未満かかります。
- 参照モデルのストレージを省略するRLVR は KL を計算するための参照戦略を必要とし、通常の慣行は再定内定定です。 しかし、2.3 の関数の不変の性質により自由な代替が与えられます: 定重 = 定差力 + 内部定不開始図: 動力重内多αa 内部定力力力発生(低チ、覚醒小)、正確に計算できます。
GeoRA は、RLVR に最適化された幾何学的設計のための最初の下位トレーニング方法であり、その中心的な貢献は次のとおりです。
- RLVR は更新された構造を明らかにしました:RLVR の更新スペース空間は圧縮可能であり、これは下位互換性を確立するための前提条件です。
- これはアニメーション追加ストーリーです:谱先電気とヨーロッパ先電気内で RLVR の偏った更新領域を使用し、低ランクのアダプターに切り捨てられた SVD 圧縮を使用し、残余バランスをアンカー ポイントとして固定します。これにより、幾何学的なエラー位置と敶アンカーの稀な計算が回避されます。
- 優れたパフォーマンスを実現するために広範囲にテストされています: 1.5B から 32B モデルまで、数学、医療、およびコード シナリオの RLVR 検証方法は安定しており、優れた回線分散と優れた速度分散を実現します。
実験論文に加えて、GeoRA はより低コストでより良いトレーニング結果を達成するために、Agentic RL の実際のビジネス シナリオでも検証されています。