En bref

HACRL (Heterogeneous Agent Collaborative Reinforcement Learning) est un cadre d’entraînement dans lequel plusieurs LLM de tailles ou de familles différentes apprennent simultanément sur les mêmes tâches en partageant leurs trajectoires de raisonnement. L’algorithme associé, HACPO, obtient en moyenne +3,3 % sur la baseline GSPO tout en consommant deux fois moins de rollouts. Les gains sont concentrés sur les tâches difficiles : +13,7 % sur AIME2025 et +12,5 % sur AMC23 pour le modèle Qwen3-4B.

En clair : imaginez deux étudiants de niveau différent qui se prêtent leurs brouillons d’examen blanc. Le bon élève voit dans la copie du moins bon des chemins qu’il n’aurait pas explorés. Le moins bon voit dans la copie du bon des trajectoires qu’il n’aurait pas trouvées seul. Les deux progressent simultanément, et la réserve de copies à corriger se divise par deux. HACRL fait pareil avec des LLM : on partage les rollouts vérifiés entre modèles de tailles différentes, et chacun en bénéficie.


Le problème : entraîner des agents hétérogènes sans gaspiller

L’entraînement par renforcement des LLM repose sur la génération de rollouts : le modèle produit des réponses, un vérificateur les note, et le gradient est calculé à partir de ces évaluations. Ce processus est coûteux — chaque rollout consomme de la compute.

Une approche naïve pour améliorer un ensemble de modèles consisterait à entraîner chacun séparément, ou à multiplier le nombre de rollouts par agent. HACRL part d’une observation différente : si deux modèles travaillent sur la même tâche, les rollouts vérifiés du premier contiennent de l’information exploitable pour le second, et vice versa. Un rollout correct d’un modèle fort indique à un modèle faible une trajectoire qu’il n’aurait pas trouvée seul. Un rollout incorrect d’un modèle faible peut signaler à un modèle fort des zones de l’espace de réponses qu’il n’explore pas naturellement.

Le partage de ces trajectoires entre agents hétérogènes réduit le coût total d’un facteur N (pour N agents) sans perte de couverture.


HACPO : quatre mécanismes pour un transfer stable

Le partage de rollouts entre modèles différents crée un problème technique : les trajectoires générées par l’agent j sont off-policy pour l’agent k. Utiliser directement ces trajectoires dans le calcul du gradient introduit un biais potentiellement déstabilisant.

HACPO (l’implémentation concrète de HACRL) adresse ce problème avec quatre mécanismes distincts :

1. Pondération par capacité relative

Un coefficient ω_t^(k,j) = P̂_t^(k) / P̂_t^(j) pèse les rollouts reçus selon le ratio de performance courante entre les deux agents, estimé sur une fenêtre glissante de K=5 batches. Sans ce coefficient, les performances de l’agent Qwen3-1.7B-Base chutent de 3,1 % en moyenne (ablation Table 3).

2. Estimation d’avantage par agent

Chaque agent maintient sa propre baseline de récompense μ̂_t^(k), distincte de celle des autres. Utiliser une baseline commune sans pondération dégrade les performances de 1,5 % à 2,8 % selon l’agent (ablation Table 2). Cette séparation garantit que l’avantage estimé reste non biaisé pour chaque modèle individuellement (Théorème 4.1 du paper).

3. Échantillonnage d’importance exponentiel

Le ratio d’importance séquentiel s_{t,i}^(k,j) = [π^(k)(y^(j)) / π^(j)_old(y^(j))]^(1/|y|) corrige le décalage de distribution entre les politiques des deux agents. Le paramètre α contrôle l’agressivité de cette correction ; sa valeur optimale varie selon la paire d’agents testée (α=3,0 pour Qwen3-8B-Base, α=1,0 pour Qwen3-4B-Base dans une même expérience).

4. Clipping asymétrique par étape

Des bornes d’écrêtage s_{t,i}^(k,j) ∈ [1,0 − δ, 1,0] se resserrent progressivement au fil des mises à jour intra-batch. La borne supérieure est fixée à 1,0 : le modèle ne peut pas “sur-exploiter” positivement les trajectoires d’un autre agent. Sans ce mécanisme, l’ablation (Figure 4) montre une instabilité sévère d’entraînement.

En clair : les quatre mécanismes répondent au même problème — quand un étudiant copie sur un voisin, il faut éviter qu’il prenne tout aveuglément. La pondération corrige les écarts de niveau (le voisin trop bon ne va pas tout dicter). La baseline séparée garde l’évaluation propre à chaque élève. L’importance sampling ajuste pour les méthodes de raisonnement différentes (Llama et Qwen ne pensent pas pareil). Le clipping asymétrique borne les enthousiasmes excessifs. Sans ces filtres, l’entraînement diverge.


Résultats sur le raisonnement mathématique

Toutes les expériences utilisent 7 500 questions MATH comme données d’entraînement, avec G=8 rollouts par prompt. Les évaluations couvrent sept benchmarks : MATH-500, MATH, GSM8K, AIME2025, AMC23, Minerva et OlympiadBench.

Paire homogène (même famille, tailles différentes) : Qwen3-1.7B-Base + Qwen3-4B-Base

  • Le modèle 1.7B passe de 0,467 à 0,493 AVG (+5,6 %)
  • Le modèle 4B passe de 0,578 à 0,601 AVG (+4,0 %)
  • Les deux agents progressent simultanément

Paire spécialisée : Qwen3-4B-Base + Qwen3-4B-Instruct

  • Le modèle 4B-Base passe de 0,684 à 0,755 AVG (+10,4 %)
  • Le modèle 4B-Instruct passe de 0,795 à 0,813 AVG (+1,8 %)
  • L’agent le plus fort bénéficie aussi du transfer, y compris depuis un modèle de base moins performant

Paire inter-familles : Qwen3-4B-Base + Llama3.2-3B-Instruct

  • Qwen3-4B-Base : de 0,578 à 0,597 AVG (+2,0 %)
  • Llama3.2-3B-Instruct : de 0,351 à 0,390 AVG (+4,0 %)
  • Tokenizers et espaces de paramètres différents — le transfer reste positif pour les deux

La comparaison avec GSPO×2 (un seul agent entraîné avec le double de rollouts) montre que HACPO fait mieux sur la majorité des benchmarks malgré un coût total inférieur. La diversité de source produit plus de signal que le volume homogène.

En clair : les chiffres confirment l’intuition pédagogique. Sur AIME2025 (benchmark de maths olympiques), Qwen3-4B passe de 0,28 à 0,42 — un gain de +13,7 % en valeur absolue, soit la moitié de l’écart entre un modèle naïf et un modèle expert. Sur GSM8K (problèmes faciles), le gain tombe à +0,8 % — il n’y a presque rien à apprendre. Plus le problème est difficile, plus le partage de trajectoires entre agents devient utile.


Limites à garder en tête

Plusieurs contraintes délimitent la portée de ces résultats :

  • Toutes les expériences impliquent exactement deux agents. Le comportement à N>2 agents n’est pas testé empiriquement. L’extrapolation n’est pas garantie.
  • Le domaine est uniquement le raisonnement mathématique. Les benchmarks utilisés (MATH, GSM8K, AIME, AMC, Minerva, OlympiadBench) ne couvrent pas le code, la compréhension de texte ou le raisonnement factuel.
  • La valeur optimale de α (importance sampling) varie selon la paire. Il n’existe pas de valeur universelle, ce qui nécessite une calibration par configuration d’agents.
  • HACRL est un framework d’entraînement, pas d’inférence. Les agents déployés fonctionnent de façon entièrement indépendante — le bénéfice est acquis pendant le fine-tuning, pas au moment de l’utilisation.
  • L’hypothèse d’indépendance statistique (Assumption D.1) sous-jacente aux garanties théoriques n’est satisfaite qu’asymptotiquement, pas en régime fini.

Ce qu’il faut retenir

  • HACRL permet à des LLM de capacités différentes de s’entraîner conjointement en partageant leurs trajectoires vérifiées, réduisant le coût de rollout d’un facteur égal au nombre d’agents.
  • HACPO obtient +3,3 % en moyenne sur GSPO avec deux fois moins de rollouts, et surpasse GSPO×2 (ressources équivalentes) sur la majorité des benchmarks.
  • Les gains sont asymétriques : ils sont plus marqués sur les tâches difficiles (AIME2025 : +13,7 %) que sur les tâches faciles (GSM8K : +0,8 %).
  • Le transfer cross-agent bénéficie aux deux participants, y compris à l’agent le plus fort qui reçoit des trajectoires d’un modèle plus faible.
  • Les expériences sont limitées à des paires d’agents sur du raisonnement mathématique — la généralisation à d’autres domaines et à N>2 agents reste à démontrer.