Comment fonctionne LearnLM ?

Bonne nouvelle pour les curieux : LearnLM ne change pas l'architecture de Gemini. Il n'y a pas de nouveau type de réseau de neurones ni de mécanisme d'attention inédit. Toute la spécialisation pédagogique vient de la phase d'entraînement postérieure (post-training).

Le point de départ : l'instruction système

Tout commence par une instruction système placée en tête de chaque conversation. Elle décrit :

Le modèle apprend à conditionner son comportement sur ces méta-instructions. C'est ce qui lui permet d'être socratique ici, encourageant là, sans qu'on ait à réentraîner un modèle par usage.

Trois étapes de spécialisation

1. Réglage fin supervisé (SFT)

On entraîne le modèle sur des dialogues pédagogiques multi-tours de qualité, chacun précédé de son instruction système. Le jeu de données mélange :

Le dosage entre les deux est calibré pour préserver la culture générale du modèle tout en injectant le signal pédagogique.

2. Modèle de récompense (RM)

Des experts humains comparent des paires de réponses du modèle face à une même consigne pédagogique et indiquent laquelle est la meilleure. On entraîne alors un « modèle de récompense » à reproduire ces préférences : il apprend à noter automatiquement la qualité pédagogique d'une réponse.

3. Apprentissage par renforcement (RLHF)

Enfin, le modèle est optimisé pour maximiser cette récompense — via l'algorithme PPO (Proximal Policy Optimization) — tout en restant proche de son comportement d'origine (contrainte de type KL pour éviter les dérives).

D'où viennent les données pédagogiques ?

Le corpus de spécialisation combine plusieurs sources :

Le tout passe par du nettoyage : déduplication, suppression du hors-sujet, et surpondération des meilleurs scripts.

En résumé

Gemini (base généraliste)
        │
        ▼
+ Instruction système pédagogique
        │
        ▼
1. SFT   → apprendre sur des dialogues de tuteur
2. RM    → apprendre à noter la qualité pédagogique
3. RLHF  → s'optimiser sur cette note
        │
        ▼
   LearnLM / Gemini spécialisé pour apprendre

La force de l'approche : LearnLM conserve le raisonnement général et le multimodal de Gemini, tout en y ajoutant des comportements pédagogiques (apprentissage actif, étayage, métacognition, curiosité).

Pour savoir si ça marche vraiment, voir Résultats et évaluations.