Comment fonctionne LearnLM ?
Bonne nouvelle pour les curieux : LearnLM ne change pas l'architecture de Gemini. Il n'y a pas de nouveau type de réseau de neurones ni de mécanisme d'attention inédit. Toute la spécialisation pédagogique vient de la phase d'entraînement postérieure (post-training).
Le point de départ : l'instruction système
Tout commence par une instruction système placée en tête de chaque conversation. Elle décrit :
- le persona du tuteur (qui il est, son ton) ;
- les stratégies d'étayage (comment décomposer, comment guider) ;
- le rythme à adopter ;
- les moments de réflexion à provoquer ;
- les contraintes, notamment « ne pas révéler directement la réponse ».
Le modèle apprend à conditionner son comportement sur ces méta-instructions. C'est ce qui lui permet d'être socratique ici, encourageant là, sans qu'on ait à réentraîner un modèle par usage.
Trois étapes de spécialisation
1. Réglage fin supervisé (SFT)
On entraîne le modèle sur des dialogues pédagogiques multi-tours de qualité, chacun précédé de son instruction système. Le jeu de données mélange :
- les données de base de Gemini (pour ne pas perdre ses capacités générales) ;
- des données pédagogiques ciblées.
Le dosage entre les deux est calibré pour préserver la culture générale du modèle tout en injectant le signal pédagogique.
2. Modèle de récompense (RM)
Des experts humains comparent des paires de réponses du modèle face à une même consigne pédagogique et indiquent laquelle est la meilleure. On entraîne alors un « modèle de récompense » à reproduire ces préférences : il apprend à noter automatiquement la qualité pédagogique d'une réponse.
3. Apprentissage par renforcement (RLHF)
Enfin, le modèle est optimisé pour maximiser cette récompense — via l'algorithme PPO (Proximal Policy Optimization) — tout en restant proche de son comportement d'origine (contrainte de type KL pour éviter les dérives).
D'où viennent les données pédagogiques ?
Le corpus de spécialisation combine plusieurs sources :
- des instructions système structurées (persona, objectifs, contraintes de l'apprenant) ;
- des transcriptions de vrais tutorats individuels ;
- des jeux de rôle synthétiques générés par IA, puis filtrés à la main ;
- des problèmes de maths (type GSM8k) reformulés en dialogues socratiques pas à pas ;
- des « scripts en or » rédigés par des experts à partir de vraies leçons ;
- des données de sécurité (comment refuser ou rediriger poliment une requête hors sujet).
Le tout passe par du nettoyage : déduplication, suppression du hors-sujet, et surpondération des meilleurs scripts.
En résumé
Gemini (base généraliste)
│
▼
+ Instruction système pédagogique
│
▼
1. SFT → apprendre sur des dialogues de tuteur
2. RM → apprendre à noter la qualité pédagogique
3. RLHF → s'optimiser sur cette note
│
▼
LearnLM / Gemini spécialisé pour apprendre
La force de l'approche : LearnLM conserve le raisonnement général et le multimodal de Gemini, tout en y ajoutant des comportements pédagogiques (apprentissage actif, étayage, métacognition, curiosité).
Pour savoir si ça marche vraiment, voir Résultats et évaluations.