Résultats et évaluations

Comment mesurer qu'une IA « enseigne bien » ? Google a mis en place des protocoles d'évaluation pilotés par des experts et des essais en classe, plutôt que de se fier aux seuls tests académiques classiques.

L'« arène pour l'apprentissage »

Le principe : faire dialoguer les modèles dans des scénarios d'apprentissage réalistes (par exemple « Explique la photosynthèse à un élève de seconde »), puis faire noter les conversations par des experts.

Dans une évaluation à grande échelle :

Préférences des experts (Gemini 2.5 Pro, dérivé de LearnLM)

AdversaireTaux de préférence pour le modèle Google
Claude 3.7 Sonnet71,3 %
GPT-4o (API)81,8 %
ChatGPT-4o61,0 %
OpenAI o374,2 %

Toutes situations confondues, le modèle de Google a été préféré dans 73,2 % des cas par les experts, et arrive en tête du classement de type Elo.

Les premières comparaisons (LearnLM initial, 2024)

Dès la première génération, LearnLM était significativement préféré à ses concurrents de l'époque sur la qualité pédagogique :

ComparaisonForce de préférence moyenne
LearnLM vs GPT-4o+31 %
LearnLM vs Gemini 1.5 Pro+13 %
LearnLM vs Claude 3.5+11 %

Au-delà du laboratoire : un essai en classe

Les évaluations d'experts jugent la qualité des dialogues. Mais qu'en est-il de l'apprentissage réel ? Un essai contrôlé randomisé (RCT) a été mené dans un collège britannique auprès de 165 élèves, en appui à des tuteurs sur une plateforme de mathématiques.

Quelques résultats marquants :

Ce que les experts ont apprécié

Certains participants ont trouvé l'expérience « étonnamment humaine ».

Les limites reconnues

Les chercheurs restent prudents :

Voir les publications dans Ressources.