Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

NVIDIA AVO termine les 183 niveaux publics d'ARC-AGI-3

3 min de lecture · developer.nvidia.com · 21 août 2026

D'après NVIDIA - « NVIDIA AVO Reaches 100% on ARC-AGI-3 » (21 août 2026), relayé par X (@NVIDIAAI)

NVIDIA AVO termine les 183 niveaux publics d'ARC-AGI-3

Image : générée (Gemini)

Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.

À retenir

  • ARC-AGI-3 place l'agent dans des jeux dont il ne reçoit ni mode d'emploi, ni règles, ni objectif : il doit déduire seul ce que font ses actions. Chaque jeu compte de 6 à 10 niveaux, 183 en tout pour les 25 environnements publics.
  • NVIDIA écrit noir sur blanc que ces résultats couvrent l'ensemble public et « ne sont pas des résultats sur les ensembles de compétition semi-privés ou entièrement privés ». La nuance vient de l'entreprise elle-même, pas d'un tiers.
  • Cette distinction est décisive : selon la documentation de la fondation, l'ensemble public ne compte que 25 environnements sur 135, ses scores ne figurent JAMAIS au classement officiel, et un outil qu'elle publie y atteint 100 % en rejouant des parties humaines.
  • AVO n'est pas un modèle mais un système bâti autour d'un modèle, avec une mémoire qui survit d'une session à l'autre et une supervision de son propre travail. NVIDIA le décrit comme un agent de programmation généraliste conçu pour travailler seul très longtemps.
  • Le même système avait déjà servi à optimiser des noyaux de calcul, ces petits programmes qui exécutent les opérations sur les processeurs graphiques : sept jours de travail continu, plus de 500 pistes explorées, 40 versions retenues.

Pourquoi ça compte

Le vrai propos du billet n'est pas le score, c'est une phrase que NVIDIA assume : évaluer un modèle n'est pas la même chose qu'évaluer un agent. La capacité brute du modèle compte, mais c'est le système qui l'entoure - la façon dont il reçoit le contexte, garde sa mémoire, se relève d'un échec - qui décide de ce qu'on en tire réellement. Pour qui construit avec ces outils, c'est une indication plus utile qu'un score de plus.

Chiffre-clé

100,00 : le score obtenu par AVO sur RHAE, la mesure officielle d'ARC-AGI-3, pour les 25 environnements de l'ensemble public et leurs 183 niveaux, selon le billet publié par NVIDIA le 21 août 2026.

Citation

« Évaluer un modèle n'est pas la même chose qu'évaluer un agent. (« evaluating a model is not the same as evaluating an agent ») » Billet du blogue développeur de NVIDIA, 21 août 2026

Action concrète

Devant une annonce de score, cherchez toujours sur QUEL ensemble il a été mesuré. Un résultat sur une partie publique, connue d'avance, ne dit pas la même chose qu'un résultat sur des épreuves gardées secrètes. Ici, l'information est dans le billet d'origine ; elle disparaît souvent dans les reprises.

« Our general-purpose coding agent just scored 100% on the ARC-AGI-3 interactive reasoning benchmark. NVIDIA AVO completed all 183 levels across all 25 public environments, figuring out what to do with no instructions, explicit rules, or stated goals. »

Fondée sur la source originale

Sources

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !