Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

Fugu de Sakana AI : l'orchestrateur multi-LLM qui défie les meilleurs modèles

3 min de lecture · The Decoder · 22 juin 2026 · IA générative · Pertinence : élevée
Vérifié par la rédaction de laveille.ai le . Notre méthodologie

D'après Sakana AI - billet de lancement de Fugu, relayé par The Decoder

Fugu de Sakana AI : l'orchestrateur multi-LLM qui défie les meilleurs modèles

Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.

À retenir

  • Fugu est accessible via une seule API compatible OpenAI ; il décide lui-même s'il confie une requête à un seul modèle ou coordonne plusieurs agents, outils et étapes de vérification avant une synthèse finale.
  • Deux variantes existent : Fugu (routage léger, faible latence, pensé pour un usage courant) et Fugu Ultra (orchestration adaptative jusqu'à cinq étapes d'agents, plus lente mais visant la meilleure qualité).
  • Selon le rapport technique de Sakana AI (arXiv:2606.21228, 19 juin 2026), Fugu Ultra obtient 73,7 % sur le banc d'essai SWE-Bench Pro contre 69,2 % pour Claude Opus 4.8 utilisé seul.
  • Un suivi de The Decoder daté du 16 juillet 2026 rapporte que Sakana affirme, dans ses propres évaluations, que Fugu Ultra égale les bancs d'essai internes d'Anthropic « Fable 5 » et « Mythos Preview », sans chiffres publiés pour la version intégrant Nvidia Nemotron.
  • Ces performances proviennent d'évaluations internes de Sakana AI, non reproduites par un tiers indépendant ; elles doivent être lues comme des données fournies par le fournisseur, pas comme une preuve externe.

Pourquoi ça compte

Ce lancement illustre un virage possible de l'IA générative : plutôt que de miser sur un seul modèle géant et coûteux, un orchestrateur combine dynamiquement les forces de plusieurs modèles spécialisés pour tenter d'égaler ou dépasser les meilleurs modèles pris individuellement, à surveiller comme tendance que d'autres fournisseurs pourraient reproduire.

Chiffre-clé

Fugu Ultra obtient 73,7 % sur le banc d'essai SWE-Bench Pro contre 69,2 % pour Claude Opus 4.8 seul, selon le rapport technique de Sakana AI publié sur arXiv le 19 juin 2026 (arXiv:2606.21228).

Action concrète

Avant d'adopter un orchestrateur multi-modèles comme Fugu en production, exiger une reproduction indépendante des bancs d'essai annoncés et vérifier la facturation des jetons d'orchestration, comptabilisés en plus de la réponse finale selon la tarification publiée par Sakana AI.

Repères datés

Sources originale et média

Sources

🔧 Outils mentionnés

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !