En bref

  • Sakana AI a lancé le 11 septembre 2026 Fugu Max et Fugu Ultra v2, deux systèmes d'orchestration multi-agents déguisés en modèles de langage classiques derrière une API unique compatible OpenAI.
  • Ces modèles ne sont pas des réseaux de neurones entraînés : ils coordonnent dynamiquement un ensemble de modèles existants pour produire leurs réponses, atteignant 48,3 sur Chartography contre 27,3 pour Opus 5.
  • Fugu Max cible les usages intensifs à 2 dollars/M tokens ; Ultra v2 vise la performance maximale à 5 dollars/M en entrée et 30 dollars/M en sortie, avec un contexte d'un million de tokens.

Fugu : Sakana AI livre un système multi-agents comme un simple modèle d'API

Sakana AI, le laboratoire de recherche en intelligence artificielle fondé par d'anciens chercheurs de Google Brain et connu pour ses travaux sur les systèmes inspirés de la nature, a publié le 11 septembre 2026 deux nouveaux membres de sa famille Fugu : Fugu Max et Fugu Ultra v2. Ces deux systèmes introduisent une approche architecturale radicalement différente de la norme dans l'industrie des modèles de langage, tout en restant entièrement transparents pour les développeurs qui les utilisent via une API standard.

La distinction fondamentale de Fugu par rapport à tous les autres modèles disponibles sur le marché est annoncée sans détour par Sakana AI dans son billet de lancement : Fugu n'est pas un réseau de neurones unique entraîné de bout en bout. C'est un système multi-agents — "a Multi-Agent System, Delivered as One Model" selon la formulation de l'entreprise. En pratique, lorsqu'une requête arrive sur l'endpoint Fugu, elle n'est pas traitée par un seul modèle mais distribuée, décomposée et orchestrée entre un ensemble dynamique de modèles spécialisés travaillant en coordination. Le résultat final est synthétisé et retourné via le même endpoint, comme si un seul modèle avait répondu.

Cette architecture pose une question conceptuelle intéressante pour l'industrie : la frontière entre un "modèle" et un "système d'agents" est-elle encore pertinente lorsque les deux sont interfacés de manière identique ? Pour l'utilisateur final ou le développeur, Fugu se comporte exactement comme un modèle de langage classique — il accepte un message, retourne une réponse, supporte les outils (function calling), maintient un historique de contexte. La complexité de l'orchestration est entièrement abstraite. Seule la latence légèrement plus élevée sur certaines requêtes complexes trahit parfois la nature distribuée du traitement sous-jacent.

Sakana AI propose deux tiers distincts au sein de la famille Fugu, correspondant à deux philosophies d'usage. Fugu Max est la version orientée coût et volume : conçu pour les applications nécessitant des millions de requêtes quotidiennes, il privilégie l'efficacité économique à 2 dollars par million de tokens. Fugu Ultra v2 est à l'opposé la version performance maximale, facturé 5 dollars par million de tokens en entrée et 30 dollars par million en sortie — un positionnement tarifaire premium justifié par les benchmarks exceptionnels publiés par Sakana AI et vérifiés par des évaluateurs indépendants.

Les deux modèles partagent les mêmes caractéristiques techniques de base : une fenêtre de contexte d'un million de tokens, un maximum de 128 000 tokens de complétion, et le support des entrées multimodales (texte, images, fichiers PDF). La compatibilité avec le format d'API OpenAI est garantie, permettant une migration sans modification de code depuis tout client utilisant l'interface standard de complétion de chat. Des tarifs spécifiques s'appliquent pour les appels de recherche web intégrés (10 dollars pour 1 000 appels dans le cas d'Ultra v2) et pour les lectures de cache.

Les performances de Fugu Ultra v2 sur les benchmarks publiés sont la donnée la plus frappante de ce lancement. Sur Chartography, un benchmark évaluant le raisonnement visuel et l'interprétation de données graphiques, Fugu Ultra v2 obtient 48,3 contre 27,3 pour Anthropic Opus 5 et 29,5 pour Fable 5 — soit un avantage de plus de 65 % sur les meilleurs modèles frontier propriétaires dans cette catégorie. Sur DeepSWE, un benchmark d'ingénierie logicielle réelle évaluant la capacité à résoudre des problèmes de programmation dans des bases de code existantes, Fugu Ultra v2 atteint 74,3, un score remarquable qui se positionne dans les premières places des classements disponibles à la date du lancement.

Sakana AI explique ces performances exceptionnelles par la nature même de son architecture : l'orchestration dynamique permet de router chaque sous-tâche vers le modèle le plus adapté au sein du pool, d'exécuter des raisonnements parallèles sur des sous-problèmes indépendants, et de synthétiser les résultats de manière cohérente. Les tâches complexes nécessitant à la fois du raisonnement visuel, de la génération de code et de la synthèse textuelle tirent particulièrement parti de cette approche distribuée.

L'accès à Fugu Max et Fugu Ultra v2 est disponible directement via l'API de Sakana AI et via plusieurs fournisseurs d'inférence tiers, notamment OpenRouter. Les développeurs souhaitant tester les capacités avant de s'engager sur l'API officielle peuvent passer par les intégrations disponibles sur des plateformes d'évaluation de modèles comparatifs.

L'approche Fugu : ce que la livraison d'agents comme modèles change pour l'industrie IA

Le concept que Sakana AI met en oeuvre avec Fugu n'est pas entièrement nouveau dans sa philosophie — l'idée de combiner plusieurs modèles spécialisés pour surpasser des modèles généraux uniques est au coeur de nombreuses approches d'ensemble en machine learning depuis des décennies. Ce qui est nouveau, c'est la maturation de l'infrastructure d'inférence distribuée qui rend ce type d'orchestration praticable à la latence et au coût requis pour une API commerciale, et la décision de Sakana AI de livrer ce système sous une interface identique à un modèle classique.

Cette approche a des implications importantes pour la manière dont les entreprises évalueront et choisiront leurs fournisseurs de modèles à l'avenir. Si la performance résulte d'une orchestration intelligente plutôt que d'un entraînement sur des données propriétaires, cela signifie que l'avantage concurrentiel se déplace : de la qualité des données d'entraînement et de la puissance computationnelle de préentraînement vers la qualité de l'orchestration, des stratégies de décomposition de tâches et des mécanismes de synthèse. C'est un terrain où des laboratoires plus petits comme Sakana AI peuvent théoriquement rivaliser avec les géants disposant de milliards de dollars d'infrastructure.

Pour les utilisateurs professionnels, la question de la traçabilité et de l'explicabilité se pose différemment avec une architecture Fugu. Lorsqu'un modèle classique produit une réponse incorrecte, il est possible en théorie d'analyser les activations internes pour comprendre le raisonnement. Avec un système multi-agents opaque, la réponse finale est le produit d'interactions entre plusieurs modèles dont ni les inputs intermédiaires ni les contributions individuelles ne sont exposés à l'utilisateur. Pour des cas d'usage critiques nécessitant auditabilité — conformité réglementaire, décisions médicales ou juridiques — cette boîte noire supplémentaire mérite d'être évaluée soigneusement.

La question des droits de propriété intellectuelle et de la chaîne de responsabilité est également soulevée par cette architecture. Si Fugu orchestre des modèles tiers pour produire ses réponses, quelles sont les obligations vis-à-vis des fournisseurs de ces modèles sous-jacents ? Sakana AI ne divulgue pas les modèles composant son pool d'orchestration, ce qui crée une opacité juridique potentiellement problématique dans des contextes réglementaires stricts comme l'Union Européenne avec l'IA Act, qui impose des exigences de transparence sur les systèmes d'IA à haut risque.

Ce qu'il faut retenir

  • Sakana AI redéfinit le concept de "modèle" : Fugu est un système multi-agents livrés via une API standard, surpassant Opus 5 de plus de 65 % sur le benchmark visuel Chartography (48,3 vs 27,3).
  • Fugu Max à 2 dollars/M tokens cible les applications à volume ; Ultra v2 à 5/30 dollars tokens/M cible la performance maximale — les deux acceptent texte, images et PDFs sur 1M tokens de contexte.
  • L'opacité de l'orchestration sous-jacente soulève des questions d'auditabilité et de conformité IA Act qui méritent évaluation pour les déploiements en contextes réglementés.

Fugu est-il compatible avec les pipelines LangChain ou LlamaIndex existants ?

Oui. Fugu expose une API entièrement compatible avec le format OpenAI Chat Completions, ce qui le rend utilisable sans modification dans tout framework ou pipeline s'appuyant sur ce standard — LangChain, LlamaIndex, LiteLLM, Haystack et la majorité des SDK d'orchestration IA courants. Il suffit de modifier l'URL de base (base_url) et la clé API dans votre configuration pour pointer vers l'endpoint Sakana AI ou votre fournisseur Fugu choisi. Les fonctionnalités avancées comme le function calling et les entrées multimodales sont supportées selon le même protocole que les autres modèles OpenAI-compatibles.

Besoin d'un accompagnement expert ?

Ayi NEDJIMI vous accompagne sur vos projets cybersécurité et IA.

Prendre contact