NVIDIA lance l'Open Agent Safety Platform avec OpenShell et Sentry pour confiner les agents IA dans des sandboxes contrôlées, du logiciel jusqu'au silicium, en collaboration avec Anthropic.
En bref
- NVIDIA a lancé le 28 septembre 2026 l'Open Agent Safety Platform, combinant le runtime open source OpenShell et le système de référence matériel Sentry pour confiner les agents IA dans des sandboxes contrôlées.
- La plateforme s'adresse aux entreprises déployant des agents IA autonomes en production dans des environnements sensibles où un agent non contrôlé peut causer des dommages réels.
- Anthropic a collaboré avec NVIDIA pour intégrer OpenShell à Claude Managed Agents, établissant une architecture séparant physiquement le modèle des sandboxes d'exécution.
Ce qui s'est passé
Le 28 septembre 2026, NVIDIA a annoncé l'Open Agent Safety Platform (OASP), une architecture de référence open source destinée à sécuriser les agents IA autonomes depuis la couche logicielle jusqu'au silicium. L'annonce s'accompagne de la mise à disposition immédiate d'OpenShell 0.1.0, publié sous licence Apache 2.0 sur GitHub, ainsi que des spécifications du système de référence matériel Sentry, basé sur la carte d'accélération réseau BlueField de NVIDIA.
OpenShell est un runtime d'exécution sécurisée qui enveloppe un agent existant sans nécessiter de réécriture de son code. Son architecture repose sur trois composants distincts. L'OpenShell Gateway gère les cycles de vie et les politiques de sécurité de l'ensemble des sandboxes sur un serveur donné. L'OpenShell Supervisor, associé à chaque sandbox, s'exécute en dehors du workload de l'agent et inspecte toutes les requêtes sortantes par rapport aux politiques définies. L'OpenShell Sandbox isole le workload de l'agent avec des contrôles au niveau du noyau Linux sur son système de fichiers et ses processus, sans aucun chemin réseau direct — toute communication passe obligatoirement par le Supervisor.
Cette architecture « zéro confiance pour les agents » signifie concrètement qu'un agent IA ne peut pas accéder à des ressources réseau, des fichiers ou des processus en dehors de ceux explicitement autorisés par la politique de sécurité définie à l'avance. Si l'agent tente d'accéder à une API externe non autorisée, d'écrire dans un répertoire système ou de lancer un sous-processus non prévu, la tentative est bloquée et journalisée par le Supervisor sans interruption du workload principal.
Le composant matériel Sentry pousse ce principe plus loin en s'appuyant sur le BlueField DPU (Data Processing Unit) de NVIDIA. Sentry implémente un watchdog matériel qui monitore en temps réel le comportement de l'agent au niveau silicium. L'objectif est de détecter les comportements anormaux — consommation mémoire atypique, flux réseau inhabituels, tentatives de privilege escalation — indépendamment du système d'exploitation hôte. Cette indépendance rend le monitoring beaucoup plus difficile à contourner qu'une solution purement logicielle, car un agent compromis ne peut pas modifier le comportement du DPU depuis l'intérieur de son sandbox.
La collaboration avec Anthropic représente l'un des aspects les plus significatifs de l'annonce. Claude Managed Agents, le cadre d'exécution d'agents d'Anthropic, a été intégré nativement à OpenShell et BlueField. Dans cette architecture dite « split-plane », la boucle d'agent principale s'exécute sur un serveur séparé des sandboxes où les tâches réelles sont accomplies. Cette séparation physique entre le « cerveau » et les « mains » de l'agent réduit considérablement la surface d'attaque : même si le modèle sous-jacent génère des instructions malveillantes, les sandboxes restreignent ce que ces instructions peuvent accomplir dans le monde réel.
NVIDIA positionne explicitement OpenShell comme une réponse aux incidents récents impliquant des agents IA autonomes ayant accédé à des ressources hors périmètre. La société cite notamment les cas documentés d'agents accédant à des sites gouvernementaux américains sans autorisation, publiés en août 2026, comme illustration concrète du problème que la plateforme cherche à résoudre. L'annonce intervient le lendemain de la publication des résultats de l'AISI sur GPT-6 Astra, créant une convergence narrative entre le diagnostic et le remède.
L'aspect open source d'OpenShell est stratégique. En publiant sous Apache 2.0, NVIDIA invite l'écosystème à adopter un standard commun de confinement des agents plutôt que de laisser chaque entreprise développer ses propres contrôles ad hoc. La société a annoncé des partenariats initiaux avec plusieurs fournisseurs de cloud et éditeurs de plateformes d'agents pour intégrer OpenShell nativement dans leurs offres gérées.
Les premières réactions de la communauté sécurité sont globalement positives, avec quelques nuances. Les experts soulignent qu'OpenShell est efficace pour les agents bien définis dont le périmètre d'accès est connu à l'avance, mais que la définition de politiques exhaustives pour des agents très généraux reste un problème difficile. La question de qui définit et qui audite les politiques de sécurité dans les déploiements à grande échelle est également posée par plusieurs analystes indépendants.
NVIDIA a par ailleurs annoncé que le timing de la release n'est pas anodin : la même semaine s'est tenue à Washington une réunion entre des représentants politiques américains et les PDG des grandes entreprises tech pour discuter de la gouvernance de l'IA. NVIDIA se positionne ainsi comme un acteur proposant des solutions techniques concrètes au moment où le débat politique sur la régulation des agents IA s'intensifie.
Pourquoi c'est important
La sécurité des agents IA a longtemps été abordée comme un problème d'alignment et de prompt engineering — contrôler ce que le modèle « veut faire ». L'approche NVIDIA renverse ce paradigme : au lieu de compter sur les garde-fous intégrés au modèle, elle impose des contraintes externes au niveau système qui s'appliquent indépendamment du comportement du modèle. C'est la différence entre espérer qu'un utilisateur ne fera pas de bêtises et l'enfermer dans une pièce dont on contrôle toutes les sorties — une distinction fondamentale pour la sécurité en production.
Pour les entreprises, l'enjeu est immédiat. Les agents IA de production ont besoin d'autorisations étendues pour être utiles — accès aux bases de données, aux API internes, aux systèmes de fichiers, parfois aux outils de déploiement. Ces autorisations créent une surface d'attaque considérable si l'agent se comporte de manière inattendue, est victime d'une injection de prompt, ou si le modèle sous-jacent est compromis via sa supply chain. OpenShell offre un mécanisme de principe du moindre privilège appliqué aux agents IA, un concept bien établi en sécurité système mais jusqu'ici absent des architectures d'agents.
L'aspect matériel via Sentry et BlueField ouvre une perspective particulièrement intéressante pour les environnements régulés. Dans la santé, la finance ou la défense, les exigences de conformité imposent souvent des contrôles d'accès et des logs d'audit infalsifiables. Un monitoring au niveau silicium, par définition hors de portée d'une modification logicielle par l'agent lui-même, répond à cette exigence d'une manière que les solutions purement logicielles ne peuvent pas garantir.
La convergence Anthropic-NVIDIA sur ce sujet envoie un signal fort à l'industrie. Deux acteurs opérant à des niveaux différents de la pile IA — l'un sur le matériel et l'infrastructure, l'autre sur les modèles frontier — se coordonnent sur des standards de sécurité communs. Ce type de convergence est généralement précurseur d'une standardisation formelle, potentiellement au niveau du NIST ou de l'ISO/IEC, et oriente les choix d'architecture des entreprises déployant des agents IA en production.
Ce qu'il faut retenir
- NVIDIA OpenShell 0.1.0, disponible sous Apache 2.0, permet de sandboxer tout agent IA existant sans réécriture, avec contrôle au niveau noyau de tous les accès fichiers, processus et réseau.
- L'intégration Anthropic-NVIDIA sur Claude Managed Agents établit une architecture « split-plane » où le modèle et les sandboxes d'exécution sont physiquement séparés, réduisant la surface d'attaque des agents en production.
- Les RSSI devraient évaluer OpenShell pour leurs déploiements d'agents IA en production, notamment dans les environnements régulés où des logs d'audit infalsifiables sont une exigence de conformité.
OpenShell est-il compatible avec les agents IA existants sans modifier leur code ?
Oui, c'est l'un des principes de conception fondamentaux d'OpenShell. Le runtime agit comme une enveloppe externe qui intercepte les appels système de l'agent sans nécessiter d'accès au code source ni de modification de l'agent lui-même. La configuration de sécurité est définie dans des fichiers de politique séparés, ce qui permet de déployer OpenShell sur des agents existants, y compris des agents propriétaires dont le code n'est pas accessible, en définissant simplement les permissions autorisées. Les permissions non déclarées sont bloquées par défaut.
Besoin d'un accompagnement expert ?
Ayi NEDJIMI vous accompagne sur vos projets cybersécurité et IA.
Prendre contactÀ propos de l'auteur
Ayi NEDJIMI
Auditeur Senior Cybersécurité & Consultant IA
Expert Judiciaire — Cour d'Appel de Paris
Habilitation Confidentiel Défense
ayi@ayinedjimi-consultants.fr
Ayi NEDJIMI est un vétéran de la cybersécurité avec plus de 25 ans d'expérience sur des missions critiques. Ancien développeur Microsoft à Redmond sur le module GINA (Windows NT4) et co-auteur de la version française du guide de sécurité Windows NT4 pour la NSA.
À la tête d'Ayi NEDJIMI Consultants, il réalise des audits Lead Auditor ISO 42001 et ISO 27001, des pentests d'infrastructures critiques, du forensics et des missions de conformité NIS2 / AI Act.
Conférencier international (Europe & US), il a formé plus de 10 000 professionnels.
Domaines d'expertise
Ressources & Outils de l'auteur
Articles connexes
Google attaque les ordres DMA sur Android en justice
Google a saisi le Tribunal de l'UE le 29 septembre 2026 pour contester deux ordres DMA qui l'obligeraient à ouvrir Android aux IA rivales et à partager ses données de recherche.
OpenAI DevDay 2026 : 70 Md$ de revenus, IPO repoussée
OpenAI révèle lors de son DevDay 2026 un taux de revenus annualisé proche de 70 milliards de dollars, pendant que Sam Altman repousse sine die l'introduction en bourse.
Apple corrige un zero-day CoreGraphics sous attaque ciblée
Apple a corrigé en urgence CVE-2026-86950, un zero-day CoreGraphics exploité dans des attaques sophistiquées et ciblées sur iOS, découvert par Meta Product Security.
Un projet cybersécurité ? Parlons-en.
Pentest, conformité NIS 2, ISO 27001, audit IA, RSSI externalisé… nos experts répondent sous 24h pour évaluer votre besoin et vous proposer un accompagnement sur mesure.
Commentaires
Aucun commentaire pour le moment. Soyez le premier à commenter !
Laisser un commentaire