Aller au contenu principal
Expert Cybersécurité & IAv9.0
Centres de ressources conformité
Besoin d'un accompagnement expert ?
Devis personnalisé sous 24h — audit, conformité, incident
Checklists Sécurité — Audit & Durcissement
Formats disponibles
📄 PDF 📊 Excel 🌐 Web

11 checklists professionnelles couvrant 2 200+ points de contrôle. Téléchargement gratuit, aucune inscription.

OpenVINO (Intel)

ia

Définition

OpenVINO (Open Visual Inference and Neural Network Optimization) est un toolkit d'inference IA open-source developpe par Intel, optimise pour executer des modeles de machine learning sur du hardware Intel : processeurs Intel Core et Xeon (CPU), cartes graphiques Intel Arc et Iris Xe (iGPU/dGPU), et dispositifs edge Intel (Neural Compute Stick). C'est l'alternative a ONNX Runtime et TensorRT pour les environments Intel. OpenVINO supporte de nombreux frameworks via sa fonction de conversion : modeles PyTorch (via torch.export ou OpenVINO Model Conversion API), ONNX, TensorFlow/Keras, PaddlePaddle. La conversion produit un fichier IR (Intermediate Representation) au format XML+BIN qui encode le graphe optimise du modele. Pour les LLMs, Optimum Intel (HuggingFace) integre OpenVINO avec l'ecosysteme Transformers : OVModelForCausalLM permet de charger, quantifier (INT8, INT4) et executer des LLMs Llama, Mistral, Phi sur CPU Intel avec des optimisations automatiques. Un Llama 3 8B en INT4 peut fonctionner a 5-10 tokens/seconde sur un Intel Core i9 (sans GPU), ce qui le rend viable pour des applications edge. Les cas d'usage typiques d'OpenVINO : (1) Edge AI — deployer des modeles de classification, detection d'objets sur des dispositifs IoT Intel sans GPU, (2) LLM local sur CPU — executer des petits LLMs (1B-3B params) sur des serveurs d'entreprise sans GPU specifiques, (3) Hybrid execution — utiliser le CPU Intel pour certaines couches et le GPU iGPU Intel pour d'autres, (4) Low-latency — optimisation pour la latence minimale sur hardware Intel specifique. OpenVINO est particulierement pertinent pour les deployments enterprise sur-premisse ou la politique IT interdit les GPU NVIDIA ou ou les couts GPU cloud sont prohibitifs. Les serveurs CPU Intel Xeon avec OpenVINO peuvent etre une alternative viable pour les modeles compact (Phi-3 Mini, Qwen 1.5 0.5B-1.8B, Gemma 2B).

LLM sur CPU Intel avec Optimum Intel

from optimum.intel import OVModelForCausalLM
from transformers import AutoTokenizer

# Charger et quantifier en INT4 pour CPU Intel
model = OVModelForCausalLM.from_pretrained(
    'microsoft/Phi-3-mini-4k-instruct',
    export=True,           # Convertir en OpenVINO IR
    load_in_4bit=True,     # Quantisation INT4
    device='CPU'           # Execution sur CPU Intel
)

tokenizer = AutoTokenizer.from_pretrained('microsoft/Phi-3-mini-4k-instruct')
inputs = tokenizer('Explique le zero-trust en 50 mots.', return_tensors='pt')
output = model.generate(**inputs, max_new_tokens=100)
print(tokenizer.decode(output[0], skip_special_tokens=True))
# Vitesse : ~8-12 tok/s sur Intel Core i9, sans GPU

Articles liés

Un projet cybersécurité ?

Expert dispo · Réponse 24h

Devis