Model Merging
iaDéfinition
Le Model Merging (fusion de modeles) est la technique de combiner les poids de plusieurs modeles fine-tunes (ayant le meme modele de base) en un seul modele, sans retrainement supplementaire. L'intuition est que si un modele A est expert en code et un modele B en mathematiques, leur fusion peut produire un modele expert dans les deux domaines. Les techniques de merging : (1) Linear interpolation (model souping) — simple moyenne arithmetique des poids : W_merged = alpha * W_A + (1-alpha) * W_B. Simple mais souvent degradant si les modeles ont diverge trop. (2) SLERP (Spherical Linear Interpolation) — interpolation spherique qui suit la geodesique sur la sphere des poids, generalement superieure a la moyenne lineaire. (3) TIES-Merging (2023) — resout les conflits de signes entre modeles en selectionnant les poids par vote majoritaire. (4) DARE — prune aleatoirement les poids avant fusion pour reduire les interferences. Les fusions de modeles populaires sur HuggingFace : Mistral 7B fusions avec des modeles code+instruct, Llama 2 fusions avec plusieurs SFTs, et des modeles francophones fuses depuis des bases multilingues. Le leaderboard 'Open LLM Leaderboard' a vu apparaitre de nombreux modeles fuses qui depassaient les composants individuels. Les limitations du model merging : (1) Ne fonctionne qu'avec des modeles de meme architecture et de meme base (impossble de fusionner Llama avec Mistral), (2) Les gains sont souvent modestes et inconsistants (le merging peut degrader autant qu'ameliorer), (3) Difficulte de predire le resultat a priori — beaucoup d'experimentations necessaires, (4) Le merging ne remplace pas le multi-task training systematique. L'outil de reference pour le model merging est mergekit (GitHub arcee-ai) : supporte Linear, SLERP, TIES, DARE, et des recettes complexes avec des configurations YAML. LaMDA, Franken-merges et Mixtral-style merges sont construits avec mergekit.
Fusion de modeles avec mergekit
# merge_config.yaml
models:
- model: mistralai/Mistral-7B-Instruct-v0.3
parameters:
weight: 0.6
- model: codellama/CodeLlama-7b-Instruct-hf
parameters:
weight: 0.4
merge_method: slerp
base_model: mistralai/Mistral-7B-v0.1 # Modele de base commun
parameters:
t: 0.5 # Parametre d'interpolation spherique
dtype: bfloat16
# Executer la fusion
# mergekit-yaml merge_config.yaml ./merged_model/
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h