SIA : auto-amélioration de l'IA par mise à jour du harnais et des poids - résumé de recherche
1. Introduction : briser la séparation de l’auto-amélioration
Section intitulée « 1. Introduction : briser la séparation de l’auto-amélioration »La quête d’un système d’intelligence artificielle capable d’auto-amélioration récursive a historiquement été entravée par une division méthodologique. D’un côté, les chercheurs se sont concentrés sur l’ingénierie du harnais (silo 1), où des méta-agents modifient les invites (prompts) et la logique d’appel d’outils autour d’un modèle de base figé. De l’autre, l’optimisation des paramètres (silo 2) reposait sur l’apprentissage par renforcement ou le réglage fin au sein d’architectures logicielles rigides.
Le framework introduit par Hexo Labs, SIA (Self-Improving AI), unifie ces deux approches. À partir d’une simple spécification de tâche et d’un vérificateur déterministe, SIA fait co-évoluer son architecture logicielle (le harnais) et ses connexions neuronales (les poids) dans un système autonome en boucle fermée, sans intervention humaine.
2. 🔬 L’architecture SIA : trois agents, deux leviers
Section intitulée « 2. 🔬 L’architecture SIA : trois agents, deux leviers »L’architecture opérationnelle de SIA repose sur trois composants spécialisés de modèles de langage exécutant une boucle de rétroaction coordonnée.
Composants clés
Section intitulée « Composants clés »- Le Méta-Agent : ingère la spécification de la tâche et le code de référence pour générer le premier harnais logiciel (le scaffold), incluant les invites système, la capture d’erreurs et la logique d’appel d’outils.
- L’Agent de tâche : exécute l’objectif en utilisant le harnais actuel et les poids du modèle de base (initialement
gpt-oss-120b). Il enregistre chaque décision, appel d’outil et réponse système sous forme d’une trajectoire détaillée. - L’Agent de rétroaction (Feedback-Agent) : évalue la trajectoire d’exécution. Après chaque itération, cet agent détermine quel levier d’optimisation activer : modifier le harnais logiciel ou déclencher une étape de mise à jour des paramètres du modèle.
La boucle d’auto-amélioration
Section intitulée « La boucle d’auto-amélioration »- initialisation : le Méta-Agent crée le harnais logiciel de départ.
- exécution : l’Agent de tâche exécute le benchmark, générant une trajectoire d’exécution complète.
- évaluation : l’Agent de rétroaction analyse la trajectoire, identifie les échecs (erreurs de syntaxe, lacunes logiques ou manques d’intuition) et attribue le mérite.
- sélection du levier :
- mise à jour du harnais (SIA-H) : si l’échec est opérationnel (ex : erreurs d’analyse, outils manquants), l’Agent de rétroaction réécrit le harnais.
- mise à jour des poids (SIA-W+H) : si l’échec est conceptuel (manque d’intuition du domaine), l’Agent de rétroaction déclenche une étape d’adaptation à bas rang (LoRA, rang 32).
- itération : le processus se répète de manière autonome, développant une intuition spécifique au domaine et un harnais logiciel sur mesure.
3. Analyses de performance et benchmarks
Section intitulée « 3. Analyses de performance et benchmarks »Pour valider la généralisation de cette approche unifiée, les chercheurs ont évalué SIA sur trois domaines techniques très différents.
A. Classification des charges juridiques (LawBench)
Section intitulée « A. Classification des charges juridiques (LawBench) »La classification de 191 accusations criminelles différentes représente un défi logique et linguistique majeur.
- modèle de base : 13,5 % de précision.
- SIA-H (harnais uniquement) : atteint 50,0 % de précision grâce à un formatage strict des invites et une logique de relance.
- SIA-W+H (harnais + poids) : grimpe à 70,1 % de précision, ce qui représente une hausse de 25,1 % par rapport au précédent état de l’art (SOTA).
B. Optimisation de noyaux GPU (AlphaEvolve TriMul)
Section intitulée « B. Optimisation de noyaux GPU (AlphaEvolve TriMul) »L’agent devait écrire un noyau CUDA personnalisé pour une opération de multiplication triangulaire sur un GPU NVIDIA H100.
- performance : les mises à jour des poids ont permis au modèle de développer une intuition profonde de la gestion de la mémoire et des drapeaux de compilation.
- résultat : SIA a convergé vers un temps d’exécution de 1 017 microsecondes, soit une vitesse 12,4 % plus rapide que le meilleur code écrit par des ingénieurs humains, et une réduction de 91,9 % du temps d’exécution par rapport au modèle de base.
C. Dénoyage d’ARN unicellulaire (MAGIC scRNA-seq)
Section intitulée « C. Dénoyage d’ARN unicellulaire (MAGIC scRNA-seq) »Un benchmark de biologie hautement spécialisé nécessitant des mathématiques complexes pour l’imputation de l’expression génique.
- résultat : SIA-W+H a surpassé le SOTA précédent de 20,4 % (une amélioration de 502 % par rapport au modèle de base initial).
4. Implications architecturales et « souveraineté des outils »
Section intitulée « 4. Implications architecturales et « souveraineté des outils » »Le succès du framework SIA met en lumière une vérité fondamentale sur les agents logiciels autonomes : les modifications du harnais rendent le modèle agentique, tandis que les modifications des poids construisent l’intuition du domaine qu’aucun prompt ne peut fournir.
Lorsque l’Agent de rétroaction modifie le harnais, les améliorations se concentrent sur « l’hygiène logicielle » — meilleure gestion des erreurs, analyse robuste du JSON et gestion des limites d’appels d’API. Cependant, lorsque l’agent déclenche une mise à jour des poids, il modifie ses paramètres neuronaux pour intérioriser des structures complexes (comme des définitions juridiques ou l’alignement de la mémoire CUDA). Cette évolution à double moteur évite à l’agent de plafonner, lui permettant d’acquérir ce que les chercheurs nomment la « souveraineté des outils » — la capacité autonome de réécrire son propre pipeline d’exécution.
5. Conclusion
Section intitulée « 5. Conclusion »SIA est un jalon important sur le chemin vers une intelligence artificielle auto-dirigée. En publiant ce framework en open-source, Hexo Labs fournit à la communauté des ingénieurs une boucle concrète et reproductible pour l’amélioration autonome des systèmes. Les recherches futures doivent désormais se concentrer sur la création de limites de sécurité et de « garde-fous d’alignement » capables d’évoluer à la même vitesse que les capacités autonomes de l’agent.
Sources & références
Section intitulée « Sources & références »- papier de recherche : arXiv:2605.27276
- auteurs : Prannay Hebbar et al. (Hexo Labs, 2026).
- dépôt officiel : GitHub - hexo-ai/sia