Guide technique

Consensus multi-modèles : définition, fonctionnement et limites

Mise à jour :

En bref

Le consensus multi-modèles consiste à soumettre une même question à plusieurs modèles d'IA indépendants, à comparer leurs réponses, puis à n'accepter un résultat que s'il satisfait une règle de décision fixée à l'avance (majorité, quorum, seuil d'accord). Il réduit la dépendance à un modèle unique et rend visibles les désaccords, mais il ne garantit pas l'exactitude : des modèles peuvent se tromper ensemble.

Dans un processus réglementé, la valeur du consensus tient surtout à ce qui se passe quand il n'est pas atteint : le résultat est suspendu et transmis à une personne habilitée, avec les points de désaccord.

Définition

Consensus multi-modèles
Méthode de contrôle où plusieurs modèles d'IA traitent la même demande de façon indépendante, et où une règle explicite détermine si leurs réponses concordantes peuvent être utilisées, ou si le cas doit être escaladé.

À ne pas confondre avec :

  • le routage multi-modèles, qui envoie chaque demande à un seul modèle choisi selon le coût ou la tâche ;
  • l'auto-cohérence (self-consistency), qui interroge plusieurs fois le même modèle et retient la réponse la plus fréquente (Wang et al., 2022, arXiv:2203.11171) ;
  • le débat multi-agents, où des instances échangent leurs arguments sur plusieurs tours avant de converger (Du et al., 2023, arXiv:2305.14325).

Les 4 mécanismes de décision

MécanismePrincipeAvantageLimite
Vote majoritaireLa réponse donnée par le plus grand nombre de modèles est retenueSimple, explicableSuppose des réponses comparables (choix fermé, extraction)
QuorumUn résultat n'est accepté que si une proportion fixée de modèles concorde, par exemple 2 sur 3 ; sinon il est suspenduComportement prévisible en cas de douteAugmente le nombre de cas escaladés
Vote pondéréChaque modèle a un poids selon sa fiabilité mesurée sur le domaineTient compte des différences de qualitéLes poids doivent être mesurés et revus
ArbitreUn modèle ou une règle tranche entre les réponses (Zheng et al., 2023, arXiv:2306.05685)Traite des réponses longues et non comparables mot à motL'arbitre a ses propres biais ; il doit être évalué

Pour des réponses rédigées, la comparaison porte sur le sens et non sur les mots. Des travaux récents combinent similarité sémantique et précision lexicale, avec une abstention si l'accord est insuffisant (HUMBR, arXiv:2604.11141).

Ce que le consensus réduit, et ce qu'il ne réduit pas

RéduitNe réduit pas
Les erreurs aléatoires propres à un modèle, qui se trompe rarement de la même façon qu'un autreLes erreurs partagées : mêmes données d'entraînement, même information périmée, même angle mort
La dépendance à un seul fournisseur de modèleL'erreur d'une source documentaire fournie à tous les modèles
Les réponses données avec assurance sans appui communUne question mal posée ou un contexte incomplet
L'invisibilité du désaccord : il devient une information exploitableLa responsabilité de la décision, qui reste humaine

L'hypothèse de départ (des modèles qui se trompent différemment) est aussi celle des méthodes de détection d'hallucinations par comparaison de réponses (Manakul et al., 2023, SelfCheckGPT, arXiv:2303.08896). Elle s'affaiblit quand les modèles se ressemblent. Choisir des modèles d'origines différentes et exiger que chaque affirmation soit reliée à une source limite ce risque sans le supprimer.

Coût et délai

Interroger N modèles multiplie à peu près par N le coût de calcul de chaque demande contrôlée, et le délai dépend du modèle le plus lent. C'est pourquoi le consensus se réserve aux traitements critiques. Les demandes courantes passent par un seul modèle et des contrôles plus légers.

KOREV AI ne publie pas de chiffres de latence ou de coût tant qu'ils n'ont pas été mesurés sur un protocole public reproductible (Trust Center).

Quand utiliser le consensus multi-modèles

SituationConsensus utile ?
Une erreur aurait une conséquence juridique, financière, sanitaire ou de sécuritéOui
La décision doit pouvoir être justifiée devant un auditeur ou un comitéOui
La réponse peut être vérifiée facilement par une règle déterministe (calcul, format)Non, la règle suffit
Le volume est élevé et l'enjeu faible (tri, résumé interne)Non, ou sur échantillon
Aucune source fiable n'est disponibleNon : le consensus ne remplace pas une source

Comment KOREV PRISM applique le consensus

KOREV PRISM est la couche de contrôle des traitements critiques dans l'architecture KOREV.

  1. Confrontation : le traitement critique est soumis à plusieurs modèles indépendants. Leurs conclusions sont comparées ; les accords sont confirmés et les divergences explicitées.
  2. Politique et quorum : des règles métier et un quorum, 2 sur 3 dans la configuration présentée sur le site, déterminent si le résultat peut être utilisé.
  3. Sortie arbitrée : si les conditions sont réunies, le résultat est autorisé. Sinon, KOREV PRISM n'émet pas de résultat direct : il le suspend et transmet le dossier complet à un responsable habilité (comportement dit fail-closed).
  4. Conservation : ce qui a été comparé, accepté, refusé ou escaladé est conservé pour l'audit (dossiers de décision vérifiables).

Le Trust Center le précise : KOREV PRISM ne promet pas l'absence d'erreur ; il réduit la dépendance à un modèle unique et suspend la décision quand les conditions ne sont pas réunies.

Questions fréquentes sur le consensus multi-modèles