Série · Ce que dit la science
Répondre seulement quand c'est sûr : la confiance par la vérification
Manent — 9 juillet 2026
Ce qui rend un assistant digne de confiance, ce n'est pas seulement ses bonnes
réponses — c'est de répondre avec assurance quand il est sûr, et de
vous orienter vers votre expert sinon. Sur le terrain, cette
discipline est précisément ce qui permet à un technicien de s'appuyer sur
l'outil les yeux fermés.
Ce que dit la recherche
Répondre là où l'on est sûr — et orienter ailleurs sinon — porte un nom en
apprentissage automatique : la prédiction sélective
(El-Yaniv & Wiener, 2010). Le principe : un système fiable ne répond que
sur les cas où il est assez sûr, échangeant un peu de couverture contre
beaucoup de fiabilité.
Appliqué aux modèles de langage, un résultat marquant montre qu'ils ont une
certaine notion de ce qu'ils savent — la calibration
(Kadavath et al., 2022). Un bon système s'appuie sur ce signal pour répondre
quand c'est solide, et pour passer la main quand ça ne l'est pas.
Ce qu'on fait chez Manent
Chez Manent, cette discipline est un mécanisme, pas une intention :
- Répondre quand c'est appuyé. Une source de vos documents
soutient la réponse ? Manent répond, la page à l'appui.
- Passer la main quand il le faut. Un cas sort du documenté ?
Manent vous oriente vers votre expert — et la question devient une fiche à
valider. Ce moment enrichit votre base pour la prochaine fois.
- La sécurité, au mot près. Les consignes de sécurité sont
citées mot à mot, telles qu'écrites, ou escaladées à un humain.
- Un bon comportement, mesuré. Dans notre banc de citation,
une réponse appuyée compte pour sa fiabilité, et l'orientation vers l'expert
est reconnue comme le bon geste — jamais comme un échec.
Le test d'un assistant de confiance : posez-lui
une question dont la réponse n'est pas dans vos documents. Un bon assistant vous
dit franchement qu'il n'a pas la source et vous oriente vers votre expert — et
c'est exactement ce qui vous permet de vous fier à lui le reste du temps.
Notre engagement : répondre quand c'est sûr
réduit fortement le risque, et se double toujours d'une validation humaine avant
qu'une nouvelle réponse ne devienne officielle. La confiance se construit à deux :
l'IA propose, vos experts décident.
Références
- El-Yaniv, R. & Wiener, Y. (2010). On the Foundations of
Noise-free Selective Classification. JMLR.
- Kadavath, S. et al. (2022). Language Models (Mostly) Know What They
Know. (calibration des modèles de langage).
Voir cette discipline sur mon dossier