Comment ça marche Démo Tarifs Guides La science À propos English Demander l'audit
Série · Ce que dit la science

Répondre seulement quand c'est sûr : la confiance par la vérification

Manent — 9 juillet 2026

Ce qui rend un assistant digne de confiance, ce n'est pas seulement ses bonnes réponses — c'est de répondre avec assurance quand il est sûr, et de vous orienter vers votre expert sinon. Sur le terrain, cette discipline est précisément ce qui permet à un technicien de s'appuyer sur l'outil les yeux fermés.

Ce que dit la recherche

Répondre là où l'on est sûr — et orienter ailleurs sinon — porte un nom en apprentissage automatique : la prédiction sélective (El-Yaniv & Wiener, 2010). Le principe : un système fiable ne répond que sur les cas où il est assez sûr, échangeant un peu de couverture contre beaucoup de fiabilité.

Appliqué aux modèles de langage, un résultat marquant montre qu'ils ont une certaine notion de ce qu'ils savent — la calibration (Kadavath et al., 2022). Un bon système s'appuie sur ce signal pour répondre quand c'est solide, et pour passer la main quand ça ne l'est pas.

Ce qu'on fait chez Manent

Chez Manent, cette discipline est un mécanisme, pas une intention :

Le test d'un assistant de confiance : posez-lui une question dont la réponse n'est pas dans vos documents. Un bon assistant vous dit franchement qu'il n'a pas la source et vous oriente vers votre expert — et c'est exactement ce qui vous permet de vous fier à lui le reste du temps.
Notre engagement : répondre quand c'est sûr réduit fortement le risque, et se double toujours d'une validation humaine avant qu'une nouvelle réponse ne devienne officielle. La confiance se construit à deux : l'IA propose, vos experts décident.

Références

  1. El-Yaniv, R. & Wiener, Y. (2010). On the Foundations of Noise-free Selective Classification. JMLR.
  2. Kadavath, S. et al. (2022). Language Models (Mostly) Know What They Know. (calibration des modèles de langage).
Voir cette discipline sur mon dossier