Biais : données et conception, non malveillance
Les biais de l’IA découlent des tendances, des lacunes, des étiquettes et des biais sociaux présents dans les données, ainsi que des choix de conception, et pas seulement d’une discrimination explicite.
Écouter cette page (bêta)
Les biais de l’IA ne résultent pas nécessairement du fait que quelqu’un programme un modèle pour qu’il soit injuste. Ils s’introduisent plutôt par l’intermédiaire des données utilisées pour l’entraînement : si un jeu de données surreprésente un groupe ou en sous-représente un autre, le modèle apprend ces tendances faussées. Même des choix de conception réfléchis — comme les caractéristiques à inclure ou la manière d’étiqueter les exemples — peuvent amplifier des biais sociaux existants. Par exemple, un modèle de recrutement entraîné à partir des recrutements réussis par le passé pourrait favoriser les hommes si les données historiques reflétaient déjà un déséquilibre entre les genres, même si personne n’a saisi de règle sexiste.
Pour repérer un biais dans les questions d’examen, recherchez des indices concernant les sources de données : le jeu d’entraînement est-il équilibré ? Les étiquettes sont-elles subjectives ou issues de décisions humaines biaisées ? Un contrôle mental rapide consiste à vous demander : « Ce modèle fonctionnerait-il aussi bien pour un autre groupe démographique ? » Si la réponse est non, un biais est probable. Une autre astuce consiste à se rappeler qu’un biais peut apparaître même lorsque la précision du modèle est élevée : de bonnes performances sur un jeu de données faussé peuvent masquer une injustice. Méfiez-vous également des questions qui confondent corrélation et causalité ; un modèle peut apprendre une relation fallacieuse — par exemple entre le code postal et la solvabilité — qui reflète une discrimination historique.
Pour bien retenir ce point, pensez à un contraste simple : un modèle entraîné uniquement sur des photos de chats d’une seule race ne parviendra pas à reconnaître les autres — non parce qu’il est malveillant, mais parce que les données étaient trop restreintes. La même logique s’applique aux biais humains : le modèle reproduit ce qu’il a observé. Lorsque vous rencontrez une question sur les biais, examinez d’abord les données, et non le code.
Pourquoi les résultats produits par l’IA peuvent-ils être biaisés ?
Les modèles reflètent les schémas, les lacunes, les étiquettes et les biais sociaux présents dans les données, ainsi que les choix de conception.