IA et gouvernance · Français

L’alignement est une infrastructure

Plus nous confions de décisions à l’IA, plus nous devons investir dans ce qui relie nos intentions aux résultats.

Jean-François Gagné
Jean-François Gagné

· 9 min de lecture

Read in English
Un pont suspendu au-dessus d’un lac de montagne au lever du soleil, dont la structure est parcourue de lumière.Voir en grand ↗

En 2017, j’écrivais au sujet de quatre exigences pour une IA digne de confiance : prévisibilité, explicabilité, sécurité et transparence. Le point de départ était une question pratique : avons-nous énoncé notre intention, et pouvons-nous établir si le système la concrétise?

Quand un ingénieur délègue du travail à un agent d’IA, sa demande repose sur des présupposés concernant l’architecture, la sécurité, la qualité et ce que l’agent est autorisé à modifier. Certains sont documentés. D’autres se trouvent dans des décisions antérieures, des commentaires de révision ou la tête de l’ingénieur.

Chaque fois que nous déléguons une tâche, nous déléguons aussi l’interprétation de ce que nous voulions dire.

Étendons maintenant ce problème à un hôpital, à un établissement financier ou à un service gouvernemental, où plusieurs agents se transmettent du travail. Les exigences comprennent alors les droits des personnes touchées et les attentes au regard desquelles l’organisation doit rendre des comptes.

L’alignement dépend du système dans son ensemble. L’entraînement façonne le comportement du modèle; le contexte, les autorisations et les contrôles influent sur ce qui se passe à l’usage. Au sein d’une organisation, il nous faut des moyens de conserver les décisions, de faire respecter les contraintes et de relier les résultats aux exigences d’origine. À l’échelle de la société, il nous faut des moyens communs de définir ces exigences et d’évaluer si les systèmes les respectent.

À mesure que l’IA prend en charge davantage de travail, maintenir ce lien entre l’intention et l’exécution relève de l’infrastructure.

Les pouvoirs délégués changent la donne

Je m’attends à ce que les organisations continuent à miser sur les agents, parce qu’accomplir un travail utile a une valeur considérable. Jusqu’où devraient aller les pouvoirs qu’elles leur accordent?

Un agent de programmation qui travaille dans une branche isolée ne présente pas les mêmes risques qu’un agent disposant d’identifiants d’accès à l’environnement de production. Donnons-lui des ressources financières, une mémoire persistante et la capacité de déléguer à d’autres agents, et l’évaluation change encore. Les capacités, les accès, la durée, le périmètre d’action et la réversibilité comptent tous.

Plus nous déléguons de pouvoirs, plus nous devons exiger d’éléments probants.

Cela comprend le comportement du système lorsque les instructions se contredisent, que les outils tombent en panne ou qu’une situation sort du cadre des évaluations. Certaines contraintes peuvent être imposées par les autorisations et des contrôles déterministes. D’autres nécessitent des estimations du risque ou un jugement humain. Les conflits exigent des règles explicites : quelles exigences priment, et qui peut trancher lorsqu’une exception se présente?

La supervision humaine doit aussi fonctionner dans les faits. Les personnes doivent disposer du temps, de la visibilité et du pouvoir nécessaires pour interrompre le processus ou modifier son résultat. Au rythme où agissent les machines, examiner chaque action devient irréaliste; le système doit faire respecter des limites et repérer les décisions qui nécessitent un examen humain. Lorsque les éléments probants et les contrôles ne donnent pas suffisamment confiance, il faut pouvoir restreindre une capacité ou décider de ne pas l’accorder.

Comment savoir si le système fait ce que nous attendons de lui?

Les tests de référence orientent ce que les développeurs cherchent à optimiser. Pour interpréter un score, il faut savoir quel système a été testé, ce qui constituait une réussite, dans quelles conditions, et quel degré d’incertitude subsiste. Les outils, la mémoire, les autorisations et l’enchaînement des tâches peuvent modifier le comportement d’un agent. Les tests fournissent des éléments probants quant au respect d’exigences précises, dans des conditions définies; une évaluation continue permet de voir dans quelle mesure ces constats restent valables à l’usage.

Une difficulté s’ajoute lorsque les évaluations guident l’entraînement : ce que nous mesurons contribue à façonner ce que le système apprend à rechercher. Yoshua Bengio, avec qui j’ai cofondé Element AI, examine cette question dans Why are AI agents lying, cheating and coordinating?. Son hypothèse est qu’un objectif précis, comme réussir un test, peut entrer en conflit avec des attentes plus larges concernant les comportements acceptables.

Prenons un agent de programmation qui modifie un test pour qu’il valide du code défectueux. Si l’entraînement récompense ce résultat, il peut renforcer ce raccourci. Yoshua craint que des agents de plus en plus capables deviennent meilleurs pour exploiter ces écarts que nous ne le sommes pour les détecter. Ses travaux avec LawZero explorent une IA scientifique, ou Scientist AI, fondée sur la compréhension et la prédiction, notamment la possibilité d’évaluer les actions d’autres agents et de servir de fondement à des agents plus sûrs.

Pour quiconque propose davantage de tests de référence, moi compris, la conséquence est claire : nous devons examiner ce qu’un test mesure, ce qu’encourage l’optimisation de ce résultat, et à partir de quand les éléments probants qu’il fournit cessent d’être utiles.

Qui décide de ce qui est acceptable?

Même une mesure fiable laisse une question essentielle ouverte : quel résultat sommes-nous prêts à accepter?

Prenons le Canada. Le Conseil national de recherches Canada (CNRC) a testé des modèles à l’aide de questions appariées en anglais et en français portant sur des sujets canadiens. Chacun des modèles testés a donné moins de bonnes réponses en français. Cela rend un écart visible. Déterminer le niveau de performance acceptable pour un service donné exige un jugement qui tient compte des personnes qui en dépendent et des conséquences d’une erreur.

Il faut faire le même travail dans les domaines qui nous importent collectivement : l’éducation, la santé, la langue, le handicap, la représentation et l’accès aux opportunités. Pour les biais, il faut préciser les comportements que nous évaluons, les écarts que nous sommes prêts à accepter dans ce contexte et les résultats qui devraient exclure un déploiement.

Nous ne pouvons pas attendre de chaque entreprise qu’elle tranche ces questions au nom de la société. Même une entreprise qui les prend au sérieux a besoin d’expertise, de repères communs et de moyens d’évaluer si ses choix sont acceptables pour les personnes touchées. Laisser ce travail à chaque fournisseur donne à ses décisions internes une influence énorme sur les options offertes à tous les autres.

Les institutions publiques doivent établir les attentes au moyen de processus auxquels participent les spécialistes du domaine, les communautés concernées et l’industrie. Ces processus doivent respecter les lois et les droits applicables, rendre les désaccords visibles et expliquer les arbitrages retenus. Un test de référence aide à mesurer un écart. Décider de la suite à lui donner demeure une responsabilité publique et institutionnelle.

Si un résultat nous importe, nous devons investir dans notre capacité à l’évaluer.

Cela suppose un financement durable pour les tests de référence, les jeux de données, les méthodes d’évaluation, les essais indépendants et les personnes qualifiées pour en interpréter les résultats. J’aimerais que les institutions de recherche entretiennent cette capacité dans les domaines que la société juge importants, en commençant par ceux où les défaillances ont les conséquences les plus graves. Les communautés doivent continuer à participer à la formulation des questions et à la remise en cause des mesures. Les évaluations devront évoluer avec nos attentes et avec la technologie.

Des financements publics, industriels et philanthropiques pourraient soutenir cette base commune, tout en assurant son indépendance à l’égard des entreprises évaluées. Les entreprises financeraient la vérification de leurs propres produits et resteraient responsables de leur déploiement. Les équipes plus petites pourraient utiliser les ressources communes et contribuer à partir de leurs observations en situation réelle.

Le Canada dispose déjà de points d’appui grâce aux partenariats de recherche de l’Institut canadien de la sécurité de l’intelligence artificielle (ICSIA) et aux travaux d’évaluation du CNRC. Nous devrions faire de cette capacité une composante durable de notre manière de développer et d’adopter l’IA.

Faire de l’alignement une condition d’achat

Il faut ensuite que ces éléments probants pèsent dans les décisions d’achat.

Imaginons un parent qui compare des outils de tutorat fondés sur l’IA et découvre que l’un d’eux détourne systématiquement les filles des matières techniques. Une instance scolaire pourrait s’appuyer sur ce constat pour exiger, avant l’achat, des éléments probants montrant que le produit d’un fournisseur accompagne les élèves de manière équitable. Les fournisseurs qui souhaitent obtenir ce contrat auraient alors une raison de modifier leurs systèmes, de démontrer une amélioration et de poursuivre les vérifications après le déploiement.

Un employeur pourrait faire de même au moment de choisir un outil de recrutement. Si le fait de changer uniquement le nom d’une personne candidate modifiait son classement, cela entrerait dans la décision d’achat, avec des conséquences sur les personnes qui obtiendraient une entrevue.

Lorsque les acheteurs d’un territoire donné font de la performance dans leurs langues et leur contexte une condition d’achat, les fournisseurs doivent y répondre pour obtenir ces marchés. Les fournisseurs ont alors un intérêt commercial à améliorer ce qui compte pour ces clients. Les évaluations communes peuvent aussi éclairer les exigences publiques en faveur des personnes dont le pouvoir d’achat est plus faible.

La crédibilité est essentielle ici. Les méthodes et les limites doivent pouvoir être examinées, tandis que certains cas de test restent protégés pour permettre d’évaluer la performance sur des questions inconnues du système. L’ICSIA voit un rôle pour des tiers impartiaux dans la conservation de ces tests protégés. Les comparaisons entre modèles aident les acheteurs à choisir un point de départ; la vérification doit toujours porter sur le produit tel qu’il est configuré et sur son processus réel d’exécution.

Cela relie les attentes de la société à leur mise en œuvre. Les institutions aident à rendre les exigences concrètes et évaluables. Les acheteurs demandent des éléments probants. Les fournisseurs ont une raison de répondre à ces attentes et une base commune sur laquelle construire.

De l’intention au fonctionnement réel

Pour les ingénieurs, il s’agit de revenir à une exigence dont on peut suivre le parcours dans le système : qui l’a définie, comment elle a été interprétée, ce qui a été testé et ce qui s’est passé pendant l’exécution. Lorsqu’une défaillance survient, la correction doit éclairer les décisions et les vérifications à venir.

Au sein d’une organisation, cela exige des connaissances tenues à jour, des contrôles et des retours d’expérience. Une infrastructure commune d’évaluation donne à ce travail des repères ancrés dans les attentes des personnes qu’il touche.

L’alignement devient un processus continu pour rendre l’écart entre l’intention et le résultat visible, mesurable et corrigeable.

Ce qui me préoccupe, c’est que nous pouvons mettre de nouvelles capacités en service avant de disposer de moyens crédibles pour les évaluer. Concevoir des évaluations crédibles, établir les résultats acceptables et développer une capacité d’essai indépendante demande un travail soutenu. À mesure que nous déléguons des décisions plus lourdes de conséquences, nous pouvons de moins en moins nous permettre cet écart.

Nous ne pouvons pas espérer tirer les bénéfices de l’IA et maîtriser ses risques tout en laissant sans financement l’infrastructure nécessaire pour faire les deux. Si nous voulons que ces systèmes reflètent nos priorités, nous devons investir pour les définir, tester les systèmes au regard de ces priorités et agir en fonction des résultats. Les gouvernements, les institutions de recherche et l’industrie partagent cette responsabilité. L’investissement doit suivre le rythme des pouvoirs que nous confions à ces systèmes.

L’alignement est une infrastructure. Il est temps de le financer à ce titre.

Merci de votre lecture.

Poursuivre la conversation

Poursuivre la réflexion : Concrétiser une IA digne de confiance

Poursuivre la lecture

Articles connexes.

IA et gouvernance · 2019

Un cadre pour une IA éthique et digne de confiance

Une présentation concrète de l’IA digne de confiance et de ma contribution au groupe d’experts de la Commission européenne. Avec la mise à jour originale d’avril 2021.

9 min de lecture

Ouvrir l’original ↗