-
Wall Street clôture en baisse, mais parvient à limiter ses pertes
-
Législatives en Serbie: le mouvement étudiant présente sa liste
-
IA: potentielle réunion du conseil de sécurité de l'ONU la semaine prochaine (source diplomatique française)
-
Divisé, le Congrès américain peine à agir pour réguler l'IA
-
New York: fermeture d'une douzaine de sites de deepfakes pornographiques de célébrités
-
Opération anti-LGBT+ en Turquie: une manifestation dispersée, des comptes de réseaux sociaux bloqués
-
Cisjordanie: une ONG accuse Israël de vouloir "éliminer" les Palestiniens en tant que peuple
-
Diversification des routes du pétrole, défense: Paris et Badgad consolident leurs liens
-
Londres se prépare à nationaliser la troisième aciérie du pays
-
Commerzbank : Berlin acte l'avancée d'UniCredit mais fixe ses exigences
-
Nigeria: entrée en Bourse de la méga-raffinerie Dangote
-
Sanofi va céder 20 médicaments anciens à l'allemand Cheplapharm et entrer à son capital
-
La Bourse de Paris bousculée par l'IA et la dette
-
Trump fustige une "conspiration malsaine" contre l'IA
-
Belgique: le monde universitaire "consterné" par le refus d'accueillir 13 étudiants de Gaza
-
L'extrême droite perd du terrain en Suède, à rebours du reste de l'Europe
-
Le patron de Thales en appelle aux gouvernements pour réguler l'IA
-
Sanofi va prendre 26,4% dans l'allemand Cheplapharm et lui cèder trois usines
-
Ralentir la course à l'IA, à quel prix ? Les marchés s'inquiètent
-
Wall Street ouvre en baisse, plombée par les craintes sur l'IA
-
BCE : les futurs billets en euros mobilisent plus de 9 millions d'Européens
-
Les antennes de Radio France fortement perturbées au second jour d'une grève
-
Basket: les Bleues tournées vers un Euro-2027 périlleux
-
JO-2030: la page Grospiron tournée, le CIO sur le terrain à Lyon
-
Réunis dans l'Arctique, douze pays appellent l'UE à muscler sa présence face à la menace russe
-
Un SDF jeté à terre par un policier à Carcassonne, enquête pour "violences volontaires"
-
Commerzbank-UniCredit: Berlin cherche à peser sur une prise de contrôle annoncée
-
Les dirigeants indépendantistes écossais, gallois et nord-irlandais revendiquent leur "droit à l'autodétermination"
-
Ce que l'on sait des nouvelles pistes pour interdire les réseaux sociaux aux ados
-
Le chef du nucléaire iranien empêché d'assister à une réunion à Vienne sous pression américaine
-
Déchets nucléaires: avis favorable de la commission d'enquête pour Cigéo
-
Géorgie: démission du chef des services de sécurité, en pleine instabilité gouvernementale
-
Les Houthis frappent l'Arabie saoudite, l'Iran dément toute implication dans la guerre au Yémen
-
Les dirigeants indépendantistes écossais, gallois et nord-irlandais accentuent la pression sur Londres
-
La Finlande va rejoindre l'initiative française de dissuasion nucléaire "avancée"
-
La grande peur de l'IA hors de contrôle rattrape la Bourse de Paris
-
En Suède, avantage à la gauche à l'issue de législatives ultra-serrées
-
Céline Dion fait son retour à Paris : un geste touchant pour Michel Drucker
-
Laura Linney "secouée" par son rôle dans "Onwards and Sideways" sur la maladie de Parkinson
-
Interdiction des réseaux sociaux aux ados: Macron pense avoir trouvé sa "voie de passage"
-
Les Bourses européennes entre baisse de l'IA et hausse du pétrole
-
Les antennes de Radio France perturbées par la grève
-
Nutriments clés pour une peau éclatante : les conseils de la diététicienne Nathalie Somville
-
En pleine guerre commerciale avec les Etats-Unis, le Canada toujours plus proche de l'UE
-
Contre la fracture numérique, la Corée du Sud forme ses seniors
-
Après un été sec et brûlant, la moule française en souffrance
-
A Gaza, un hôpital démuni pour soigner les bébés prématurés
-
Malgré la rébellion, les travailleurs migrants toujours plus nombreux au Cachemire indien
-
Hôtellerie-restauration : qui pour succéder à Thierry Marx à la tête du principal syndical patronal ?
-
누샤 아우벨, 책임 외치지만 포츠담의 망가진 도로는 리더십 부실 드러내
L'IA devient menteuse et manipulatrice, les chercheurs s'inquiètent
Les derniers modèles d'intelligence artificielle (IA) générative ne se contentent plus de suivre les ordres et vont jusqu'à mentir, manigancer ou menacer pour parvenir à leurs fins, sous le regard inquiet des chercheurs.
Menacé d'être débranché, Claude 4, le nouveau-né d'Anthropic, fait du chantage à un ingénieur et menace de révéler une liaison extra-conjugale. L'o1 d'OpenAI essaye lui de se télécharger sur des serveurs extérieurs et nie lorsqu'on le prend la main dans le sac.
Pas besoin d'aller fouiller dans la littérature ou le cinéma, l'IA qui se joue de l'homme est désormais une réalité.
Pour Simon Goldstein, professeur à l'université de Hong Kong, ces dérapages tiennent de l'émergence récente des modèles dits de "raisonnement", capables de travailler par étapes plutôt que de produire une réponse instantanée.
o1, version initiale du genre pour OpenAI, sorti en décembre, "a été le premier modèle à se comporter ainsi", explique Marius Hobbhahn, patron d'Apollo Research, qui teste les grands programmes d'IA générative (LLM).
Ces programmes tendent aussi parfois à simuler "l'alignement", c'est-à-dire à donner l'impression qu'ils se plient aux consignes d'un programmeur tout en poursuivant, en fait, d'autres objectifs.
Pour l'heure, ces traits se manifestent lorsque les algorithmes sont soumis à des scénarios extrêmes par des humains, mais "la question, c'est de savoir si les modèles de plus en plus puissants auront tendance à être honnêtes ou pas", estime Michael Chen, de l'organisme d'évaluation METR.
"Les utilisateurs poussent tout le temps les modèles aussi", fait valoir Marius Hobbhahn. "Ce que nous observons est un vrai phénomène. Nous n'inventons rien."
Beaucoup d'internautes évoquent, sur les réseaux sociaux, "un modèle qui leur ment ou invente. Et ce ne sont pas des hallucinations, mais une duplicité stratégique", insiste le co-fondateur d'Apollo Research.
Même si Anthropic et OpenAI font appel à des sociétés extérieures, comme Apollo, pour étudier leurs programmes, "davantage de transparence et un accès élargi" à la communauté scientifique "permettraient de meilleures recherches pour comprendre et prévenir la tromperie", suggère Michael Chen.
Autre handicap, "le monde de la recherche et les organisations indépendantes ont infiniment moins de ressources informatiques que les acteurs de l'IA", ce qui rend "impossible" l'examen de grands modèles, souligne Mantas Mazeika, du Centre pour la sécurité de l'intelligence artificielle (CAIS).
Si l'Union européenne s'est dotée d'une législation, elle concerne surtout l'utilisation des modèles par des humains.
Aux Etats-Unis, le gouvernement de Donald Trump ne veut pas entendre parler de régulation et le Congrès pourrait même bientôt interdire aux Etats d'encadrer l'IA.
- L'IA en justice? -
"Il y a très peu de prise de conscience pour l'instant", constate Simon Goldstein, qui voit néanmoins le sujet s'imposer dans les mois à venir avec la révolution des agents IA, des interfaces à même de réaliser seules une multitude de tâches.
Les ingénieurs sont engagés dans une course derrière l'IA et ses dérives, à l'issue incertaine, dans un contexte de compétition féroce.
Anthropic se veut plus vertueux que ses concurrents, "mais il essaye en permanence de sortir un nouveau modèle pour dépasser OpenAI", selon Simon Goldstein, une cadence qui offre peu de temps pour des vérifications et corrections éventuelles.
"En l'état, les capacités (de l'IA) se développent plus rapidement que la compréhension et la sécurité", reconnaît Marius Hobbhahn, "mais nous sommes toujours en mesure de rattraper notre retard".
Certains pointent dans la direction de l'interprétabilité, une science récente qui consiste à décrypter de l'intérieur le fonctionnement d'un modèle d'IA générative, même si d'autres, notamment le directeur du CAIS, Dan Hendrycks, sont sceptiques.
Les combines de l'IA "pourraient gêner son adoption si elles se multiplient, ce qui constitue une forte incitation pour les entreprises (du secteur) à résoudre" ce problème, selon Mantas Mazeika.
Simon Goldstein évoque, lui, le recours à la justice pour mettre au pas l'intelligence artificielle, en se tournant vers les sociétés en cas de sortie de route.
Mais il va plus loin et propose même de "tenir légalement responsables" les agents IA "en cas d'accident ou de crime".
Y.Kobayashi--AMWN