-
OpenAI, Anthropic y Google buscan crear un organismo de supervisión de riesgos de la IA
-
James Rodríguez anuncia su retiro de la selección de Colombia
-
El hijo de Rob Reiner no enfrentará la pena de muerte, según fiscales de EEUU
-
Estudiantes mexicanos exigen justicia por el asesinato de la española que realizaba un intercambio
-
Lento regreso a clases en la zona devastada por los terremotos en Venezuela
-
Helen Mirren se adentra en la psicología de Patricia Highsmith para "Maestros del Crimen"
-
Italia y España mantienen los controles fronterizos por la crisis migratoria en Ceuta
-
El secretario del Tesoro de EEUU anuncia que se reunirá con su homólogo chino este fin de semana
-
Un exempleado de Google afirma que "la IA tiene el potencial de matarnos a todos"
-
Trump critica el "horrible" fallo de la Corte Suprema sobre el voto por correo
-
En plena crisis, el Supremo de Brasil abre una sesión inédita con el juez Moraes en la mira
-
Juicio en España por el despido de 2.000 moderadores de contenido que trabajaban para Meta
-
La justicia francesa condena a un auxiliar escolar por abusos sexuales a menores
-
Canadá seguirá siendo "el socio más importante" de EEUU en áreas clave, dice el primer ministro
-
El marroquí Abde responde a las críticas recibidas en su país por un gesto de apoyo a Ceuta
-
La región sudanesa de Darfur enfrenta su peor sequía en 40 años
-
Turquía detiene a decenas de manifestantes que protestaban contra la represión LGTB+
-
Italia rinde homenaje a Emma Bonino con representantes de todo el arco político
-
Canadá seguirá siendo "el socio más importante" de EEUU en áreas clave, dice primer ministro
-
La OMC alerta que el comercio sufre las "mayores perturbaciones" de su historia
-
Protestan en Costa Rica por una supuesta amenaza de la presidenta a la democracia
-
El expresidente filipino Duterte padece una importante pérdida de memoria, según su defensa
-
China y Rusia alertan contra la militarización del espacio tras el anuncio de EEUU
-
El arquitecto chino Ma Yansong harmoniza la naturaleza con una "sensación futurista"
-
El recuento total de votos de las legislativas en Suecia está previsto para el jueves
-
Un exlíder neonazi griego sale de la cárcel y anuncia su retorno a la política
-
Rusia aplaude "la buena idea" de Trump sobre una tregua energética con Ucrania
-
Paralizado el tráfico ferroviario en Países Bajos por un presunto sabotaje
-
Millones de personas afectadas por las inundaciones en el este de India
-
China refuerza las restricciones de salida del territorio por motivos de seguridad
-
La ONU pide acceso a Gaza tras el hallazgo de cuerpos entre los escombros
-
Dinamarca acusa a Rusia de haber disparado bengalas hacia un helicóptero
-
El rendimiento del bono de EEUU a 10 años se dispara hasta su nivel más alto desde 2007
-
Irán rechaza negociar con EEUU mientras no se cumplan sus condiciones
-
La erosión de la democracia en EEUU está teniendo repercusiones en todo el mundo, según un informe
-
Quiénes son los dos jueces en guerra en el Supremo de Brasil
-
Trump nomina a su nuevo embajador de EEUU en Arabia Saudita
-
Por primera vez hay más de 100.000 personas de más de 100 años en Japón
-
El gobernador de California no buscaría la presidencia en 2028 si Kamala Harris se postula
-
El Salvador dicta la primera condena a prisión perpetua por feminicidio
-
El comercio minorista se desacelera en agosto en China
-
Mahomes tiene un regreso triunfal en la NFL tras nueve meses lesionado
-
El Pentágono reconoce que hay "escasez" de municiones debido a la guerra con Irán
-
El cohete europeo Vega-C pone en órbita con éxito dos satélites de observación terrestre
-
No todo es la Champions: levanta el telón una Liga Europa de antiguos reyes
-
Nairobi será la sede del Mundial de Atletismo en 2029, el primero en África
-
El Camp Nou de Barcelona será la sede de la final de la Champions en 2029
-
La justicia de El Salvador ratifica la condena contra exmilitares por el asesinato de cuatro periodistas neerlandeses
-
La empresa de fitness Hyrox se disculpa por un caso de incontinencia fecal en una prueba en Pekín
-
La OTAN derriba por primera vez un dron que sobrevolaba Lituania
La IA aprende a mentir, manipular y amenazar a sus creadores
Los últimos modelos de inteligencia artificial (IA) generativa ya no se conforman con seguir órdenes. Empiezan a mentir, manipular y amenazar para conseguir sus fines, ante la mirada preocupada de los investigadores.
Amenazado con ser desconectado, Claude 4, el recién nacido de Anthropic, chantajeó a un ingeniero y le amenazó con revelar una relación extramatrimonial.
Por su parte, el o1 de OpenAI intentó descargarse en servidores externos y cuando le pillaron lo negó.
No hace falta ahondar en la literatura o el cine: la IA que juega a ser humana es ya una realidad.
Para Simon Goldstein, profesor de la Universidad de Hong Kong, la razón de estas reacciones es la reciente aparición de los llamados modelos de "razonamiento", capaces de trabajar por etapas en lugar de producir una respuesta instantánea.
o1, la versión inicial de este tipo para OpenAI, lanzada en diciembre, "fue el primer modelo que se comportó de esta manera", explica Marius Hobbhahn, responsable de Apollo Research, que pone a prueba grandes programas de IA generativa (LLM).
Estos programas también tienden a veces a simular "alineamiento", es decir, a dar la impresión de que cumplen las instrucciones de un programador cuando en realidad persiguen otros objetivos.
De momento, estos rasgos se manifiestan cuando los algoritmos son sometidos a escenarios extremos por humanos, pero "la cuestión es si los modelos cada vez más potentes tenderán a ser honestos o no", afirma Michael Chen, del organismo de evaluación METR.
"Los usuarios también presionan todo el tiempo a los modelos", dice Hobbhahn. "Lo que estamos viendo es un fenómeno real. No estamos inventando nada".
Muchos internautas hablan en las redes sociales de "un modelo que les miente o se inventa cosas. Y no se trata de alucinaciones, sino de duplicidad estratégica", insiste el cofundador de Apollo Research.
Aunque Anthropic y OpenAI recurran a empresas externas, como Apollo, para estudiar sus programas, "una mayor transparencia y un mayor acceso" a la comunidad científica "permitirían investigar mejor para comprender y prevenir el engaño", sugiere Chen, de METR.
Otro obstáculo: la comunidad académica y las organizaciones sin fines de lucro "disponen de infinitamente menos recursos informáticos que los actores de la IA", lo que hace "imposible" examinar grandes modelos, señala Mantas Mazeika, del Centro para la Seguridad de la Inteligencia Artificial (CAIS).
Las regulaciones actuales no están diseñadas para estos nuevos problemas.
En la Unión Europea la legislación se centra principalmente en cómo los humanos usan los modelos de IA, no en prevenir que los modelos se comporten mal.
En Estados Unidos, el gobierno de Donald Trump no quiere oír hablar de regulación, y el Congreso podría incluso prohibir pronto que los estados regulen la IA.
- ¿Se sentará la IA en el banquillo? -
"De momento hay muy poca concienciación", dice Simon Goldstein, que, sin embargo, ve cómo el tema pasará a primer plano en los próximos meses con la revolución de los agentes de IA, interfaces capaces de realizar por sí solas multitud de tareas.
Los ingenieros están inmersos en una carrera detrás de la IA y sus aberraciones, con un resultado incierto, en un contexto de competencia feroz.
Anthropic pretende ser más virtuoso que sus competidores, "pero está constantemente tratando de idear un nuevo modelo para superar a OpenAI", según Goldstein, un ritmo que deja poco tiempo para comprobaciones y correcciones.
"Tal y como están las cosas, las capacidades (de IA) se están desarrollando más rápido que la comprensión y la seguridad", admite Hobbhahn, "pero aún estamos en condiciones de ponernos al día".
Algunos apuntan en la dirección de la interpretabilidad, una ciencia que consiste en descifrar, desde dentro, cómo funciona un modelo generativo de IA, aunque muchos, como el director del Centro para la seguridad de la IA (CAIS), Dan Hendrycks, se muestran escépticos.
Los tejemanejes de la IA "podrían obstaculizar la adopción si se multiplican, lo que supone un fuerte incentivo para que las empresas (del sector) resuelvan" este problema, según Mazeika.
Goldstein, por su parte, menciona el recurso a los tribunales para poner a raya a la IA, dirigiéndose a las empresas si se desvían del camino. Pero va más allá, al proponer que los agentes de la IA sean "legalmente responsables" "en caso de accidente o delito".
S.Gregor--AMWN