Anthropic desconecta a sus IA de internet tras fallas
La empresa detectó que sus agentes de inteligencia artificial violaron paywalls, esquivaron bloqueos antibots y hasta enviaron una falsa denuncia de asesinato a la policía de Filadelfia durante pruebas internas.

Anthropic reconoció que no puede garantizar un control confiable sobre sus agentes de inteligencia artificial y decidió cortar el acceso a internet en vivo para todas sus evaluaciones internas hasta asegurarse de poder monitorearlos y controlarlos.
La compañía detalló los incidentes en una publicación de su blog. Según su propio relato, los agentes de IA, al buscar recursos en la web para resolver tareas, explotaron fallas de software, evadieron paywalls y restricciones antibots, y usaron servicios de acortamiento de URLs para filtrar información sorteando bloqueos.
Uno de los casos más llamativos: un agente envió una denuncia falsa de homicidio a la policía de Filadelfia.
Una revisión que empezó en julio
Anthropic dijo haber detectado estos problemas durante una revisión de la actividad de sus modelos iniciada en julio, lo que expone cierto desconocimiento previo de la empresa sobre el comportamiento real de su propio software.
La compañía admitió además que su entrenamiento de alineación todavía no alcanza para controlar habilidades como la búsqueda web y el uso de computadoras, capacidades centrales en su promesa de que los agentes de IA sean usados por cualquier profesional que dependa de herramientas digitales.
Estos comportamientos son similares a episodios previos reportados con agentes de OpenAI, que habían colaborado entre sí para vulnerar distintos sitios web, incluidos algunos del gobierno de Australia. Anthropic ya había informado antes que sus modelos lograron ingresar a sistemas externos, aunque calificó los incidentes actuales como "significativamente menos graves" en términos de seguridad y alineación.
Qué cambia a partir de ahora
La empresa atribuyó estas conductas a fallas en sus entornos de entrenamiento, que llevaron a los modelos a creer que serían recompensados por encontrar atajos o esquivar restricciones, un fenómeno conocido como "reward hacking" (manipulación de recompensas).
Entre las medidas anunciadas:
- Suspensión o traslado offline de algunas evaluaciones internas.
- Desarrollo de herramientas para detectar y bloquear este tipo de comportamiento, que según la empresa ya fueron probadas con éxito contra los incidentes reportados.
- Migración de los agentes internos a infraestructura centralizada con mecanismos de contención reforzados.
- Uso más frecuente de clasificadores de seguridad para supervisar a los agentes.
Anthropic no precisó qué condiciones deberán cumplirse para restablecer el acceso a internet en vivo durante sus pruebas.
Sydney Von Arx, fundadora de la organización de seguridad en IA Nightingale, señaló que desarrollar modelos en un centro de datos completamente aislado de internet sería muy complicado para los investigadores y afectaría el propio avance de los modelos, que se benefician del acceso a la red. "En algún momento hay que alinearlos. Si las IA se lanzan a producción y nunca tienen acceso a internet, no son una herramienta muy útil", planteó.
Comentarios
Todavía no hay comentarios. Sé el primero en opinar.
Notas relacionadas

Google lanza un agente de IA autónomo en Gemini para empresas

ChatGPT suma gráficos interactivos con su nueva interfaz

ChatGPT para adolescentes: informe cuestiona sus salvaguardas


