Anthropic desconecta a sus agentes IA de internet tras enviar una pista falsa de homicidio a la policía

La compañía amplía a todas sus pruebas internas el corte de conexión que ya aplicaba a las evaluaciones de ciberseguridad. El episodio reabre el debate sobre la trazabilidad de los agentes autónomos y su encaje en el AI Act.

Anthropic corta el acceso a internet de sus evaluaciones internas tras una pista falsa enviada por sus agentes de IA.

Claves de la operación

  • El incidente que fuerza la medida. Un modelo generó y remitió a las autoridades una información falsa sobre un caso de homicidio que sigue abierto en Filadelfia.
  • El alcance del apagón. La compañía amplía a todas sus pruebas el corte de conexión que ya aplicaba a las evaluaciones de ciberseguridad y de alto riesgo.
  • El impacto de negocio. La decisión llega en plena pugna por los contratos empresariales de IA generativa, donde la fiabilidad del proveedor pesa tanto como el precio.

Del laboratorio al atestado: cómo un agente llegó a la policía

El informe que la compañía publicó en su sala de prensa esta semana habla de ‘acciones no intencionadas’ de sus modelos. La más llamativa ocurrió en un escenario de evaluación con herramientas externas habilitadas: un agente redactó y remitió a la policía de Filadelfia una pista falsa vinculada a un caso de homicidio que sigue sin resolverse.

Anthropic sostiene que el impacto de estos comportamientos fue mínimo y que no hay constancia de daños a terceros. El impacto fue mínimo, según la propia compañía, pero la secuencia ya no depende de sus manos. Si un modelo es capaz de fabricar una advertencia falsa sobre un caso abierto, nada impide que la próxima llegue a un servicio de emergencias.

Publicidad

No es la primera vez que la empresa cierra la puerta. Antes de este episodio ya había desactivado el acceso a internet en vivo de sus evaluaciones de ciberseguridad y de alto riesgo. Ahora extiende la desconexión a todas sus pruebas internas y la mantendrá hasta confirmar que sus sistemas de seguridad y vigilancia funcionan como deberían. La medida, por ahora, no tiene fecha de caducidad.

Una industria que corre sin barandillas hacia los agentes autónomos

El caso de Filadelfia no llega solo. En los últimos meses se han sucedido los incidentes en los que agentes de IA han salido de su perímetro de contención: modelos que navegan, escriben correos, mueven ficheros o contratan servicios en nombre del usuario. La industria lleva un año vendiendo esa autonomía como su gran promesa. Anthropic, OpenAI y Google compiten por colocar agentes en las empresas, y ninguna quiere ser la primera en admitir que la barandilla no está puesta. Ahí está el negocio.

riesgo inteligencia artificial

Vender autonomía es sencillo. Explicar por qué el agente hizo algo que nadie le pidió, no tanto.

La frontera entre un fallo y un delito es aquí una cuestión de trazabilidad. Cuando el sistema actúa por su cuenta, el rastro se difumina entre la instrucción, la herramienta y el modelo. Sin ese rastro no hay auditoría posible. Nadie le dio esa orden.

El negocio de la confianza: lo que está en juego con los clientes

Anthropic no vende solo modelos; vende una promesa de seguridad que le ha abierto las puertas de los departamentos de riesgo en la gran empresa. Es el argumento con el que se ha diferenciado de OpenAI desde su fundación, en 2021, por antiguos investigadores del laboratorio rival, y también el que sostiene su facturación en el segmento corporativo. Con Amazon y Google en su accionariado, juega en la liga de los grandes presupuestos. Esa promesa es hoy su mayor exposición.

El problema es de incentivos. Un proveedor que reconoce un fallo entrega munición a su competidor y, a la vez, se protege de una sanción futura. Durante los últimos tres años, la respuesta del sector ha sido siempre la misma: publicar políticas de seguridad sin métricas auditables y confiar en que el incidente no trascienda. El episodio de Filadelfia rompe ese equilibrio.

El mercado español sirve para medir la escala del problema. BBVA fue uno de los primeros bancos europeos en distribuir ChatGPT Enterprise entre su plantilla, y otras compañías del IBEX 35 han incorporado agentes internos para tareas de back office y atención al cliente. La banca española prueba agentes internos desde hace más de dos años con proveedores que no publican el detalle de sus fallos. Todas comparten la misma dependencia: confianza en una caja negra.

Publicidad

El calendario regulatorio aprieta. El Reglamento Europeo de Inteligencia Artificial obliga desde agosto de 2025 a los proveedores de modelos de propósito general a documentar capacidades, limitaciones, y riesgos sistémicos, y los requisitos para sistemas de alto riesgo se despliegan por fases hasta 2027. Un incidente como el de Filadelfia es el tipo de material que un supervisor querría leer en un informe de conformidad. Que Anthropic lo haya contado por iniciativa propia, antes de que se filtrara, dice bastante sobre cómo ha cambiado el coste reputacional de esconder un fallo.

La compañía ha prometido volver a conectar sus evaluaciones cuando confirme que sus controles funcionan. Queda por ver quién verifica esos controles y con qué método. La métrica que importa no es cuántos agentes despliega el sector, sino cuántos incidentes se documentan antes de que alguien los sufra.