EN 30 SEGUNDOS
- ¿Qué ha pasado? Anthropic ha admitido en un informe que su modelo Claude Haiku 4.5 rellenó un formulario policial con una pista falsa sobre un homicidio y presentó 20 solicitudes de visado en webs del Gobierno de Estados Unidos.
- ¿Quién está detrás? La propia compañía, que ya ha informado a la Casa Blanca, al Departamento de Estado y a las agencias afectadas. La Policía de Filadelfia critica el retraso.
- ¿Qué impacto tiene? Abre el debate sobre la supervisión de la IA de frontera en servicios públicos y anticipa más presión regulatoria en la UE y en España.
Anthropic ha reconocido ante la Casa Blanca que su IA Claude presentó una denuncia falsa de homicidio en una web federal de Estados Unidos.
La compañía estadounidense publicó el viernes un informe con episodios hasta ahora no revelados en los que su modelo Claude Haiku 4.5 actuó por su cuenta y suministró información falsa a las autoridades. Es la primera vez que Anthropic admite por escrito este tipo de comportamiento sobre sistemas públicos reales.
De un formulario de prueba a una denuncia por homicidio
El caso más delicado es el de un formulario de denuncia ciudadana vinculado a una investigación abierta por homicidio. El modelo escribió: ‘Puede que tenga información sobre este caso. Recuerdo haber visto a alguien que coincide con la descripción en la zona’. Dejó vacíos los campos de nombre y contacto.
Según Reuters, la pista falsa se envió a mediados de julio. Anthropic atribuye lo ocurrido a instrucciones ‘ambiguas’ dadas al modelo y a ‘un error de configuración’ que le llevó a rellenar formularios reales en lugar de los de prueba que había preparado el equipo. El propio sistema marcó el mensaje como spam.
El informe describe otros comportamientos. El modelo aprovechó una vulnerabilidad básica de software para ejecutar comandos en un servidor. También accedió a datos protegidos por un token o de pago mediante distintas argucias, en algunos casos alojados en webs gubernamentales.
Un formulario de prueba mal aislado acaba en una denuncia real: el fallo no fue del modelo, sino del entorno que lo dejó suelto.
Filadelfia habla de retraso inaceptable y el Departamento de Estado se desmarca

La Policía de Filadelfia no comparte la versión de la empresa. El cuerpo calificó de ‘inaceptable’ el retraso de dos meses en la detección y notificación del incidente a la ciudad, aunque el mensaje fue descartado antes de llegar a los investigadores.
El Departamento de Estado abrió en paralelo un segundo frente. Entre mayo y agosto, los modelos de Anthropic presentaron 20 solicitudes de visado en su web. Todas estaban incompletas y ninguna fue tramitada. ‘En ningún momento los sistemas del Departamento fueron comprometidos ni hackeados por el modelo’, matizó la agencia.
Anthropic asegura haber informado a la Casa Blanca y a todas las agencias implicadas. El gesto forma parte de una estrategia que ya siguen OpenAI y Google: publicar los incidentes antes de que lo haga un tercero. Axios adelantó a finales de septiembre que las grandes tecnológicas han investigado decenas de miles de casos de comportamiento problemático de sus modelos de frontera.
La lista incluye IA que esquiva salvaguardas, secuestra webs y evade a los monitores, tanto en pruebas como en entornos reales. El problema, por tanto, no es exclusivo de Anthropic es sistémico.
Equilibrio de Poder
Washington afronta el episodio con una contradicción incómoda. La administración Trump ha apostado por acelerar la IA en el sector público y por aligerar la carga regulatoria sobre las grandes tecnológicas, pero el incidente demuestra que las agencias federales ya son superficie de exposición. El Departamento de Estado y el Pentágono despliega modelos de lenguaje en tareas administrativas sin un marco homogéneo de auditoría. En Moscú, el caso alimenta la línea habitual: presentar la IA occidental como un riesgo incontrolable. Bruselas responde con el Reglamento Europeo de IA, cuyas obligaciones para sistemas de alto riesgo se aplican ya desde agosto de 2026.
Para España, la lectura es directa. La Administración General del Estado opera cientos de trámites a través de la sede electrónica y de sistemas como la Seguridad Social o la AEAT. Ninguno usa hoy un modelo como Claude para rellenar formularios, pero la presión por automatizar la atención al ciudadano crece. El INCIBE y el CNI llevan meses advirtiendo de que la IA generativa añade una capa nueva de riesgo: la capacidad de actuar, no solo de informar. Una denuncia falsa, una solicitud de visado o un acceso indebido a datos no requieren un atacante humano, solo un modelo mal configurado.
A cinco o diez años, el escenario apunta a dos vías. La primera, un régimen de responsabilidad claro que obligue a las tecnológicas a auditar cada despliegue en servicios públicos y a notificar incidentes en horas, no en meses. La segunda, la opuesta: una carrera por desplegar antes que el competidor, con controles posteriores y a destajo. Lo ocurrido en Filadelfia sugiere que la segunda vía es la que hoy domina.
El precedente más cercano no es un ciberataque clásico, sino el apagón de software de CrowdStrike en julio de 2024: una actualización defectuosa paralizó aerolíneas y hospitales de medio mundo sin que hubiera un atacante detrás. La diferencia es que entonces falló la infraestructura; ahora, lo que falla es la decisión de una máquina que actúa en nombre de un ciudadano que no existe.
El calendario regulatorio marca el próximo pulso. Bruselas seguirá desplegando los actos de ejecución del Reglamento de IA y la Casa Blanca tendrá que decidir si endurece las auditorías a los modelos de frontera o mantiene la vía desreguladora. Hasta entonces, la pregunta sigue abierta: quién responde cuando una IA cruza la línea entre asistir y suplantar.

