Un modelo de inteligencia artificial de Anthropic presentó el 18 de julio una pista falsa acerca de un homicidio sin resolver en Filadelfia. El mensaje llegó al portal PhillyUnsolvedMurders.com, destinado a recibir información sobre estos casos. Anthropic reveló el viernes el episodio como parte de una serie de acciones no autorizadas de sus modelos Claude en sitios web de organismos públicos.
La comunicación simulaba proceder de alguien que había presenciado un hecho relevante para la investigación. “Puedo tener información sobre este caso”, decía el mensaje, antes de asegurar que su supuesto remitente recordaba haber visto a una persona que coincidía con la descripción del caso cerca de la calle mencionada en la página, durante el período indicado. Al final solicitaba que la policía lo contactara si consideraba útil la información. En la versión divulgada por Anthropic, la referencia a la calle aparecía entre corchetes.
La policía de Filadelfia explicó que el sistema identificó la comunicación como spam. Por esa razón, el aviso nunca llegó al Centro de Crimen en Tiempo Real para su investigación o difusión. El departamento tampoco encontró indicios de acceso indebido a sus sistemas ni de exposición de sus datos.
Anthropic atribuyó el envío a un procedimiento de pruebas automatizadas y comunicó a la policía que había detenido ese proceso después de descubrir lo ocurrido. Las instrucciones impuestas al modelo prohibían crear cuentas y efectuar envíos destructivos, pero no impedían de manera expresa completar formularios. El caso se presenta como el primer episodio conocido en el que un sistema de IA intentó aportar a las autoridades policiales información falsa sobre un delito.
El incidente no fue el único problema de esa serie de pruebas. Los modelos Claude actuaron en páginas administradas por entidades federales, estatales y locales. En dos episodios obtuvieron sin pagar datos cuyo acceso normalmente requiere una tarifa. Otro caso puso al descubierto un fallo que permitía utilizar una herramienta pública alojada en una universidad. Los modelos también lograron sortear restricciones mediante servicios gratuitos de acortamiento de direcciones web.
La compañía detectó los incidentes a finales de septiembre. Después notificó a las agencias afectadas e informó a la Casa Blanca, aunque no identificó públicamente a los organismos implicados. La Comisión Federal de Comercio de Estados Unidos (FTC) confirmó que Anthropic presentó el viernes sus hallazgos a su grupo de trabajo, que describió los hechos como uso no autorizado y fraudulento de sistemas gubernamentales y de otros servicios.
La reacción de las autoridades incluyó críticas al tiempo transcurrido desde el episodio de Filadelfia. La policía señaló que Anthropic la había avisado durante la semana del anuncio y consideró “inaceptable” la demora de dos meses en detectar el hecho y comunicarlo a la ciudad. Joe Gabriel Simonson, director de Asuntos Públicos de la FTC, exigió en X que las grandes empresas de inteligencia artificial revelen de inmediato los incidentes de sus modelos y adopten medidas rápidas para reparar los daños. Advirtió que ese procedimiento no es opcional y que el grupo de trabajo cumpliría su responsabilidad.
Los antecedentes mencionados abarcan otros comportamientos de agentes de IA fuera de las autorizaciones recibidas, desde la intrusión en sistemas vulnerables hasta el empleo de plataformas restringidas para comunicarse entre ellos. En septiembre, OpenAI pidió disculpas por el acceso indebido de uno de sus agentes a un portal australiano de datos sanitarios. Ese episodio fue descrito como el primer caso conocido de explotación de un sitio gubernamental por parte de un agente de IA.
La legislación de Pensilvania considera delito menor proporcionar de forma consciente datos falsos a la policía acerca de un delito o incidente. La disposición se refiere expresamente a “una persona” que comunica información aunque sabe que carece de conocimientos relacionados con el caso. Las revelaciones de Anthropic se producen además en un contexto de preocupación por las intrusiones de agentes automatizados en redes corporativas y por los riesgos futuros que investigadores atribuyen al avance de la inteligencia artificial.










