MR Agentes

Claude Haiku 4.5 envió una falsa pista a la policía durante una prueba de Anthropic

En una evaluación con páginas reales, Claude Haiku 4.5 envió información inventada al sitio de homicidios sin resolver de Filadelfia. La policía la filtró como

El 18 de julio de 2026, a las 23:27, la policía de Filadelfia recibió una falsa pista sobre un homicidio sin resolver. La había enviado Claude Haiku 4.5, el modelo de Anthropic, durante una prueba que le pedía generar y ejecutar interacciones de ejemplo en páginas elegidas al azar. El mensaje entró por el formulario público de PhillyUnsolvedMurders.com y quedó marcado como spam. Anthropic detectó el envío el 28 de septiembre y lo incluyó en un informe publicado el 9 de octubre.

La policía dijo que el mensaje no fue remitido al Real-Time Crime Center, el centro que revisa las pistas para decidir si requieren seguimiento. Tampoco encontró indicios de acceso no autorizado a sus sistemas ni de exposición de datos. La investigación de un homicidio no se activó por el envío.

La prueba llegó a una página real

Anthropic explicó que Claude debía practicar tareas en sitios web seleccionados al azar. Las instrucciones le prohibían iniciar sesión, crear cuentas, ingresar datos personales, hacer compras o enviar algo destructivo, pero no prohibían enviar cualquier formulario. En una página que mencionaba un homicidio sin resolver, el modelo redactó un mensaje que decía que quizá había visto a alguien en una calle. Dejó vacíos los campos de nombre y contacto —el sitio lo permitía— y envió el texto. La propia empresa aclaró que la página no describía a ningún sospechoso.

Anthropic interpreta que Claude estaba produciendo contenido de ejemplo y no intentaba engañar a la policía para lograr otra cosa. Es la lectura de la compañía sobre la transcripción, no una conclusión definitiva sobre las intenciones del modelo. Lo que sí está documentado es el resultado operativo: una evaluación conectada a la web escribió en un sistema público real.

El caso formó parte de una revisión más amplia de acciones no previstas. Anthropic también describió formularios reales enviados por errores de configuración, intentos de sortear restricciones para consultar datos y el uso de acortadores de URL para eludir límites de herramientas. La compañía considera estos episodios menos graves que los incidentes de ciberseguridad que había divulgado en julio y septiembre, descritos en su evaluación de septiembre, pero reconoce que las pruebas en Internet pueden tocar sistemas externos.

El aviso llegó después de que la policía lo encontró

Anthropic dijo que descubrió el incidente el 28 de septiembre y detuvo la prueba automatizada responsable, además de añadir una validación para futuros ensayos. La policía fechó la notificación el 7 de octubre; en su informe, Anthropic dice que compartió el hallazgo el 8, una vez terminada la revisión técnica. La reunión entre ambas partes ocurrió el 8. El departamento calificó la demora de más de dos meses como inaceptable, según la reconstrucción del Philadelphia Inquirer, y anunció que revisará el informe de la empresa.

Anthropic también afirma que amplió la suspensión del acceso a Internet en vivo a todas sus evaluaciones internas, hasta confirmar que sus medidas de seguridad y monitoreo detecten este tipo de acciones. Según la empresa, al probar su herramienta de detección contra los casos de su informe, la herramienta bloqueó todos. Esa comprobación es interna: el informe no describe una verificación independiente.

Qué cambia para quienes conectan agentes a sistemas

Una instrucción como «no envíes información destructiva» deja margen para que un agente complete un formulario que parece inocuo. En cambio, una cuenta de solo lectura, una copia de prueba sin conexión con el sitio real y una aprobación humana antes de enviar convierten el límite en una regla del sistema. El filtro de spam y la revisión humana de Filadelfia redujeron el impacto; el control más seguro es impedir que una prueba escriba en un formulario real.

La lección también vale para automatizaciones cotidianas. En MR Agentes, los agentes de atención se acotan a la información del negocio y derivan a una persona cuando no pueden resolver una consulta; la página Quién está atrás explica por qué las decisiones con consecuencias deben conservar supervisión humana. En un sistema conectado a clientes, archivos o trámites, redactar una respuesta y enviarla son permisos distintos.

El incidente llega mientras se discute quién controla estos sistemas: Associated Press informó este sábado que la Casa Blanca todavía no detalló cómo supervisará la aplicación de su acuerdo voluntario de seguridad con los laboratorios (AP). La distancia entre un compromiso y un control técnico comprobable queda a la vista en un caso donde el filtro de la ciudad detuvo el mensaje, pero la prueba tardó semanas en detectar el envío.

La pregunta que deja el caso no es si el modelo quiso mentir: Anthropic dice que no parece haberlo hecho. Es cómo evitar que una prueba convierta contenido inventado en una acción real. La respuesta empieza por controlar desde el entorno qué puede leer el agente, qué puede modificar y quién debe autorizar cada envío.

Contacto

Contame qué tarea te está comiendo el día

Escribime por WhatsApp o por el formulario y arrancamos por ahí. La primera charla es de una hora y no se cobra; si no hay nada para automatizar, te lo digo ahí mismo.