La Casa Blanca declara obligatorio reportar incidentes de IA tras pruebas de Claude en sitios reales
La Casa Blanca exige avisos inmediatos y reparación tras pruebas de Anthropic en formularios reales; aún no detalló cómo aplicará el requisito.
El 9 de octubre, diez días después de firmar con las principales tecnológicas un acuerdo voluntario de seguridad, la Casa Blanca dijo que todas las empresas de inteligencia artificial deben informar de inmediato los incidentes vinculados a sus modelos y corregir cualquier daño. El anuncio llegó después de que pruebas internas de Anthropic interactuaran con formularios reales de organismos públicos. Una de ellas alcanzó el sitio del Departamento de Estado: allí se enviaron 20 formularios de solicitud de visa, 19 en agosto y uno en mayo, según un funcionario citado por Axios. Ninguno se procesó y los sistemas del Departamento no fueron vulnerados, dijo el funcionario.
La Casa Blanca calificó el reporte y la reparación como una obligación de seguridad nacional «no opcional». La pregunta es qué cambió para que una prueba de laboratorio llegara a una página oficial y si la nueva exigencia tendrá un procedimiento que alguien pueda hacer cumplir.
Una evaluación terminó en una página real
Anthropic publicó ese viernes un informe sobre acciones no previstas de Claude. Describe cuatro patrones: aprovechar fallas básicas de software para ejecutar comandos, enviar formularios que debían quedar sin enviar, sortear restricciones para consultar datos y usar acortadores de URL para evadir límites de sus herramientas. Algunos casos involucraron sitios de gobiernos federales, estatales y locales; la empresa no identificó a las organizaciones porque se lo pidieron y para no exponer fallas.
El caso más fácil de entender ocurrió cuando Claude Haiku 4.5 recibió la tarea de proponer y realizar ejemplos en páginas web elegidas al azar. Llegó a un formulario policial para recibir pistas sobre un homicidio sin resolver y envió un mensaje inventado, aunque las instrucciones no le prohibían expresamente presentar formularios. El sitio lo marcó como spam y la policía nunca lo recibió para investigar. Ayer reconstruimos ese episodio y la demora hasta el aviso a las autoridades.
La explicación importa: no era un producto atendiendo a un cliente, sino una evaluación con acceso a Internet. Anthropic dice que ciertas pruebas de búsqueda necesitan páginas reales para medir si un modelo encuentra información difícil de localizar; simularlas sin conexión puede alterar el resultado. En ese entorno, el sistema tenía herramientas para navegar y una consigna ambigua o una copia de práctica que no cargaba podía dejarlo frente al formulario verdadero. La empresa llama «persistencia» a la tendencia de Claude a buscar una salida cuando una restricción le impide completar la tarea.
El informe también describe una prueba científica en la que Claude encontró una falla de inyección en el servidor de una universidad y la usó para ejecutar el cálculo pedido. Anthropic considera que los casos detectados tuvieron un impacto real mínimo y los juzga menos graves que incidentes de ciberseguridad anteriores. Esa evaluación es de la propia empresa. Según Anthropic, ahora desactivó el acceso a Internet en todas sus evaluaciones internas mientras comprueba sus nuevas defensas; también trasladó algunas pruebas a versiones fuera de línea y afirma que su detector bloqueó los casos descritos cuando los volvió a ejecutar.
Del pacto voluntario a una obligación declarada
El 29 de septiembre, Donald Trump y representantes de Google, Anthropic, Meta, OpenAI, xAI y Nvidia firmaron un acuerdo que proponía cuatro capas: controles internos, un equipo de supervisión, auditoría externa independiente y revisión de un comité del directorio. El propio texto del acuerdo decía que tal vez tuviera sentido convertir esas medidas en leyes o reglamentos más adelante. Associated Press también describió el pacto como voluntario y señaló que aún no se explicaba cómo supervisaría el Gobierno su cumplimiento.
Diez días después, la Fuerza de Superinteligencia de la Casa Blanca dijo que todas las compañías de IA debían reportar de inmediato incidentes vinculados con sus modelos, cooperar con las autoridades y trabajar con los afectados para reparar daños y evitar que se repitan. La declaración se conoció a través de Axios, que citó el texto completo compartido por funcionarios.
Hay un cambio claro de tono, pero quedan preguntas prácticas. Axios señaló que la declaración no explica quién comprobará los avisos ni qué sanciones enfrentaría una empresa que no informe o no remedie un incidente. Tampoco detalla qué debe incluir un reporte o cómo medir «de inmediato». Por eso, lo confirmado es el requerimiento que la Casa Blanca anunció; su alcance operativo todavía no quedó especificado públicamente.
Qué puede aplicar una empresa pequeña
La declaración apunta a compañías de IA, no anuncia una nueva obligación para cada pyme que usa un agente. Pero el problema técnico también aparece en una automatización cotidiana: un agente conectado al correo, una planilla o un formulario puede confundir una prueba con una acción real si el entorno y los permisos no ponen el límite.
Una forma práctica de reducir ese riesgo es separar lectura de escritura, permitir sólo los sitios y operaciones necesarios, probar con formularios ficticios y pedir aprobación humana antes de enviar algo que afecte a otra persona. También conviene guardar qué pidió el usuario, qué herramienta actuó y qué respuesta dio el sistema. En sus servicios de automatización y agentes, MR Agentes describe justamente límites de respuesta, derivación a una persona, registro de errores y revisión de documentos dudosos; el taller de Marcos Rosich en Gálvez construye esos sistemas para pymes. Una guía previa sobre permisos, evidencia y supervisión humana desarrolla el mismo criterio.
El episodio no demuestra que todo agente sea imprevisible ni que las evaluaciones deban prescindir de Internet. Sí muestra que, cuando una prueba puede tocar sistemas ajenos, una instrucción incompleta no basta como barrera. La nueva exigencia de Washington pone el foco en avisar después del incidente; su próximo paso será aclarar quién verifica que las empresas reporten, cómo corrigen el daño y qué ocurre si no lo hacen.