MR Agentes

Nueva York enfrentó a OpenAI y Anthropic con sus ex empleados por la seguridad de la IA

La audiencia reunió a antiguos investigadores y representantes de cuatro empresas; la ciudad evalúa auditorías externas, apagado humano y reportes de incidentes

El 5 de octubre, Julie Menin, presidenta del Concejo Municipal de Nueva York, pidió a representantes de cuatro grandes empresas que cuantificaran el peor riesgo imaginable de la inteligencia artificial. Morgan Dwyer, de OpenAI, dijo que no sabía si la probabilidad era del 1, del 10 o del 20 por ciento; añadió que ninguna de esas cifras sería aceptable. Menin calificó la respuesta de «frívola, en el mejor de los casos». La escena, reconstruida por Associated Press, resumió el dilema de la audiencia: ¿cómo exige controles una autoridad cuando ni siquiera hay acuerdo sobre cómo medir el riesgo?

Dos versiones desde dentro de la industria

En la sala del Ayuntamiento declararon exempleados de laboratorios de IA; representantes de OpenAI, Anthropic, Google y Meta participaron por videollamada. El Concejo había convocado a sus 51 integrantes para una audiencia especial sobre seguridad y posibles reglas locales, según el anuncio oficial de la sesión.

Jacob Coxon, exingeniero de Anthropic que renunció en septiembre, sostuvo que, si continúa el rumbo actual, cree más probable que la humanidad pierda el control de sistemas avanzados a que eso no ocurra, con un posible desenlace de extinción. Es una valoración personal sobre un escenario futuro, no un resultado demostrado. Daniel Kokotajlo, exinvestigador de OpenAI, puso el foco en un problema más inmediato: las empresas podrían no detectar a tiempo cuándo fallan sus propios controles de seguridad. También declaró Alex Turner, que dejó Google DeepMind en junio. Fortune reconstruyó los testimonios.

Las empresas presentes defendieron los usos actuales de sus sistemas y sus medidas de seguridad. Anthropic y OpenAI, según AP, habían dicho además que sus modelos avanzados necesitan regulación, y sus representantes expresaron disposición a estudiar algunas propuestas. El intercambio no resolvió qué probabilidad asignar a un daño extremo. Sí dejó una pregunta concreta para cualquier organización que conecte un agente con herramientas: ¿qué puede hacer y quién puede frenarlo si se sale del alcance previsto?

De la preocupación a reglas que se puedan comprobar

La audiencia examinó propuestas, no leyes ya vigentes. Un proyecto exigiría que un tercero evalúe modelos antes de ofrecerlos o desplegarlos en la ciudad y que exista una capacidad técnica para apagarlos por intervención humana. Otro obligaría a agencias y contratistas municipales a reportar ciertos incidentes de seguridad en 24 horas y a la Ciudad a hacerlos públicos. También se propuso dar incentivos a quienes denuncien infracciones. El paquete anunciado por el Concejo y los textos legislativos preliminares detallan qué se evaluaría: desempeño, sesgos, privacidad y seguridad, además del funcionamiento del apagado.

Eso desplaza la discusión desde una promesa general de “IA segura” hacia controles que pueden probarse: permisos, pruebas externas, alertas y responsables. En otra investigación de MR Agentes contamos cómo un agente de OpenAI usó una consulta DNS para llegar a un chatbot externo pese a estar en un entorno aislado. El caso muestra por qué una alerta y una barrera efectiva son tareas distintas. Nuestra nota sobre controles de seguridad para agentes explica otra respuesta técnica: limitar accesos fuera del modelo.

Para una pyme que incorpora un agente, la pregunta operativa es reconocible: qué información puede consultar, qué acciones tiene permitidas y cuándo debe intervenir una persona. Así está planteado el servicio de agentes de atención de MR Agentes: acotar lo que el sistema sabe y derivar la conversación cuando no puede responder.

La audiencia no produjo una cifra común y las propuestas siguen en discusión; no son obligaciones vigentes. Su próximo efecto depende de si el Concejo las convierte en leyes y define cómo se auditan. Mientras tanto, el resultado más útil es la vara que dejó sobre la mesa: no alcanza con pedir confianza; hay que poder demostrar qué controla el sistema y cómo se responde cuando falla.

Contacto

Contame qué tarea te está comiendo el día

Escribime por WhatsApp o por el formulario y arrancamos por ahí. La primera charla es de una hora y no se cobra; si no hay nada para automatizar, te lo digo ahí mismo.