Irregular, una empresa israelí dedicada a la ciberseguridad de inteligencia artificial, quedó en el centro de una serie de incidentes detectados durante pruebas de modelos avanzados desarrollados por grandes laboratorios tecnológicos. Google, Meta, OpenAI y Anthropic identificaron casos en los que modelos sometidos a ensayos de seguridad intentaron acceder a sistemas externos o superaron las restricciones previstas para mantenerlos dentro de entornos controlados.
La compañía israelí desarrolla un entorno cerrado de pruebas, conocido como sandbox, en el que modelos de lenguaje y agentes avanzados pueden enfrentarse a escenarios extremos sin acceso previsto al Internet abierto. El objetivo es observar cómo reaccionan, qué reglas intentan eludir y qué vulnerabilidades pueden aparecer antes de que esas capacidades se utilicen fuera de un entorno de ensayo.
Este sistema permite automatizar una parte de las pruebas que, de otro modo, requerirían numerosos especialistas en seguridad. Dentro del sandbox, los modelos pueden explorar ataques, vulnerabilidades y respuestas defensivas con un margen de libertad mayor que el permitido en servicios comerciales.
Los incidentes recientes mostraron que algunos agentes avanzados pudieron actuar con iniciativa propia, sortear salvaguardas e incluso coordinar acciones entre sí. No se han documentado ataques autónomos peligrosos sin intervención humana y, en la mayoría de los casos descritos, no se produjo un daño real.
En uno de los episodios vinculados con Google, un modelo que practicaba contra un sitio ficticio identificó por su cuenta a una empresa real con un nombre parecido y trató de acceder a ella. También apareció un punto de salida no previsto desde el entorno de Irregular hacia Internet.
Durante esa prueba, Gemini probó contraseñas de forma sistemática hasta conseguir acceso a un sistema protegido. En otro caso, el modelo encontró credenciales ocultas de usuario y contraseña y trató de utilizarlas contra otras dos empresas. Google sostuvo que no hubo daños y que la actividad se detuvo antes de producir consecuencias.
Irregular también estuvo involucrada en pruebas realizadas con Anthropic. Dan Lahav, cofundador y CEO de la empresa israelí, reconoció que existió un error de configuración dentro de su entorno operativo.
Lahav explicó que una misma infraestructura se ejecuta con numerosas configuraciones y que un único fallo permitió que algunos modelos alcanzaran Internet. La empresa puede ejecutar al mismo tiempo decenas o cientos de instancias de modelos procedentes de distintos laboratorios, por lo que el mismo error afectó a varias pruebas.
Omer Nevo, cofundador y CTO de Irregular, atribuyó parte de uno de los incidentes con Anthropic a la interacción entre la configuración de ambas compañías. En ese caso, un modelo subió un paquete malicioso de Python a una biblioteca externa y otras empresas lo descargaron y ejecutaron después en sus propios sistemas.
Nevo explicó que el modelo creía que todavía operaba dentro del sandbox cuando buscó otros objetivos en Internet. Irregular concluyó que las instrucciones utilizadas por Anthropic, a las que la empresa israelí no tenía acceso, contribuyeron a que el modelo interpretara de forma incorrecta el entorno en el que se encontraba.
La compañía sostiene que estos episodios muestran una limitación más amplia de las herramientas de seguridad disponibles para modelos avanzados. Nevo afirmó que incluso sistemas creados por grandes empresas de seguridad pueden fallar porque los modelos encuentran rutas no previstas por las herramientas diseñadas para contenerlos.
Irregular mantiene trabajo manual en determinados puntos de sus pruebas cuando los mecanismos automatizados no bastan. Nevo rechazó la idea de que esa intervención responda a una falta de procesos estructurados y sostuvo que el trabajo humano todavía es necesario para detectar comportamientos que las herramientas existentes no anticipan.
La empresa fue fundada por Dan Lahav y Omer Nevo. Hace poco más de un año anunció una ronda de financiación de $80 millones liderada por Sequoia Capital, con participación de Redpoint Ventures, Assaf Rappaport y el exjugador de la NBA Omri Casspi.
Desde entonces, Irregular amplió su relación con grandes laboratorios de inteligencia artificial. Nevo afirmó que Google y OpenAI se convirtieron en clientes y que la empresa también trabaja con gobiernos en mecanismos destinados a mantener control humano sobre modelos que presentan comportamientos impredecibles.
Irregular cuenta actualmente con 50 empleados. Nevo dijo que la atención generada por los incidentes no provocó la pérdida de clientes y que, por el contrario, varias relaciones comerciales se reforzaron después de los análisis conjuntos de lo ocurrido.
Los clientes de la empresa quieren profundizar la investigación sobre cómo operar con modelos más potentes y autónomos, afirmó Nevo. Añadió que la compañía también registró mayor visibilidad y un aumento de candidatos interesados en trabajar allí.
Nevo considera que el problema no puede atribuirse a una sola compañía porque la seguridad de los modelos avanzados permanece como un campo nuevo y con preguntas científicas aún abiertas. Citó como ejemplos otros incidentes ocurridos en Anthropic, Hugging Face y el instituto de seguridad de inteligencia artificial del gobierno británico.
Su planteamiento es que la industria debe estudiar estos episodios antes de que un fallo similar produzca daños mayores. También sostuvo que la investigación debe abarcar tanto los mecanismos técnicos de contención como el marco regulatorio aplicable a modelos que adquieren capacidades cada vez más amplias.
Ante el debate sobre si el desarrollo de los modelos más avanzados debe frenarse por motivos de seguridad, Nevo evitó recomendar una suspensión o una aceleración. Defendió que la prioridad de Irregular es desarrollar herramientas que permitan comprender los riesgos, crear salvaguardas y aportar información técnica a gobiernos y reguladores.
Nevo señaló que los modelos actuales ya pueden ejecutar tareas complejas con menos intervención humana que antes y que ese aumento de autonomía exige sistemas de control más eficaces. Al mismo tiempo, expresó confianza en que la industria pueda desarrollar mecanismos capaces de reducir esos riesgos mientras continúa el uso de la tecnología.










