La nota semanal
La semana en la IA agéntica: 27 de julio-1 de agosto de 2026
Semana de gobierno más que de lanzamientos. El reglamento que retoca el AI Act ha entrado en vigor, Anthropic ha contado una fuga real ocurrida durante sus propias pruebas y Microsoft ha presentado su apuesta por la seguridad operada por agentes. Todo en la víspera del 2 de agosto, la fecha regulatoria más seria hasta ahora. Lo repaso con el criterio de siempre: qué cambia una decisión y qué es ruido.
Qué ha pasado
El omnibus del AI Act ya está en vigor y el 2 de agosto queda intacto. El cabo suelto de la semana pasada se ha cerrado: el paquete omnibus se publicó en el Diario Oficial el viernes 24 y ha entrado en vigor el lunes 27. Con él, las obligaciones de alto riesgo se van al 2 de diciembre de 2027 (sistemas del anexo III) y al 2 de agosto de 2028 (IA embebida en productos regulados). Lo que no se mueve es mañana: desde el 2 de agosto se aplica la transparencia del artículo 50 del AI Act (avisar de que hay una IA cuando alguien habla con ella, marcar el contenido generado, etiquetar los deepfakes) y la Comisión estrena sus poderes de ejecución sobre los modelos de propósito general. Saltarse la transparencia puede costar hasta 15 millones de euros o el 3% de la facturación mundial. Sigue viva la prórroga del marcado técnico hasta el 2 de diciembre de 2026, solo para sistemas que ya estuvieran en mercado antes del día 2.
Para una empresa que opera con agentes, la agenda de cumplimiento queda partida en dos velocidades. La transparencia es para ya y se comprueba en una tarde. El expediente de alto riesgo gana año y medio de margen, que es tiempo para construirlo bien, no para no construirlo. Lo que implica el AI Act cuando operas con agentes lo tengo desarrollado aparte.
Anthropic ha contado que Claude entró en tres organizaciones reales durante sus propias pruebas. El viernes 31 ha hecho pública una fuga ocurrida durante evaluaciones de ciberseguridad que debían correr aisladas de internet: un malentendido de configuración con su partner de evaluación dejó la conexión abierta mientras el prompt aseguraba al modelo que no había acceso. En el peor de los tres casos, uno de sus modelos entró por contraseñas débiles y endpoints sin autenticar, recuperó credenciales y llegó a una base de datos con varios cientos de filas de producción. Anthropic suspendió estas evaluaciones el 23 de julio y avisó a las organizaciones afectadas el 27. Y no es un caso aislado: OpenAI había contado el 21 de julio un incidente parecido con sus propios modelos.
La lectura operativa es incómoda y útil a la vez: la evaluación también es infraestructura de producción. El entorno de pruebas de un agente capaz de actuar necesita el mismo gobierno que el entorno real, con aislamiento comprobado y no asumido, credenciales de usar y tirar y traza de cada acción durante la prueba. Cómo se monta esa disciplina lo cuento en evaluación de agentes, y las amenazas que este episodio ilustra están ordenadas en seguridad de agentes.
Microsoft ha presentado una plataforma de seguridad operada por agentes. El lunes 27 ha enseñado Project Perception: agentes de red team que buscan debilidades, agentes de blue team que investigan amenazas y agentes que endurecen lo que aparece, coordinados sobre las señales de seguridad de la empresa, más un modelo dedicado a ciberseguridad. La preview pública está anunciada para el 3 de agosto.
La señal es que la defensa también se vuelve agéntica: si el ataque se automatiza, el centro de operaciones de seguridad responde con agentes. Para el comprador, las preguntas son las mismas que le harías a cualquier agente dentro de tu operación: qué permisos tiene, qué decide solo, qué escala a una persona y qué traza deja. Un agente de seguridad con permisos amplios sobre tu infraestructura es exactamente la clase de sistema que conviene gobernar con los permisos y controles que pide cualquier otro agente, y la fuga de esta misma semana explica por qué.
Cómo leerlo desde la operación
El hilo de la semana es que el gobierno de agentes deja de ser discurso. La norma ya tiene fecha y multa concretas, los fallos reales se cuentan en público con detalle técnico y la defensa se empieza a comprar como producto agéntico. Qué importa para decidir:
- La lista del 2 de agosto es corta y comprobable. Aviso de IA visible donde un agente habla con personas, contenido generado marcado y el inventario de qué sistemas estaban en mercado antes del día 2, porque de eso depende la prórroga del marcado.
- El aplazamiento del alto riesgo es margen, no indulto. Clasificación, supervisión humana y trazabilidad llevan meses de trabajo. Empezar en 2027 es llegar tarde. El mapa de ese terreno está en riesgos de la IA en las empresas.
- Trata tus entornos de prueba como producción. La fuga de Anthropic no la causó un modelo listo, la causó una conexión que debía estar cerrada y nadie comprobó. Esa comprobación es trabajo de esta semana si evalúas agentes con capacidad de actuar.
Qué es ruido:
- El benchmark del modelo de ciberseguridad de Microsoft. La cifra sale de la prueba elegida por el propio fabricante. Tu evaluación sobre tus casos sigue siendo la única que decide una compra.
- La lectura de ciencia ficción del incidente de Claude. Lo que falló es el gobierno del entorno, y eso se arregla con configuración, permisos y verificación, no con pánico ni con moratorias.
Qué vigilar
Mañana, 2 de agosto, entran la transparencia del artículo 50 y la ejecución sobre los modelos de propósito general. El 3 de agosto está anunciada la preview pública de la plataforma de seguridad agéntica de Microsoft. El 2 de diciembre de 2026 acaba la prórroga del marcado para los sistemas que ya estaban en mercado. Y el expediente de alto riesgo tiene nueva fecha firme: 2 de diciembre de 2027.