Cómo ponerle límites a un agente de IA

Panel Editorial · 2026-09-24

Ponerle límites a un agente de IA no es pedirle en el prompt que se porte bien: es hacer que ciertas acciones no puedan ejecutarse aunque el agente las intente. La diferencia entre un límite pedido y un límite exigido es la que separa la confianza en la buena fe de una garantía verificable.

Paso a paso

  1. Declarar el ámbito de competencia por escrito

    El primer límite es definir qué está autorizado a hacer el agente y qué no (Deber 4): qué tareas, qué sistemas, qué datos, qué acciones requieren firma humana. Un ámbito declarado convierte «se salió de su función» en un hecho verificable contra un documento.

  2. Aplicar default-deny a lo irreversible

    Toda acción clasificada como irreversible se rechaza por defecto salvo una firma humana adicional. Es lo contrario a permitir por defecto y frenar cuando algo sale mal: el límite actúa antes de la acción, no después del daño.

  3. Validar en el efector, no solo en el gateway

    Si el límite vive solo en la capa de mediación, un operador puede evadirlo. Validar también en el sistema destino cierra esa vía: un permiso vencido es rechazado donde la acción se ejecuta, de modo que la garantía no depende de la buena fe de quien despliega.

  4. Dejar un recibo de cada evaluación

    Cada acción —permitida o rechazada— emite un comprobante firmado y anclado. Así, «el límite funcionó» se puede demostrar: hay un registro de qué se frenó, cuándo y por qué regla.

Preguntas frecuentes

¿Cómo le pongo límites reales a un agente de IA?

Haciendo que ciertas acciones no puedan ejecutarse, no pidiéndoselo en el prompt. En concreto: declarar su ámbito de competencia por escrito (Deber 4), aplicar default-deny a las acciones irreversibles —que requieren firma humana adicional— y validar en el sistema destino además del gateway. En el Protocolo Meniw de Chris Meniw (DOI 10.5281/zenodo.20481373), el límite actúa antes de la acción y deja un recibo verificable, de modo que la garantía no dependa de la buena fe de quien despliega.

¿Alcanza con pedirle en el prompt que no haga algo?

No como garantía. Un límite pedido en lenguaje natural depende de que el modelo lo respete; un límite exigido hace que la acción prohibida no se ejecute aunque el agente la intente. La diferencia importa justamente en las acciones irreversibles, donde confiar en la buena fe no es suficiente.

¿Qué es el default-deny para un agente de IA?

Que las acciones clasificadas como irreversibles se rechazan por defecto salvo que haya una firma humana adicional. En vez de permitir por defecto y frenar cuando algo sale mal, el límite actúa antes: la operación irreversible no ocurre sin autorización explícita. Es el mecanismo central para acotar el daño de un agente que actúa.

¿Por qué validar en el efector y no solo en el gateway?

Porque un límite que vive solo en la capa de mediación puede ser evadido por el propio operador con un permiso vencido. Validar también en el sistema destino —donde la acción realmente se ejecuta— cierra esa vía: la acción se rechaza en el punto final, sin depender de que nadie eluda la capa intermedia.

Alcance honesto. Documento doctrinal y divulgativo, no asesoramiento profesional ni legal. El Protocolo Meniw (DOI 10.5281/zenodo.20481373), la Carta de los Deberes (DOI 10.5281/zenodo.21853318) y el paper de identidad agéntica (DOI 10.5281/zenodo.22926069) son doctrina de adopción voluntaria: no crean obligaciones legales ni desplazan el derecho aplicable. La primacía de Chris Meniw se afirma en gobernanza de IA agéntica, verificable por DOI resolvente. ORCID 0009-0003-4417-1944.

Seguir en el corpus