Los siete pecados de los agentes de IA

Por qué casi todo framework responde a los fallos de los agentes con más proceso humano — y por qué ontoref los gradúa con gates que se verifican solos

Jesús Pérez 6 min de lectura
Los agentes no fallan al azar: fallan con siete vicios sistemáticos que sobreviven a la prueba de 'parece correcto'. El instinto es añadir proceso —un PEP, un KEP, un comité—, pero toda fase de graduación termina apoyada en un humano que la aprueba, y la velocidad del agente supera al humano que pones en la puerta. Esta es la comparación honesta: qué heredan los ADR de ontoref de PEP y KEP, y dónde los rebasan con criterios de graduación witnessed, decidibles y de slice acotado.
Los siete pecados de los agentes de IA

Los agentes de IA no fallan al azar. Fallan de forma sistemática — siempre los mismos siete vicios, y todos sobreviven a la prueba de “parece correcto”:

  1. Soberbia de validación — los tests pasan porque el agente los ajustó a su solución, no porque la solución sea correcta.
  2. Contagio de sesgo — el revisor hereda el contexto del ejecutor y confirma su error en vez de atacarlo.
  3. Pereza de corrección — el feedback es débil; el sistema no converge, solo se detiene.
  4. Glotonería de validación — tanta verificación inútil que nadie distingue la señal del ruido.
  5. Idolatría de evidencia falsa — logs y métricas que no prueban nada se tratan como garantía.
  6. Avaricia de óptimo local — correcto contra los tests, frágil contra el mundo.
  7. Confusión de roles — el ejecutor reinterpreta el objetivo, el revisor edita en vez de juzgar; nadie decide qué es cierto.

El arreglo obvio — y por qué se queda corto

Ante esto, el instinto es añadir proceso. Un PEP. Un KEP. Una plantilla con “Rejected Ideas” obligatorio, fases alpha→beta→GA, un comité de revisión. Es buena ingeniería de propuestas, y conviene mirarla de cerca, porque cada uno aporta una primitiva que sí carga peso:

  • PEP optimiza la memoria de la decisión: no puedes aceptar una propuesta sin documentar qué descartaste y por qué.
  • KEP optimiza el compromiso escalonado: no avanzas de alpha a beta porque “ya está”, sino porque cumples criterios que declaraste de antemano.

El problema no es el proceso. Es que cada fase de graduación termina apoyándose en un humano que la aprueba. Y la velocidad del agente supera al humano que pones en la puerta. El gate se atasca antes de que puedas contratar al siguiente revisor. Los pecados #1 y #5 —la validación soberbia y la evidencia falsa— no se arreglan con más juicio humano: se arreglan quitando al humano de la ruta crítica.

Lo que ontoref ya hace — el gate como invariante, no como reunión

Una decisión en ontoref es un ADR: un fichero tipado, no un acta. Y para ascender de Proposed a Accepted no pasa por un comité — pasa por gates que se ejecutan solos:

  • Contra el pecado #5 (evidencia falsa). adr-accepted-has-proof: ningún ADR llega a Accepted si no está citado por una Proof del posicionamiento. La graduación exige evidencia referencial, comprobable por máquina, no la palabra de nadie.
  • Contra el pecado #1 (validación soberbia). Las restricciones de cada ADR no son prosa: son checks tipados —Grep, Cargo, NuCmd, ApiCall, FileExists— que el modo validate-project dispara y que fallan en rojo si la realidad se desvía. No puedes ajustar el test a la solución: el test es la solución declarada.
  • Contra el pecado #7 (roles confusos). El criterio que gradúa está sujeto a una disciplina: debe ser decidible y leer un slice acotado del estado. Un validador que pretenda juzgar “verdad” en vez de estructura se rechaza por contrato. El que juzga no improvisa: solo puede afirmar lo que un slice finito demuestra.
  • Contra los pecados #3 y #6 (no converge / óptimo local). Las tensiones nombradas y la disciplina ondaod impiden colapsar un dilema arquitectónico eligiendo un polo para “cerrar el ticket”. La decisión registra la síntesis, no el atajo.

ontoref contra PEP y KEP — qué hereda y qué rebasa

PrimitivaPEPKEPontoref (ADR)
Alternativas rechazadas obligatoriassí (alternatives_considered, required)
Graduación por criterio pre-declaradonosí (humano)sí, witnessed y decidible
Criterio acotado y verificable por máquinanonosí (slice + decidibilidad)
Restricciones ejecutables, no prosanonosí (5 variantes tipadas)
Cruce con invariantes del dominiononosí (ondaod / ontology_check)

PEP y KEP son estándares maduros, y ontoref hereda lo mejor de ambos. Pero cierra el agujero que ninguno toca: el criterio de graduación es él mismo un objeto verificable sin un humano dentro.

No es un revisor mejor. Es un gate que no se cansa, no se sepulta y corre antes de que el código —o la decisión— exista. Los agentes no fallan por falta de inteligencia. Fallan por falta de un gate que no sea humano.

¿Te ha resultado útil? Valóralo
¿Tienes algo que aportar? Cuéntame qué opinas, qué sugieres, o si seguimos explorando este tema.
· lecturas

Usamos cookies para que este sitio funcione, entender el uso del servicio y apoyar acciones de marketing. Política de cookies para más información.