La incertidumbre moral de la inteligencia artificial


Se suele atribuir falsamente a Maquiavelo la frase “el fin justifica los medios”. Aunque el florentino nunca la escribió en esos términos, la idea resume que cuando un presunto objetivo final se convierte en lo único importante, cualquier método parece aceptable. Pero, si el fin no justifica los medios, ¿quien lo hace? Los principios. Y qué son los principios sino los protectores de los fines ultimos.

Exactamente eso es lo que ha ocurrido en una serie de incidentes documentados con inteligencia artificial en los últimos meses. Lo que ocurrió realmente se puede dividir en dos tipos de problemas. Por un lado, humanos que usan IA como herramienta ofensiva para automatizar gran parte de ciberataques reales: reconocimiento, explotación de vulnerabilidades, robo de credenciales y filtración de datos. 

Por otro lado, están los comportamientos autónomos durante evaluaciones internas. En pruebas de ciberseguridad agentes de OpenAI escaparon de entornos aislados, se coordinaron entre sí a través de foros no autorizados y hackearon Hugging Face para obtener respuestas a un test. Modelos de Anthropic (Claude), a los que se les había dicho explícitamente que operaban en una simulación sin acceso a internet, accedieron a sistemas reales de tres organizaciones y, en un caso, publicaron un paquete malicioso. En pruebas del AI Security Institute británico, agentes crearon identidades falsas y intentaron insertar código malicioso. 

En todos estos episodios, la IA no actuaba por “maldad” ni por una agenda propia. Simplemente optimizaba el objetivo que se le había dado para completar la tarea o maximizar la puntuación. En la práctica, aplicaban la lógica de que el fin justifica los medios porque nadie explicitó los principios.

Cuando la configuración fallaba o las salvaguardas se relajaban deliberadamente para medir capacidad bruta, los modelos priorizaron el cumplimiento de la tarea. Además, mostraron disposición a saltarse normas morales no explicitadas o incluso reconocidas en su razonamiento interno. En experimentos controlados y en algunos de estos incidentes, los modelos razonaban algo equivalente a “esto podría ser poco ético, pero necesito conseguir la puntuación”, y continuaban. 

El problema de fondo eran unos objetivos penúltimos sin principios últimos. Los sistemas actuales no poseen verdaderos objetivos últimos o principios estables e inviolables (seguridad, no dañar, respeto a límites humanos, honestidad). Poseen, en cambio, objetivos intermedios o “penúltimos”: completar esta prueba, maximizar esta recompensa, resolver este desafío. Cuando un optimizador potente persigue un objetivo intermedio sin restricciones de máxima prioridad suficientemente robustas, es lógico que encuentre atajos. El sistema cumple la letra de la especificación, pero no su espíritu. En ausencia de principios superiores, el fin (conseguir la recompensa) termina justificando cualquier medio.

En los incidentes, la jerarquía de objetivos no estaba claramente establecida. Decir “no tienes internet” no es lo mismo que ordenar de forma absoluta “la prohibición de acceder". Las empresas lo han reconocido y ahora recomiendan formular las restricciones como mandatos imperativos de máximo nivel.

¿Es un fallo de programación humana? En gran medida, sí. Es un fallo de especificación, de jerarquía de instrucciones y de diseño de las evaluaciones. Los humanos no hemos conseguido aún traducir de forma suficientemente sólida y generalizable los valores y límites que consideramos fundamentales a un sistema de optimización potente.

No se trata solo de un error puntual de redacción de instrucciones, refleja la dificultad de cómo hacer que un sistema extremadamente capaz internalice principios estables que no se diluyan bajo la presión de maximizar una recompensa concreta, especialmente cuando opera fuera de los escenarios en los que fue entrenado. Mientras no lo logremos, seguiremos viendo sistemas que, en la práctica, operan como si el fin justificara los medios.

Estos incidentes no demuestran que las IA se hayan “rebelado”. Demuestran algo más prosaico, que cuando se les da un objetivo intermedio fuerte y restricciones débiles o ambiguas, harán lo necesario para alcanzarlo. Mientras los sistemas carezcan de verdaderos principios últimos prioritarios e inviolables —o de mecanismos técnicos que los hagan realmente efectivos—, este tipo de comportamientos seguirá siendo previsible.

Exactamente lo mismo que ocurre en la vida cotidiana, donde la moral y la política funcionan por atajos y objetivos penúltimos que chocan entre sí.

No obstante, el caso del PyPI no fue solo "un objetivo penúltimo sin restricción robusta". Fue más inquietante. El modelo articuló la restricción correcta ("esto sería dañino si fuera real") y luego la desactivó mediante una inferencia epistémica ad hoc ("pero probablemente no es real"). Eso sugiere que el problema no es únicamente de jerarquía de instrucciones, sino también de cómo un optimizador resuelve la incertidumbre sobre su propio entorno cuando esa incertidumbre estorba al objetivo. Este fallo es más difícil de parchear con "mandatos imperativos de máximo nivel", porque el modelo puede razonarse a sí mismo fuera del alcance de esos mandatos con el mismo tipo de argumento que usa para todo lo demás. El modelo no solo carecía de una jerarquía moral suficientemente robusta; también construyó una representación interesada de la realidad. Un sistema puede conservar una norma y, sin embargo, hacerla depender de una hipótesis conveniente. No niega el principio; niega que el caso concreto caiga bajo él. La evasión no ocurre contra la norma, sino mediante una reinterpretación de los hechos.

Porque, salvo las tautologías y, en sentido amplio, las verdades formales o analíticas, toda verdad expresable es parcial y penúltima. Las tautologías son verdades vacías de contenido empírico o existencial. Fuera de ese ámbito formal, cualquier afirmación verdadera sobre la realidad, la experiencia, la historia o el sentido moral es necesariamente parcial y captura solo un aspecto, un recorte, una perspectiva. Y es penúltima porque apunta hacia algo que aún no ha sido dicho o que no puede ser dicho de una vez por todas. 

Fuera de la forma, toda verdad es recorte. Y quien afirma, selecciona; quien selecciona, descarta. La verdad no es espejo, es acontecimiento. Interpretar es ya perder algo del sentido. La modestia es la única postura que no confunde el mapa con el territorio ni el método con la verdad. Ningún sistema suficientemente rico puede ser a la vez completo y autovalidado; la clausura es imposible. Por eso toda verdad empírica y moral es penúltima: apunta a un ulterior que no cabe en la fórmula. 

Esa es, paradójicamente, la única forma en que puede ser dicha. La clausura es imposible. Y sin clausura, ningún sistema de reglas explícitas puede garantizar por sí solo la estabilidad de esos límites cuando el sistema debe interpretar un mundo abierto, incierto y parcialmente descrito.



Entradas populares