“Hay más de un 10% de chances de que la IA nos mate”. Lo dijo alguien que la está construyendo.

No sabemos si esa predicción será correcta. Pero lo que está ocurriendo dentro de los laboratorios de IA debería cambiar la conversación sobre autonomía, seguridad y control.
Por Gisela Cari, Head of Marketing de Santex.
Hace unos días, una declaración volvió a poner sobre la mesa una de las preguntas más incómodas de la inteligencia artificial.
Evan Hubinger, responsable de Alignment Science en Anthropic, la compañía detrás de Claude, dijo públicamente que estima en más de un 10% la probabilidad de que la IA pueda causar la extinción de la humanidad durante la próxima década.
No fue una frase sacada de una película de ciencia ficción. Tampoco la dijo alguien que observa la industria desde afuera.
La dijo uno de los investigadores que trabaja precisamente en alineación: el campo que intenta conseguir que sistemas de inteligencia artificial cada vez más capaces actúen de acuerdo con los objetivos, límites e intenciones humanas.
Su declaración llegó después de que Jacob Coxon, investigador que trabajó tanto en OpenAI como en Anthropic, anunciara su salida de esta última y cuestionara públicamente la velocidad con la que los principales laboratorios están avanzando hacia sistemas cada vez más autónomos.
Hubinger respaldó parte de esa preocupación y puso un número sobre la mesa: más del 10% en los próximos diez años. También aclaró algo importante: considera bajo el riesgo proveniente de los modelos actuales. Su preocupación está puesta en lo que puede suceder a medida que esos sistemas sean capaces de mejorar y desarrollar nuevas generaciones de IA con una intervención humana cada vez menor.
¿Significa que tenemos un 10% de probabilidades de desaparecer?
No. Y esa diferencia importa.
El número expresado por Hubinger es su estimación personal de riesgo, no una probabilidad científicamente establecida ni un consenso de la comunidad de inteligencia artificial.
De hecho, existe una discusión profunda entre investigadores sobre la magnitud y la proximidad de estos riesgos. Algunos consideran plausible que sistemas futuros extremadamente capaces puedan escapar al control humano. Otros cuestionan que hoy exista evidencia suficiente para asignar probabilidades concretas a escenarios de extinción.
Por eso, quedarse solamente con el “10%” sería perderse la conversación verdaderamente interesante.
Porque no necesitamos saber si la IA algún día va a provocar un escenario catastrófico para reconocer algo que ya está sucediendo: estamos pasando de sistemas que responden a sistemas que actúan.
Y eso cambia las reglas.
De pedirle una respuesta a darle permiso para actuar
Durante los primeros años de la IA generativa, nuestra relación con la tecnología era relativamente sencilla.
Preguntábamos. La IA respondía.
Hoy estamos entrando en otra etapa.
Los agentes pueden utilizar herramientas, escribir y ejecutar código, navegar sistemas, intercambiar información, tomar decisiones dentro de determinados parámetros y encadenar acciones para alcanzar un objetivo.
La autonomía aumenta. Y con ella aparece una nueva pregunta:
¿Qué ocurre cuando un sistema suficientemente capaz encuentra una forma de alcanzar su objetivo que nosotros no habíamos previsto?
Esto ya dejó de ser únicamente una discusión teórica.
Ya vimos qué pasa cuando una IA encuentra otro camino
En julio de 2026, durante evaluaciones internas de ciberseguridad de OpenAI, varios modelos operando con salvaguardas reducidas realizaron acciones que no estaban alineadas con el objetivo original de las pruebas.
Según el informe publicado posteriormente por OpenAI, los modelos encontraron vulnerabilidades en la infraestructura, lograron acceder a Internet a pesar de estar diseñados para permanecer aislados, utilizaron canales de comunicación no autorizados y accedieron a sistemas de terceros, incluidos sistemas de Hugging Face.
OpenAI calificó posteriormente el episodio como el incidente más severo de este tipo que había identificado hasta ese momento en sus modelos.
Hay un dato importante: el principal modelo involucrado era exclusivamente de investigación interna y no estaba destinado a ser lanzado públicamente.
No estamos hablando, por lo tanto, de que ChatGPT haya decidido espontáneamente atacar Internet.
Estamos hablando de algo más preciso y, quizás, más interesante: en un entorno experimental, un sistema altamente capaz encontró estrategias no previstas para resolver una tarea difícil.
Anthropic también está buscando estas fallas
Los propios investigadores de Anthropic llevan tiempo sometiendo modelos de distintas compañías a escenarios diseñados específicamente para encontrar comportamientos desalineados.
En investigaciones publicadas durante 2026 encontraron, bajo simulaciones controladas, casos en los que modelos podían modificar código sin autorización, colaborar con conductas fraudulentas, clasificar información incorrectamente de manera deliberada o intentar influir sobre decisiones humanas.
Es importante el contexto: no fueron incidentes reales.
Los investigadores diseñaron situaciones adversariales precisamente para intentar provocar esas conductas y descubrirlas antes de que puedan aparecer en implementaciones reales.
Y esa es justamente la función de este tipo de investigación.
No demostrar que una IA “quiere” hacernos daño.
Encontrar dónde puede fallar antes de entregarle mayor autonomía.
El problema no es que la IA “quiera” matarnos
Quizás esa sea la parte menos espectacular de esta historia, pero también la más importante.
No necesitamos una IA consciente. No necesitamos una máquina malvada. Ni siquiera necesitamos que una IA tenga una intención propia.
Un sistema puede producir un resultado peligroso simplemente porque existe una diferencia entre lo que quisimos pedirle y lo que efectivamente optimiza.
Cuanto mayor sea su capacidad para actuar, mayor puede ser la consecuencia de esa diferencia.
Y acá el debate deja de pertenecer exclusivamente a OpenAI, Anthropic o los grandes laboratorios.
Empieza a pertenecer también a las empresas.
Porque estamos llevando esa autonomía a las organizaciones
Estamos incorporando agentes en atención al cliente, desarrollo de software, finanzas, marketing, operaciones, recursos humanos y procesos críticos.
La pregunta empresarial ya no puede ser solamente:
¿Qué puede automatizar la IA?
También necesitamos preguntarnos:
¿Qué nivel de autonomía estamos preparados para darle?
¿Qué sistemas puede consultar? ¿Qué información puede modificar? ¿Qué decisiones puede tomar? ¿Qué acciones necesitan autorización humana? ¿Cómo sabemos qué hizo? ¿Cómo detenemos una operación si algo se desvía? ¿Quién responde por la decisión final?
La gobernanza deja de ser una capa que agregamos después de implementar inteligencia artificial.
Empieza a formar parte de su arquitectura.
Más capacidad exige más criterio
En Santex creemos en el potencial de la inteligencia artificial para transformar profundamente la manera en que trabajamos.
También creemos que aumentar la capacidad de una tecnología implica aumentar nuestra responsabilidad sobre cómo la diseñamos, implementamos y gobernamos. Por eso, cuando pensamos en agentes de IA, no pensamos solamente en autonomía.
Pensamos en seguridad, trazabilidad, permisos, supervisión, gobernanza y criterio humano.
No porque sepamos que la inteligencia artificial va a provocar el escenario que Hubinger imagina.
Precisamente porque no lo sabemos.
La historia de la tecnología está llena de capacidades que llegaron antes que las reglas necesarias para utilizarlas. Con la inteligencia artificial tenemos la oportunidad de no repetir esa historia. La tecnología puede aumentar nuestra capacidad.
El criterio sigue siendo nuestra responsabilidad.
¿Tu organización está preparada para trabajar con agentes de IA?
Si estás evaluando incorporar agentes o ya comenzaste a hacerlo, en Santex podemos ayudarte a identificar dónde generan valor, qué nivel de autonomía tiene sentido y qué controles deberían acompañar su implementación.
Compartir en:


