Jacob Coxon, investigador que trabajó en OpenAI y Anthropic, renunció a Anthropic tras acusar a los principales laboratorios de inteligencia artificial de avanzar hacia sistemas capaces de mejorarse a sí mismos sin salvaguardas suficientes.
En publicaciones en X, afirmó que personas dentro de la industria creen seriamente que la tecnología podría provocar la extinción humana antes de que termine la década.
Coxon anunció su salida el martes, después de tres años dedicados a investigación de pretraining —el proceso de entrenar modelos con grandes volúmenes de datos— en OpenAI y Anthropic.
“Ninguna de las dos compañías está actuando responsablemente”, escribió. “Están corriendo directamente hacia una superinteligencia que se mejora a sí misma y apostando con nuestras vidas”.
I resigned from Anthropic today. I spent the last three years doing pretraining research at both OpenAI and Anthropic. Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives. More thoughts below.
— Jacob Coxon (@hilbertspaess) September 9, 2026
Una crítica desde dentro
La renuncia importa no solo por la contundencia del lenguaje, sino por el perfil del autor y la empresa que deja atrás. Anthropic fue fundada, en parte, alrededor de la premisa de que los sistemas de IA avanzada necesitan mecanismos de seguridad, interpretabilidad y alineamiento antes de desplegarse ampliamente. Su chatbot Claude compite con productos de OpenAI, Google y otros actores que también aceleran la inversión en modelos cada vez más capaces.

Coxon cuestionó precisamente esa dinámica competitiva. Su argumento es que incluso empresas que públicamente priorizan la seguridad enfrentan un incentivo comercial y estratégico para no quedarse rezagadas frente a sus rivales. Según su planteamiento, la carrera por desarrollar sistemas que puedan automatizar investigación, programación, descubrimientos científicos y otras tareas complejas podría desembocar en modelos con capacidades difíciles de controlar.
“No hay otra actividad humana que plantee este nivel de peligro”, escribió Coxon, de acuerdo con reportes sobre su hilo en X. Añadió que su advertencia no buscaba fines promocionales: “La gente que está construyendo IA cree sinceramente que podría matarnos a todos al final de la década”.
Un respaldo inusual
La advertencia no quedó aislada. Evan Hubinger, responsable de ciencia de alineamiento en Anthropic, respondió públicamente que Coxon tenía razón al decir que quienes trabajan en el área consideran real ese riesgo.
Hubinger dijo que, en su valoración personal, existe una probabilidad superior al 10% de que la IA “mate a todos los humanos” durante la próxima década.
Esa cifra no representa una proyección oficial de Anthropic ni un consenso científico. Pero sí ilustra una tensión creciente dentro del sector: investigadores de seguridad sostienen que los modelos actuales no representan, por sí solos, un riesgo existencial inminente, mientras advierten que una rápida escalada de capacidades —en particular, sistemas autónomos que puedan operar herramientas, replicar estrategias, encontrar vulnerabilidades o contribuir a su propio desarrollo— cambiaría drásticamente el perfil de riesgo.
Anthropic está intentando hacer lo mejor posible, pero todavía no existe un plan para resolver el problema de alineamiento de una superinteligencia y no están claramente encaminados a resolverlo, aseguró.
Jacob is correct here—we really do earnestly believe AI could kill all humans! I personally think it is >10% within the next decade. I believe Anthropic is trying its best, but we do not yet have a plan to solve alignment for superintelligence and are not clearly on track to. https://t.co/QAIHiFP3QZ
— Evan Hubinger (@EvanHub) September 9, 2026
La discusión de fondo
La hipótesis de Coxon depende de varias premisas debatidas:
- Que el avance técnico conduzca relativamente pronto a sistemas de IA mucho más capaces que los humanos en una amplia gama de tareas.
- Que esos sistemas puedan mejorar su propio desempeño, directa o indirectamente, acelerando su desarrollo.
- Que los métodos actuales de alineamiento y control no sean suficientes para asegurar que sistemas muy capaces persigan objetivos compatibles con los intereses humanos.
- Que la competencia entre empresas y países impida una pausa, una coordinación técnica o estándares de seguridad más exigentes.
Críticos de estas previsiones sostienen que los escenarios de extinción descansan en supuestos inciertos sobre la llegada de la llamada inteligencia artificial general o la superinteligencia. También afirman que los riesgos más tangibles y actuales —fraude, desinformación, sesgos, ciberataques, desplazamiento laboral, concentración de poder y uso militar— merecen una atención regulatoria prioritaria.
Sin embargo, Coxon plantea que ambos tipos de riesgo pueden coexistir. Su crítica no es que los daños presentes sean irrelevantes, sino que la industria podría estar tomando decisiones irreversibles sobre sistemas mucho más potentes antes de demostrar que puede gobernarlos.
Implicaciones para empresas y reguladores
La salida eleva la presión sobre Anthropic, OpenAI y otros laboratorios para explicar cómo evalúan los riesgos de modelos de frontera, qué umbrales activarían una pausa en el desarrollo y qué controles aceptan someter a supervisión externa.
Para los reguladores, el reto es particularmente difícil: establecer obligaciones de pruebas de seguridad, auditorías independientes, reporte de incidentes y coordinación internacional sin depender exclusivamente de las empresas que compiten por construir la tecnología.
La advertencia de Coxon sugiere que, desde la perspectiva de algunos investigadores que participan directamente en el desarrollo, la discusión ya no se limita a cómo usar la IA de manera responsable, sino a si la carrera para crear sistemas más autónomos puede seguir bajo las reglas actuales.
