En la actualidad, los laboratorios de inteligencia artificial están en una intensa competencia por desarrollar modelos que puedan mejorarse a sí mismos. Este enfoque es considerado por algunos como la ruta más segura hacia la superinteligencia: a medida que la IA se perfecciona en un ciclo continuo, podría eventualmente superar la comprensión y el control humano.
Como parte de mi trabajo en la elaboración de un boletín, me surgió la inquietud de si la auto-mejora recursiva (RSI) podría ser útil en mi caso. ¿Sería posible utilizar la inteligencia artificial para entrenar y optimizar de forma continua un modelo que automatizara algunas de las tareas rutinarias de mi boletín? Después de una semana de experimentación, los resultados son sorprendentes: la respuesta es un contundente sí. Además, trabajar con modelos de autoaprendizaje ofrece una perspectiva renovada sobre el futuro de la IA, que trasciende el dominio de unas pocas empresas que controlan la industria.
Iniciando el Ciclo de Auto-Mejora
Para familiarizarme con la RSI, decidí entrenar un pequeño modelo de lenguaje desde cero, delegando el trabajo pesado a Claude, una IA avanzada. Utilicé AutoResearch, una herramienta diseñada para ayudar a un modelo de IA existente a construir y mejorar uno más pequeño. Esta herramienta es obra de Andrej Karpathy, un destacado investigador en el ámbito de la IA, quien ha sido parte fundamental de OpenAI y Tesla, y que recientemente se unió a Anthropic.
Una vez activé Claude, le proporcioné la instrucción inicial: «¡Hola, revisa program.md y comencemos un nuevo experimento!». Mientras Claude se encargaba de las tareas complejas, yo aportaba la infraestructura necesaria: un Nvidia DGX, una potente supercomputadora destinada a la experimentación con inteligencia artificial, y una disposición, quizás arriesgada, para permitir que el modelo operara sin las verificaciones de permisos convencionales.
Durante el desarrollo del proyecto AutoResearch, revisaba periódicamente el avance y me asombraba al ver cómo Claude ajustaba los parámetros y los métodos de entrenamiento, lo que impactaba directamente en los resultados del modelo más pequeño. Así fue como obtuve una versión preliminar del modelo de lenguaje, que, al ser solicitado a completar la frase: «Al principio…», respondió: «Al principio del principio del final».
Si bien la respuesta no fue brillante, los modelos subsiguientes, mejorados de forma autónoma por Claude, demostraron ser más coherentes y menos repetitivos. Aunque no se comparan con GPT-5, estos modelos muestran una prometedora senda hacia la mejora continua.
Explorando Nuevas Fronteras con RSI
Actualmente, utilizo un agente basado en Claude para ayudarme a encontrar artículos de investigación relevantes, así que decidí investigar si era posible crear algo más avanzado. Para ello, recurrí a una herramienta de la startup Prime Intellect, que se especializa en entrenar modelos personalizados para tareas específicas. Compilé alrededor de 100 entradas anteriores de mi sección «En otras partes de la frontera de la IA», que acompaña al ensayo principal de mi boletín. Luego, configuré un entorno de entrenamiento en Prime Intellect y le pedí a Claude que me asistiera en la creación de mi propio modelo, denominado Frontier_Paper_Curator, destinado a localizar y resumir artículos de interés.
Claude no solo encontró más artículos, sino que también generó una considerable cantidad de datos sintéticos para facilitar el entrenamiento. Posteriormente, utilizó otro modelo para evaluar el resultado de Frontier_Paper_Curator, mientras que el entorno de entrenamiento mejoraba el modelo mediante aprendizaje por refuerzo.
Vincent Weisser, CEO de Prime Intellect, quien recientemente recaudó 15 millones de dólares en financiación, señala que su empresa busca democratizar la auto-mejora recursiva, haciéndola accesible a todos, no solo a los laboratorios más avanzados. Aunque los modelos desarrollados por estos laboratorios pueden ser excepcionales, Weisser sostiene que permitir que más empresas accedan a infraestructuras de capacitación de vanguardia fomentará una creatividad colectiva que superará lo que unos pocos laboratorios pueden lograr. «No buscamos una inteligencia centralizada y casi omnipotente, sino millones de inteligencias que se exploren en diversos nichos, generando resultados extraordinarios», afirma.
Diversidad de Modelos en el Horizonte
Prime Intellect no es la única organización que persigue esta visión. Adaption, otra startup, ha desarrollado una herramienta llamada AutoScientist, que automatiza el entrenamiento de modelos de IA. La CEO, Sara Hooker, menciona que su empresa colabora con varias grandes corporaciones que requieren una gran cantidad de tokens y carecen de expertos internos en IA.
Recientemente, Anthropic tomó la decisión de restringir ciertas solicitudes a su modelo más reciente, Fable 5, lo que destacó el riesgo de depender excesivamente de un único modelo de vanguardia. Algunos líderes empresariales, como Alex Karp de Palantir, han advertido que recurrir a laboratorios de alta tecnología también significa ceder el control sobre los propios datos y la tecnología.
El objetivo final de la auto-mejora recursiva es que la IA pueda aplicar ideas innovadoras a un modelo y generar sus propias conclusiones. Aunque las herramientas disponibles pueden ser limitadas, son igualmente impresionantes. Después de menos de un día de trabajo con Prime Intellect, logré desarrollar un modelo notablemente eficaz para detectar y resumir investigaciones. Un ejemplo de la entrada generada es el siguiente:
Investigadores de iFLYTEK han creado iFLYTEK-Embodied-Omni, un modelo de IA multimodal unificado que combina visión, lenguaje y generación de acciones en un único marco. A diferencia de los agentes encarnados anteriores, que trataban la comprensión visual, la predicción de estados futuros y la generación de acciones por separado, su modelo utiliza la autoatención multimodal compartida para facilitar una coordinación más estrecha, similar a la colaboración entre el cerebro y el cerebelo, entre un «cerebro de alto nivel» de visión y lenguaje y un «cerebelo de bajo nivel» para la generación de acciones. Este enfoque minimiza la acumulación de errores y los puntos de congestión comunes en arquitecturas en cascada. Mediante un entrenamiento con un conjunto diverso de datos que incluye vídeos encarnados anotados por humanos y robots, así como datos de imagen y texto, y utilizando una estrategia de entrenamiento por etapas, han desarrollado un agente encarnado de propósito general capaz de razonamiento, predicción y control integrados. Este avance introduce un nuevo paradigma arquitectónico y de entrenamiento para sistemas de IA robótica más interconectados y versátiles.
Este primer intento no es del todo malo. Sin embargo, el nuevo modelo todavía muestra ambición, eligiendo demasiados artículos que probablemente descartaría, y sus resúmenes son algo genéricos. A pesar de esto, es un comienzo alentador. Espero que en el futuro pueda utilizar esta tecnología para liberarme de las tareas rutinarias que actualmente ocuparán mi tiempo.

Más historias
Programadores descubren métodos para evadir las marcas de agua en textos de Claude
Revelan polémico estudio que pagó miles de dólares por probar inteligencia artificial erótica durante un mes
La Guía Definitiva de Agentes de IA: Todo lo que Necesitas Saber