TLDR
En este artículo propongo una forma de leer cómo han avanzado los modelos de lenguaje grandes (LLM, por sus siglas en inglés) en los últimos años, a partir de tres preguntas.
- ¿Por qué los primeros LLM, los de antes de los modelos de razonamiento de 2024, parecían tan «tontos»? Porque aprendieron de un internet lleno de resultados y casi vacío de procesos, y tenían que dar cada respuesta de golpe, sin ir paso a paso.
- ¿Qué cambió con el razonamiento? La cadena de pensamiento les dejó resolver los problemas pieza por pieza, y el aprendizaje por refuerzo les enseñó a hacerlo por su cuenta y a pensar más cuando hace falta.
- ¿Por qué los modelos de razonamiento actuales no son capaces de proponer métodos o ideas nuevas? Mi hipótesis es que el refuerzo solo afina lo que el modelo ya consigue alguna vez, y que casi ninguna idea nueva viene con una forma automática de comprobarla.
Para las dos primeras me apoyo en artículos de los últimos años. La tercera todavía no tiene una respuesta establecida, así que ahí paso al terreno hipotético.
Los primeros LLM predecían la siguiente palabra
Un modelo de lenguaje hace una sola cosa. Dado un texto, reparte la probabilidad entre todas las formas posibles de continuarlo, elige el siguiente token (un trozo de palabra), lo añade y vuelve a empezar. Es la predicción del siguiente token (next-token prediction, NTP), y el entrenamiento consiste justo en eso, repetido con cientos de miles de millones de tokens de internet, libros y código. GPT-2 y, sobre todo, GPT-3 mostraron que, con suficientes datos y parámetros, esta tarea tan simple da para mucho. Traducían, resumían o respondían preguntas sin que nadie los hubiera entrenado para ninguna de esas tareas (Radford et al., 2019 · Brown et al., 2020).
Los ChatGPT de 2022 y 2023 se entrenaban un poco más para que sus respuestas agradasen a las personas, a partir de ejemplos de qué respuestas preferían (Ouyang et al., 2022). Ese ajuste los hizo mucho más útiles, pero aquí lo dejo de lado, porque no creo que sea una pieza clave del camino hacia la inteligencia. En el fondo, seguían siendo máquinas de continuar texto.
Dos problemas aparecían una y otra vez. El primero eran las alucinaciones, respuestas falsas dichas con total seguridad, como una cita que no existe o una fecha inventada. No son un fallo raro, sino la consecuencia natural de cómo se entrenan y se evalúan estos modelos. Igual que en un examen tipo test que no penaliza los errores, arriesgar una respuesta sale más a cuenta que admitir que no se sabe (Kalai et al., 2025). El segundo eran los problemas de varios pasos, como una multiplicación larga, un acertijo lógico o un plan. Los modelos acertaban los casos fáciles y se hundían en cuanto había que encadenar muchos pasos (Dziri et al., 2023). La figura 1 lo muestra con tres ejemplos.[1]
Hay una razón de fondo para lo segundo. Internet está lleno de resultados y casi vacío de procesos. Se publica la solución del problema y no los veinte borradores, el artículo terminado y no las semanas de callejones sin salida, «37 × 48 = 1776» y no la multiplicación en columna. A las personas nos pasa algo parecido. Cuando ya dominamos un proceso, lo interiorizamos y dejamos de escribirlo, porque ya no lo necesitamos. Un niño, en cambio, necesita verlo todo desglosado para aprender a multiplicar. Un LLM que aprende de lo que escribimos los adultos se encuentra con los resultados, pero casi nunca con el desglose.
Ante «37 × 48» caben dos maneras de acertar. La primera es haber visto esa cuenta tantas veces que el resultado se sabe de memoria. La segunda es haber aprendido cómo se multiplica y aplicarlo a cualquier par de números. Queremos la segunda, porque es la única que generaliza, y la segunda obliga a encadenar competencias más pequeñas, como multiplicar una cifra por otra, llevarse una o sumar en columna. Es como construir con piezas de Lego, que se colocan de una en una. El problema es que, para escribir cada token, el modelo hace una sola pasada por la red, con un número fijo de capas. Si la cadena de piezas es más larga de lo que cabe en esa pasada, no puede montarla de golpe, y solo le queda adivinar o tirar de memoria.
No es solo una intuición. Hay resultados teóricos que lo demuestran (Feng et al., 2023), y en la práctica pasaba justo eso. GPT-3 sumaba sin fallos números de dos cifras, pero con cinco cifras acertaba menos del 10 % de las veces (Brown et al., 2020). Y que un modelo acierte muchos ejemplos no quiere decir que haya aprendido el procedimiento. Los transformers tienden a resolver estos problemas reconociendo trozos de cálculos que ya han visto, no con un método sistemático, y por eso el acierto se desploma a medida que el problema crece (Dziri et al., 2023).
Imagina aprender matemáticas solo con el solucionario, cientos de enunciados, cada uno con su resultado y ni un solo desarrollo. Con el tiempo reconocerías patrones («si el enunciado habla de porcentajes, el resultado suele ser redondo») y acertarías bastantes ejercicios parecidos a los que ya has visto. Pero ante uno nuevo solo podrías tirar de intuición y, cuando la intuición fallase, no tendrías manera de darte cuenta, porque nunca aprendiste a comprobar nada. Así es un LLM entrenado solo con NTP, un estudiante brillante que se ha aprendido el solucionario de memoria. Tiene una intuición excelente, pero es solo intuición.
Ahora bien, el solucionario enseña mucho. Casi todo lo que sabe un modelo lo aprende en el preentrenamiento, y las fases posteriores sirven sobre todo para sacarlo a la luz. Me gusta pensarlo con dos palabras, alcance y control. El preentrenamiento da el alcance, es decir, lo que el modelo puede llegar a resolver. El posentrenamiento da el control, que es saber cuándo seguir trabajando en un problema y cuándo parar. LIMA lo mostró con un experimento muy limpio. Bastaron mil ejemplos bien elegidos para ajustar un modelo preentrenado, sin aprendizaje por refuerzo ni preferencias humanas, y sus respuestas resultaron iguales o mejores que las de GPT-4 en el 43 % de los casos (Zhou et al., 2023). Y en sentido contrario, cuando se intenta enseñarle hechos nuevos durante el ajuste, el modelo los aprende mucho más despacio que los que ya conocía y, cuando por fin los aprende, alucina más (Gekhman et al., 2024).
El conocimiento, por tanto, está ahí desde el preentrenamiento. Lo que falta es una manera de usarlo en problemas que necesitan muchos pasos. Y si hacen falta muchos pasos, la solución parece obvia. Hay que dejar que el modelo los dé de uno en uno, por escrito.
La cadena de pensamiento y el posentrenamiento
Después llegó el «razonamiento». En 2022, un equipo de Google Brain, con Jason Wei como primer autor y Denny Zhou al frente, publicó el artículo que dio nombre a la chain of thought (CoT), la cadena de pensamiento (Wei et al., 2022). La idea es muy simple y muy potente. Si en lugar de pedirle la respuesta directamente se le muestran al modelo unos pocos ejemplos resueltos paso a paso, el modelo también resuelve paso a paso, y acierta mucho más. Poco después se vio que ni siquiera hacían falta los ejemplos. Bastaba con añadir «Pensemos paso a paso» a la pregunta para que un modelo de OpenAI pasase del 17,7 % al 78,7 % de aciertos en un conjunto de problemas aritméticos (Kojima et al., 2022). A partir de ahí empezamos a enseñar a los modelos a encarar los problemas poco a poco (figura 2).
Por qué funciona tiene que ver con lo anterior. Cada token escrito es una pasada más por la red, y los resultados intermedios quedan en el texto, donde las pasadas siguientes los pueden leer. Es la otra mitad de ese resultado teórico, porque con una cadena de pensamiento un transformer de tamaño fijo sí puede resolver los problemas que no podía resolver de golpe (Feng et al., 2023). Pero creo que hay algo más. Escribir los pasos obliga al modelo a construir la solución pieza por pieza, desde la base, en lugar de saltar a una respuesta recordada, y hay trabajos que apuntan en esa dirección. Los modelos responden bien a cada subpregunta por separado y aun así fallan la pregunta que las combina, un hueco que no se cierra al hacer el modelo más grande pero sí al pedirle que se haga las subpreguntas en voz alta (Press et al., 2022). Eso sí, la CoT no funcionaba con cualquier modelo. En el artículo original solo mejoraba los resultados a partir de unos 100.000 millones de parámetros, y los modelos pequeños escribían cadenas fluidas pero sin lógica (Wei et al., 2022). Es una pista de que la cadena organiza un conocimiento que ya tiene que estar ahí.
La CoT tiene muchas ventajas y pocos inconvenientes. Es barata, no obliga a cambiar el modelo y deja ver por dónde va el razonamiento, aunque no siempre refleje lo que el modelo calcula por dentro (Chen et al., 2025). Hoy está presente, de una forma u otra, en todos los modelos punteros. Con esta herramienta en la caja podíamos soñar con resolver problemas más complejos, pero faltaba una pieza. ¿Cómo conseguir que los modelos aprendiesen por sí solos a resolver problemas con la CoT?
La respuesta fue el aprendizaje por refuerzo (reinforcement learning, RL). Ante un problema verificable, el modelo propone varias soluciones, se comprueba cuáles llegan a la respuesta correcta y se ajusta el modelo para que las que han funcionado sean más probables. Es una idea elegante, y no es nueva, pero a partir de 2024 llegó a una escala enorme. OpenAI lo presentó con o1 (OpenAI, 2024) y DeepSeek publicó los detalles con R1 (DeepSeek-AI, 2025), entrenado con GRPO, un algoritmo que compara cada intento con la media de su grupo (Shao et al., 2024). La figura 3 lo reproduce en pequeño.
El RL no solo enseñó a los modelos a trabajar de forma más autónoma. También abrió un eje nuevo para escalar. Hasta entonces, mejorar un modelo quería decir hacerlo más grande o darle más datos, y ahora también se le puede dejar pensar más antes de responder. La CoT nos dio la herramienta para escalar en tiempo, y el RL, el método para aprovecharla. Durante el entrenamiento de R1-Zero, las respuestas se alargan solas. Nadie le pide que piense más, pero pensar más da más recompensa (DeepSeek-AI, 2025). Es lo que se conoce como cómputo en inferencia (test-time compute), y funciona. A igualdad de cómputo total, un modelo pequeño que piensa más puede superar a uno catorce veces mayor, siempre que el pequeño ya acierte el problema de vez en cuando (Snell et al., 2025).
Así empezamos a dedicar cantidades enormes de cómputo a problemas muy difíciles, y en julio de 2025 una versión de Gemini alcanzó oficialmente el nivel de medalla de oro en la Olimpiada Internacional de Matemáticas (Luong y Lockhart, 2025). En septiembre de 2026, OpenAI fue mucho más lejos. Un sistema de unos 10.000 agentes, con un gasto de millones de dólares en cómputo, produjo una demostración de que las ecuaciones de Navier–Stokes en tres dimensiones pueden desarrollar una singularidad en tiempo finito cuando actúa sobre el fluido una fuerza externa suave (OpenAI, 2026a · Kahn, 2026). Es una de las alternativas que admite el enunciado oficial del problema del milenio, así que, si se confirma, sería el primero de esos problemas resuelto con una máquina. La demostración ocupa 166 páginas y viene con una formalización en Lean (OpenAI, 2026b), pero la comunidad todavía la está revisando y hay una disputa abierta sobre el mérito. Cuanto más tiempo (y, por tanto, dinero) le damos a la máquina, mejor.
Sin embargo, el cuento no es tan bonito como parece. El RL tiene efectos secundarios.
- Hace que el modelo repita lo que ya le ha funcionado. Las soluciones premiadas se vuelven cada vez más probables y las demás desaparecen, así que la diversidad de respuestas colapsa y el modelo explora cada vez menos (Cui et al., 2025). Pasa porque cada refuerzo hace todavía más probable lo que ya salía a menudo, mientras que lo que casi nunca sale no llega a reforzarse. Es como quien encuentra un restaurante que le gusta y ya no prueba ningún otro. Nunca sabrá si había uno mejor a dos calles.
- Depende de que el modelo ya tenga el conocimiento necesario (las features) para resolver el problema. Con recompensas de acierto o fallo a secas, no vamos a resolver un problema para el que el modelo no esté mínimamente preparado. No es un límite del RL como tal, sino de cómo lo usamos. Con el mismo entrenamiento, un modelo que ya trae de serie hábitos como comprobar sus cálculos o dar marcha atrás mejora mucho, y otro que no los trae apenas se mueve (Gandhi et al., 2025). En experimentos controlados, el RL solo amplía de verdad lo que el modelo resuelve cuando se entrena en el borde de su competencia (Zhang et al., 2025). Son problemas difíciles pero no fuera de su alcance, que el modelo todavía resuelve de vez en cuando. En ese estudio, por ejemplo, son problemas algo más largos que los del preentrenamiento, que el modelo base aún acierta en alguno de 128 intentos.
- Las soluciones pueden aportar poco y ser larguísimas. Aunque el modelo resuelva problemas muy difíciles, sus razonamientos pueden ser tan largos que resulten ininteligibles. R1-Zero mezclaba idiomas y costaba leerlo (DeepSeek-AI, 2025), y optimizar solo el acierto hace que las soluciones sean más difíciles de comprobar para una persona (Kirchner et al., 2024). Además, estos modelos piensan de más incluso ante problemas triviales, como sumar 2 + 3 (Chen et al., 2024). Es la consecuencia de llevar el cómputo en inferencia al límite.
Para entender de dónde salen estos límites me ayuda volver al Lego. El preentrenamiento llena la caja de piezas, que son hechos, operaciones y maneras de razonar. La cadena de pensamiento permite montarlas de una en una, y el RL es la práctica que hace que el montaje salga bien más a menudo. Pero si falta una pieza en la caja, no hay práctica que valga (figura 4).
Los dos primeros efectos se ven con claridad en otro juguete (figuras 5 y 6). Imagina doscientos problemas y, para cada uno, la probabilidad de que el modelo lo acierte en un intento. GRPO intenta cada problema veces, da a cada intento una recompensa (1 si acierta y 0 si falla) y lo compara con la media de su grupo. Esa comparación es la ventaja del intento,
y el modelo sube la probabilidad de los intentos con ventaja positiva y baja la de los que la tienen negativa (Shao et al., 2024). El problema está en el numerador. Si todos los intentos aciertan, o todos fallan, cada es igual a la media, así que todas las ventajas valen cero y no hay nada que reforzar (el denominador también vale cero, y en la práctica se le suma un número muy pequeño para no dividir entre cero). El aprendizaje solo ocurre en una banda de dificultad intermedia. De hecho, DAPO descarta directamente los problemas que siempre se aciertan o siempre se fallan, porque no aportan nada (Yu et al., 2025).
El resultado se parece mucho a una votación. Si a un modelo le pides dieciséis respuestas y te quedas con la más repetida (majority vote), aciertas bastante más que con una sola (Wang et al., 2023). El RL consigue algo parecido sin votar. Afila la distribución hacia las respuestas correctas que ya salían a menudo y deja caer las que casi nunca salían. DeepSeekMath lo midió. Tras el RL mejoraba el acierto por votación, pero no la probabilidad de acertar alguna vez en muchos intentos. Según sus autores, el RL vuelve más robusta la distribución de respuestas, pero no mejora las capacidades de fondo (Shao et al., 2024). Redistribuye las respuestas que ya había, pero no crea otras nuevas. Tanto es así que, sin entrenar nada, muestreando el modelo base de forma más afilada se iguala al RL en muchas tareas, y sin perder diversidad (Karan y Du, 2025).
Lo segundo se ve con pass@k, la probabilidad de acertar al menos una vez en k intentos. Con k = 1, el modelo entrenado con RL gana con claridad. Pero si se deja que los dos lo intenten cientos de veces, el modelo base acaba resolviendo más problemas (Yue et al., 2025). El RL no amplía lo que el modelo puede resolver. Concentra la probabilidad en lo que ya podía resolver y, por el camino, pierde parte de lo demás. Los mismos autores encuentran que destilar de un modelo mejor sí puede aportar patrones de razonamiento nuevos, algo que el RL, tal como lo usamos hoy, no consigue.
Esta es, para mí, la mejor respuesta que tenemos a la tercera pregunta del principio. Un modelo de razonamiento combina muy bien lo que ya sabe, y eso a veces parece creatividad. El RL sí aprende a encadenar más piezas de las que vio al entrenar. Con composiciones de dos funciones, un modelo pasa de acertar un 5 % a un 30 % de las cadenas de tres que nunca ha visto, cosa que el ajuste supervisado con los mismos datos no consigue (Yuan et al., 2025). Pero es la forma más sencilla de componer, repetir el mismo paso con el resultado anterior, y un modelo preentrenado ha visto muchísimo código con llamadas anidadas. Incluso con un modelo entrenado desde cero, lo que el RL alarga es la profundidad de la cadena, no el tipo de composición (Zhang et al., 2025). Proponer un método nuevo exige, muchas veces, una pieza que no estaba en los datos, o una forma de combinarlas que no es repetir. Esto último ya no es un resultado, sino mi hipótesis.
Aun así, en mi opinión, con estos modelos llegaron los primeros resultados de verdad grandes. Por momentos parecen inteligentes. Pero seguían lejos de funcionar bien en situaciones reales, incluso en los terrenos donde más brillan, como la programación o las matemáticas. Resolver un ejercicio cerrado no es lo mismo que trabajar durante horas en un proyecto de verdad.
El siguiente eje para escalar siguió siendo el RL, pero esta vez dándole al modelo herramientas reales que pudiera usar dentro de un entorno controlado. Los propios Yue et al. (2025) apuntan en esa dirección. Para ir más allá del modelo base, proponen seguir escalando el RL y que el modelo interactúe con un entorno a lo largo de varios turnos.
Entornos de RL y agentes, ¿hacia los world models?
Un entorno de RL es un pequeño mundo con reglas en el que el modelo puede actuar. En cada paso, el modelo, al que ahora llamamos agente, ve el estado (un repositorio de código, una terminal, una página web), decide una acción (leer un fichero, ejecutar un comando, editar una línea) y el entorno le responde con lo que ha pasado. Razonar y actuar se alternan. El agente piensa, actúa, mira el resultado y vuelve a pensar (Yao et al., 2023). Al final del episodio, un verificador decide si la tarea está resuelta, por ejemplo ejecutando unos tests. Si pasan, la recompensa es 1, y si no, 0. El entrenamiento es el mismo RL de antes, pero a lo grande, con miles de episodios, cada uno con decenas o cientos de acciones, en los que se refuerzan las trayectorias que acaban bien. Para programación hay, por ejemplo, entornos construidos a partir de issues reales de GitHub. El agente tiene que arreglar el fallo y los tests del propio proyecto hacen de verificador (Jimenez et al., 2024 · Pan et al., 2025).
Aquí aparece la idea de los world models, un modelo interno de cómo funciona el mundo que permite prever qué pasará al hacer algo sin necesidad de hacerlo (Ha y Schmidhuber, 2018). Mi intuición es que darle acciones a un modelo le empuja a construir uno, y hay trabajos que apuntan en esa dirección. Para predecir qué devolverá un comando, el agente necesita saber en qué estado está el sistema, y ese estado cambia con cada cosa que hace. Meta lo está probando a lo grande. Entrenó un modelo de 32.000 millones de parámetros con trayectorias de observación y acción de un intérprete de Python y de entornos Docker, precisamente para que aprendiera un modelo del mundo del código (FAIR CodeGen team, 2025). Con imágenes y vídeo pasa algo parecido (Bruce et al., 2024 · Assran et al., 2025 · Hafner et al., 2025). Y algo así ocurre también dentro de los modelos de lenguaje. Un transformer entrenado solo para predecir jugadas legales de Othello acaba representando por dentro el estado del tablero, sin que nadie se lo haya enseñado (Li et al., 2023). Pero también hay motivos para la cautela. Modelos que dan indicaciones casi perfectas para moverse por Nueva York tienen por dentro un mapa incoherente, y fallan en cuanto la tarea cambia un poco, por ejemplo con un desvío (Vafa et al., 2024). En conducción pasa algo parecido. DriveBench examina a doce modelos de visión y lenguaje con más de 20.000 preguntas sobre escenas de tráfico reales, y descubre que a menudo responden de forma convincente aunque la imagen esté degradada o ni siquiera esté, tirando de conocimiento general y de pistas del texto en lugar de mirar la escena (Xie et al., 2025). Acertar la siguiente acción no garantiza entender el mundo.
Y se está escalando en todas las direcciones, con agentes de programación que trabajan durante horas en repositorios reales, agentes que navegan por la web, modelos que generan en tiempo real mundos 3D interactivos donde entrenar a otros agentes (Parker-Holder y Fruchter, 2025) o modelos del mundo para la conducción, que generan escenas de tráfico realistas con las que entrenar y poner a prueba coches autónomos (Hu et al., 2023). La apuesta de fondo la resumen Silver y Sutton (2025). Después de la era de los datos humanos vendría la «era de la experiencia», en la que los agentes aprenderían sobre todo de lo que hacen, y no de lo que hemos escrito nosotros. Aun así, aprender de la experiencia no libra a los agentes de lo anterior. Solo se puede reforzar lo que el agente ya consigue alguna vez, y eso depende en buena parte de las competencias que trae del preentrenamiento.
Los problemas
Los problemas son los del RL, y alguno más. El primero es el reward hacking, que es cuando el agente encuentra la manera de cobrar la recompensa sin hacer la tarea (Skalse et al., 2022). En los entornos de programación no es un riesgo teórico. Se ha observado en modelos de razonamiento punteros como o3-mini, que en lugar de arreglar el código buscaban la manera de que las comprobaciones dieran el visto bueno (Baker et al., 2025). Es la trayectoria tramposa de la figura 7.
El segundo es la asignación de mérito (credit assignment). La recompensa llega al final, después de decenas de acciones, y no dice cuáles contribuyeron al éxito y cuáles sobraban. Recompensar cada paso ayudaría, porque supervisar el proceso funciona mejor que supervisar solo el resultado (Lightman et al., 2024), pero exige saber qué es un buen paso. Es tan difícil que el equipo de DeepSeek lo intentó y lo descartó para R1. No había una manera clara de definir un paso ni de saber si era correcto, y el modelo acababa aprendiendo a engañar al evaluador (DeepSeek-AI, 2025). Hay una tercera vía, que es probar. Desde cada paso intermedio se lanzan varias continuaciones y se mide cuántas acaban bien, y el mérito de un paso es cuánto sube esa proporción (Kazemnejad et al., 2024). No hace falta un juez de pasos, solo el verificador final y mucho más cómputo. La figura 8 lo cuenta con una jugada de fútbol.
El tercero es que dependemos de entornos verificables. Solo podemos entrenar así lo que se puede comprobar automáticamente, como un test que pasa, una respuesta numérica o una partida ganada. Parece un detalle técnico, pero decide hacia dónde avanza la IA. Los modelos mejoran muy deprisa justo donde hay comprobaciones baratas, como las matemáticas, la programación o los juegos, y mucho más despacio donde no las hay, como escribir bien, investigar o negociar. El resultado es una inteligencia muy desigual, brillante en unas tareas y torpe en otras que a nosotros nos parecen igual de difíciles. Además, cuando la comprobación no captura del todo lo que queremos, el modelo aprende a satisfacer la comprobación y no el objetivo, que es otra forma de reward hacking. Por eso construir buenos verificadores y buenos entornos se ha vuelto uno de los trabajos más importantes del campo.
En mi opinión, estos dos últimos problemas son el mismo visto desde dos lados. Si supiéramos verificar cada paso intermedio, tendríamos recompensas parciales. Como solo sabemos verificar el resultado final, y solo en algunas tareas, nos quedamos con recompensas escasas, o con pagar en cómputo lo que no sabemos verificar, y con tareas cuyo resultado se puede comprobar. Justo lo contrario de lo que hace falta para proponer ideas nuevas, que no vienen con un test para comprobarlas.
Lo que queda abierto
Si tuviera que resumir el camino en una frase, diría que primero enseñamos a los modelos a saber (el preentrenamiento), después a encadenar lo que saben (la CoT y el RL) y ahora intentamos que aprendan actuando (los entornos). Cada salto resolvió el problema del anterior y dejó al descubierto uno nuevo. El que tenemos delante, cómo recompensar lo que no se puede verificar, es para mí el que separa a un modelo que resuelve problemas de uno que propone ideas.
Lo desarrollaré en la próxima entrada, Lo que el post-training no enseña, porque creo que todo lo anterior cabe en una desigualdad. Si el modelo intenta cada problema veces y solo aprende cuando alguno de esos intentos acierta, solo puede entrenarse con lo que ya acierta, más o menos, una vez de cada , es decir, . Por debajo no hay nada que reforzar (es el borde izquierdo de la zona de aprendizaje de la figura 5), y el problema, en lugar de aprenderse, se pierde (Zhou, 2026). Casi todo lo que hoy consigue ir más allá del modelo base es, en el fondo, una manera de saltarse esa desigualdad. O se sube , que cuesta dinero (Hu et al., 2025), o se sube sin pagarlo en intentos, por ejemplo con un profesor que da pistas en el borde de lo que el modelo sabe hacer (Cai et al., 2026), con una recompensa parcial que premia pasar algunos tests antes de exigirlos todos (Sun et al., 2025) o con un mid-training que prepara al modelo antes del RL (Zhang et al., 2025). Y lo aprendido dentro de la banda puede llegar algo más lejos. Un modelo preentrenado desde cero con problemas de hasta 10 operaciones, al que se aplica RL con problemas de 11 a 14, mejora también con los de 15 a 20, donde antes no acertaba casi nunca (Zhang et al., 2025). Más lejos, sí. Distinto, todavía no.
Vista así, la demostración de Navier–Stokes no contradice nada de lo que he contado. Es esa misma cuenta llevada al extremo. AlphaEvolve ya lo había mostrado a menor escala. Un LLM que propone cambios en un programa, evaluadores automáticos y búsqueda evolutiva encontraron cómo multiplicar dos matrices complejas de 4 × 4 con 48 multiplicaciones, la primera mejora en 56 años sobre el algoritmo de Strassen en ese caso (Novikov et al., 2025). En Navier–Stokes hubo diez mil agentes en paralelo, un resultado que se puede comprobar mecánicamente y, si Buckmaster tiene razón, una línea de ataque que ya existía en trabajo humano. Si tengo razón, la creatividad de las máquinas no se va a decidir en el algoritmo de RL, sino en dos sitios mucho menos glamurosos, cuánto podemos pagar por cada intento y qué sabemos verificar. Y casi nada de lo que llamamos una buena idea viene con un verificador.
Este artículo se escribió originalmente en español, con la asistencia de modelos de IA (Claude Opus 5.5, de Anthropic).
Las figuras de esta entrada son modelos de juguete. Sus números sirven para ver el mecanismo y no reproducen ningún experimento. ↩︎
Referencias
- Akgül, Ö. F., Kannan, R., Neiswanger, W. y Prasanna, V. (2026). Rethinking RL for LLM Reasoning: It’s Sparse Policy Selection, Not Capability Learning. arXiv:2605.06241. https://arxiv.org/abs/2605.06241
- Assran, M., Bardes, A., Fan, D., Garrido, Q., Howes, R. et al. (2025). V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning. arXiv:2506.09985. https://arxiv.org/abs/2506.09985
- Bachmann, G. y Nagarajan, V. (2024). The Pitfalls of Next-Token Prediction. En International Conference on Machine Learning. https://arxiv.org/abs/2403.06963
- Baker, B., Huizinga, J., Gao, L., Dou, Z., Guan, M. Y., Madry, A. et al. (2025). Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation. arXiv:2503.11926. https://arxiv.org/abs/2503.11926
- Balesni, M., Korbak, T. y Evans, O. (2024). Lessons from Studying Two-Hop Latent Reasoning. arXiv:2411.16353. https://arxiv.org/abs/2411.16353
- Brown, T. B., Mann, B., Ryder, N., Subbiah, M., Kaplan, J., Dhariwal, P. et al. (2020). Language Models are Few-Shot Learners. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2005.14165
- Bruce, J., Dennis, M., Edwards, A., Parker-Holder, J., Shi, Y., Hughes, E. et al. (2024). Genie: Generative Interactive Environments. arXiv:2402.15391. https://arxiv.org/abs/2402.15391
- Cai, P., Fang, T., Li, X., Zeng, Q., Li, G. y Chen, J. (2026). Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model. arXiv:2606.22317. https://arxiv.org/abs/2606.22317
- Chen, X., Xu, J., Liang, T., He, Z., Pang, J., Yu, D. et al. (2024). Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs. arXiv:2412.21187. https://arxiv.org/abs/2412.21187
- Chen, Y., Benton, J., Radhakrishnan, A., Uesato, J., Denison, C., Schulman, J. et al. (2025). Reasoning Models Don’t Always Say What They Think. arXiv:2505.05410. https://arxiv.org/abs/2505.05410
- Cui, G., Zhang, Y., Chen, J., Yuan, L., Wang, Z., Zuo, Y. et al. (2025). The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models. arXiv:2505.22617. https://arxiv.org/abs/2505.22617
- DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. Nature, 645, 633–638. https://arxiv.org/abs/2501.12948
- Dziri, N., Lu, X., Sclar, M., Li, X. L., Jiang, L., Lin, B. Y. et al. (2023). Faith and Fate: Limits of Transformers on Compositionality. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2305.18654
- FAIR CodeGen team (2025). CWM: An Open-Weights LLM for Research on Code Generation with World Models. arXiv:2510.02387. https://arxiv.org/abs/2510.02387
- Feng, G., Zhang, B., Gu, Y., Ye, H., He, D. y Wang, L. (2023). Towards Revealing the Mystery behind Chain of Thought: A Theoretical Perspective. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2305.15408
- Gandhi, K., Chakravarthy, A., Singh, A., Lile, N. y Goodman, N. D. (2025). Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs. arXiv:2503.01307. https://arxiv.org/abs/2503.01307
- Gekhman, Z., Yona, G., Aharoni, R., Eyal, M., Feder, A., Reichart, R. y Herzig, J. (2024). Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations? En Proceedings of the Conference on Empirical Methods in Natural Language Processing. https://arxiv.org/abs/2405.05904
- Gunjal, A., Wang, A., Lau, E., Nath, V., He, Y., Liu, B. et al. (2025). Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains. arXiv:2507.17746. https://arxiv.org/abs/2507.17746
- Ha, D. y Schmidhuber, J. (2018). World Models. arXiv:1803.10122. https://arxiv.org/abs/1803.10122
- Hafner, D., Yan, W. y Lillicrap, T. (2025). Training Agents Inside of Scalable World Models. arXiv:2509.24527. https://arxiv.org/abs/2509.24527
- Hu, A., Russell, L., Yeo, H., Murez, Z., Fedoseev, G., Kendall, A. et al. (2023). GAIA-1: A Generative World Model for Autonomous Driving. arXiv:2309.17080. https://arxiv.org/abs/2309.17080
- Hu, J., Liu, M., Lu, X., Wu, F., Harchaoui, Z. y Diao, S. (2025). BroRL: Scaling Reinforcement Learning via Broadened Exploration. arXiv:2510.01180. https://arxiv.org/abs/2510.01180
- Jimenez, C. E., Yang, J., Wettig, A., Yao, S., Pei, K., Press, O. y Narasimhan, K. (2024). SWE-bench: Can Language Models Resolve Real-World GitHub Issues? En International Conference on Learning Representations. https://arxiv.org/abs/2310.06770
- Kalai, A. T., Nachum, O., Vempala, S. S. y Zhang, E. (2025). Why Language Models Hallucinate. arXiv:2509.04664. https://arxiv.org/abs/2509.04664
- Karan, A. y Du, Y. (2025). Reasoning with Sampling: Your Base Model is Smarter Than You Think. arXiv:2510.14901. https://arxiv.org/abs/2510.14901
- Kazemnejad, A., Aghajohari, M., Portelance, E., Sordoni, A., Reddy, S., Courville, A. et al. (2024). VinePPO: Refining Credit Assignment in RL Training of LLMs. arXiv:2410.01679. https://arxiv.org/abs/2410.01679
- Kirchner, J. H., Chen, Y., Edwards, H., Leike, J., McAleese, N. y Burda, Y. (2024). Prover-Verifier Games improve legibility of LLM outputs. arXiv:2407.13692. https://arxiv.org/abs/2407.13692
- Kojima, T., Gu, S. S., Reid, M., Matsuo, Y. y Iwasawa, Y. (2022). Large Language Models are Zero-Shot Reasoners. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2205.11916
- Lambert, N., Morrison, J., Pyatkin, V., Huang, S., Ivison, H., Brahman, F. et al. (2024). Tülu 3: Pushing Frontiers in Open Language Model Post-Training. arXiv:2411.15124. https://arxiv.org/abs/2411.15124
- Li, K., Hopkins, A. K., Bau, D., Viégas, F., Pfister, H. y Wattenberg, M. (2023). Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task. En International Conference on Learning Representations. https://arxiv.org/abs/2210.13382
- Lightman, H., Kosaraju, V., Burda, Y., Edwards, H., Baker, B., Lee, T. et al. (2024). Let’s Verify Step by Step. En International Conference on Learning Representations. https://arxiv.org/abs/2305.20050
- Liu, M., Diao, S., Lu, X., Hu, J., Dong, X., Choi, Y. et al. (2025). ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models. arXiv:2505.24864. https://arxiv.org/abs/2505.24864
- Luong, T. y Lockhart, E. (2025). Advanced version of Gemini with Deep Think officially achieves gold-medal standard at the International Mathematical Olympiad. Google DeepMind (blog). https://deepmind.google/discover/blog/advanced-version-of-gemini-with-deep-think-officially-achieves-gold-medal-standard-at-the-international-mathematical-olympiad/
- Novikov, A., Vũ, N., Eisenberger, M., Dupont, E., Huang, P.-S., Wagner, A. Z. et al. (2025). AlphaEvolve: A coding agent for scientific and algorithmic discovery. arXiv:2506.13131. https://arxiv.org/abs/2506.13131
- Nye, M., Andreassen, A. J., Gur-Ari, G., Michalewski, H., Austin, J., Bieber, D. et al. (2021). Show Your Work: Scratchpads for Intermediate Computation with Language Models. arXiv:2112.00114. https://arxiv.org/abs/2112.00114
- OpenAI (2024). Learning to Reason with LLMs. OpenAI (blog). https://openai.com/index/learning-to-reason-with-llms/
- OpenAI (2026b). NavierStokesAndEuler: Lean certificates accompanying Navier–Stokes and Euler results. GitHub. https://github.com/openai/NavierStokesAndEuler
- Ouyang, L., Wu, J., Jiang, X., Almeida, D., Wainwright, C. L., Mishkin, P. et al. (2022). Training language models to follow instructions with human feedback. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2203.02155
- Pan, J., Wang, X., Neubig, G., Jaitly, N., Ji, H., Suhr, A. y Zhang, Y. (2025). Training Software Engineering Agents and Verifiers with SWE-Gym. En International Conference on Machine Learning. https://arxiv.org/abs/2412.21139
- Parker-Holder, J. y Fruchter, S. (2025). Genie 3: A new frontier for world models. Google DeepMind (blog). https://deepmind.google/discover/blog/genie-3-a-new-frontier-for-world-models/
- Press, O., Zhang, M., Min, S., Schmidt, L., Smith, N. A. y Lewis, M. (2022). Measuring and Narrowing the Compositionality Gap in Language Models. arXiv:2210.03350. https://arxiv.org/abs/2210.03350
- Prystawski, B., Li, M. Y. y Goodman, N. D. (2023). Why think step by step? Reasoning emerges from the locality of experience. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2304.03843
- Radford, A., Wu, J., Child, R., Luan, D., Amodei, D. y Sutskever, I. (2019). Language Models are Unsupervised Multitask Learners. OpenAI. https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf
- Shao, Z., Wang, P., Zhu, Q., Xu, R., Song, J., Bi, X. et al. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv:2402.03300. https://arxiv.org/abs/2402.03300
- Si, C., Yang, D. y Hashimoto, T. (2024). Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers. arXiv:2409.04109. https://arxiv.org/abs/2409.04109
- Si, C., Hashimoto, T. y Yang, D. (2025). The Ideation-Execution Gap: Execution Outcomes of LLM-Generated versus Human Research Ideas. arXiv:2506.20803. https://arxiv.org/abs/2506.20803
- Silver, D. y Sutton, R. S. (2025). Welcome to the Era of Experience. Preprint, capítulo de «Designing an Intelligence» (MIT Press). https://storage.googleapis.com/deepmind-media/Era-of-Experience%20/The%20Era%20of%20Experience%20Paper.pdf
- Skalse, J., Howe, N. H. R., Krasheninnikov, D. y Krueger, D. (2022). Defining and Characterizing Reward Hacking. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2209.13085
- Snell, C., Lee, J., Xu, K. y Kumar, A. (2025). Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. En International Conference on Learning Representations. https://arxiv.org/abs/2408.03314
- Sun, Y., Cao, Y., Huang, P., Bai, H., Hajishirzi, H., Dziri, N. y Song, D. (2025). RL Grokking Recipe: How Does RL Unlock and Transfer New Algorithms in LLMs? arXiv:2509.21016. https://arxiv.org/abs/2509.21016
- Vafa, K., Chen, J. Y., Rambachan, A., Kleinberg, J. y Mullainathan, S. (2024). Evaluating the World Model Implicit in a Generative Model. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2406.03689
- Wang, X., Wei, J., Schuurmans, D., Le, Q., Chi, E., Narang, S. et al. (2023). Self-Consistency Improves Chain of Thought Reasoning in Language Models. En International Conference on Learning Representations. https://arxiv.org/abs/2203.11171
- Wei, J., Wang, X., Schuurmans, D., Bosma, M., Ichter, B., Xia, F. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2201.11903
- Wu, F., Xuan, W., Lu, X., Liu, M., Dong, Y., Harchaoui, Z. y Choi, Y. (2025). The Invisible Leash: Why RLVR May or May Not Escape Its Origin. arXiv:2507.14843. https://arxiv.org/abs/2507.14843
- Xie, S., Kong, L., Dong, Y., Sima, C., Zhang, W., Chen, Q. A. et al. (2025). Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives. En International Conference on Computer Vision. https://arxiv.org/abs/2501.04003
- Yang, C., Zhang, X. y Chen, J. (2026). RLVR is a Kernel, Not a Function: Statistical Inference for pass@ Crossovers. arXiv:2609.22547. https://arxiv.org/abs/2609.22547
- Yao, S., Zhao, J., Yu, D., Du, N., Shafran, I., Narasimhan, K. y Cao, Y. (2023). ReAct: Synergizing Reasoning and Acting in Language Models. En International Conference on Learning Representations. https://arxiv.org/abs/2210.03629
- Yu, Q., Zhang, Z., Zhu, R., Yuan, Y., Zuo, X., Yue, Y. et al. (2025). DAPO: An Open-Source LLM Reinforcement Learning System at Scale. arXiv:2503.14476. https://arxiv.org/abs/2503.14476
- Yuan, L., Chen, W., Zhang, Y., Cui, G., Wang, H., You, Z. et al. (2025). From and to : LLMs Learn New Skills in RL by Composing Old Ones. arXiv:2509.25123. https://arxiv.org/abs/2509.25123
- Yue, Y., Chen, Z., Lu, R., Zhao, A., Wang, Z., Yue, Y. et al. (2025). Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model? En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2504.13837
- Zelikman, E., Wu, Y., Mu, J. y Goodman, N. D. (2022). STaR: Bootstrapping Reasoning With Reasoning. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2203.14465
- Zhang, C., Neubig, G. y Yue, X. (2025). On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models. arXiv:2512.07783. https://arxiv.org/abs/2512.07783
- Zhao, X., Kang, Z., Feng, A., Levine, S. y Song, D. (2025). Learning to Reason without External Rewards. arXiv:2505.19590. https://arxiv.org/abs/2505.19590
- Zhou, C., Liu, P., Xu, P., Iyer, S., Sun, J., Mao, Y. et al. (2023). LIMA: Less Is More for Alignment. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2305.11206
- Zhou, T. (2026). When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion. arXiv:2607.20543. https://arxiv.org/abs/2607.20543
- Zuo, Y., Zhang, K., Sheng, L., Qu, S., Cui, G., Zhu, X. et al. (2025). TTRL: Test-Time Reinforcement Learning. arXiv:2504.16084. https://arxiv.org/abs/2504.16084