---
title: "El camino de las IA hacia la «inteligencia»"
description: "Del modelo que predice la siguiente palabra al agente que actúa en un entorno. Qué resolvió cada salto y qué dejó sin resolver."
url: https://latent-universe.pages.dev/el-camino-de-las-ias-hacia-la-inteligencia/
date: 2026-09-26
lang: es
translations:
  eu: https://latent-universe.pages.dev/eu/el-camino-de-las-ias-hacia-la-inteligencia/
  en: https://latent-universe.pages.dev/en/el-camino-de-las-ias-hacia-la-inteligencia/
---

# El camino de las IA hacia la «inteligencia»

*Del modelo que predice la siguiente palabra al agente que actúa en un entorno. Qué resolvió cada salto y qué dejó sin resolver.*

## TLDR

En este artículo propongo una forma de leer cómo han avanzado los modelos de lenguaje grandes (LLM, por sus siglas en inglés) en los últimos años, a partir de tres preguntas.

-   **¿Por qué los primeros LLM, los de antes de los modelos de razonamiento de 2024, parecían tan «tontos»?** Porque aprendieron de un internet lleno de resultados y casi vacío de procesos, y tenían que dar cada respuesta de golpe, sin ir paso a paso.
-   **¿Qué cambió con el razonamiento?** La cadena de pensamiento les dejó resolver los problemas pieza por pieza, y el aprendizaje por refuerzo les enseñó a hacerlo por su cuenta y a pensar más cuando hace falta.
-   **¿Por qué los modelos de razonamiento actuales no son capaces de proponer métodos o ideas nuevas?** Mi hipótesis es que el refuerzo solo afina lo que el modelo ya consigue alguna vez, y que casi ninguna idea nueva viene con una forma automática de comprobarla.

Para las dos primeras me apoyo en artículos de los últimos años. La tercera todavía no tiene una respuesta establecida, así que ahí paso al terreno hipotético.

## Los primeros LLM predecían la siguiente palabra

Un modelo de lenguaje hace una sola cosa. Dado un texto, reparte la probabilidad entre todas las formas posibles de continuarlo, elige el siguiente *token* (un trozo de palabra), lo añade y vuelve a empezar. Es la predicción del siguiente token (*next-token prediction*, NTP), y el entrenamiento consiste justo en eso, repetido con cientos de miles de millones de tokens de internet, libros y código. GPT-2 y, sobre todo, GPT-3 mostraron que, con suficientes datos y parámetros, esta tarea tan simple da para mucho. Traducían, resumían o respondían preguntas sin que nadie los hubiera entrenado para ninguna de esas tareas (Radford et al., 2019 · Brown et al., 2020).

Los ChatGPT de 2022 y 2023 se entrenaban un poco más para que sus respuestas agradasen a las personas, a partir de ejemplos de qué respuestas preferían (Ouyang et al., 2022). Ese ajuste los hizo mucho más útiles, pero aquí lo dejo de lado, porque no creo que sea una pieza clave del camino hacia la inteligencia. En el fondo, seguían siendo máquinas de continuar texto.

Dos problemas aparecían una y otra vez. El primero eran las alucinaciones, respuestas falsas dichas con total seguridad, como una cita que no existe o una fecha inventada. No son un fallo raro, sino la consecuencia natural de cómo se entrenan y se evalúan estos modelos. Igual que en un examen tipo test que no penaliza los errores, arriesgar una respuesta sale más a cuenta que admitir que no se sabe (Kalai et al., 2025). El segundo eran los problemas de varios pasos, como una multiplicación larga, un acertijo lógico o un plan. Los modelos acertaban los casos fáciles y se hundían en cuanto había que encadenar muchos pasos (Dziri et al., 2023). La figura 1 lo muestra con tres ejemplos.[^1]

> **Figura 1.** Predicción del siguiente token en tres casos. Pulsa «Siguiente token» o elige tú una de las barras. En «Un dato», el modelo no puede saber la respuesta, pero decir «no lo sé» es casi imposible. En «Una cuenta», tiene que escribir el resultado dígito a dígito sin haber hecho la multiplicación. *(figura interactiva, en la web: https://latent-universe.pages.dev/el-camino-de-las-ias-hacia-la-inteligencia/#el-camino-de-las-ias-hacia-la-inteligencia-fig-1)*

Hay una razón de fondo para lo segundo. Internet está lleno de resultados y casi vacío de procesos. Se publica la solución del problema y no los veinte borradores, el artículo terminado y no las semanas de callejones sin salida, «37 × 48 = 1776» y no la multiplicación en columna. A las personas nos pasa algo parecido. Cuando ya dominamos un proceso, lo interiorizamos y dejamos de escribirlo, porque ya no lo necesitamos. Un niño, en cambio, necesita verlo todo desglosado para aprender a multiplicar. Un LLM que aprende de lo que escribimos los adultos se encuentra con los resultados, pero casi nunca con el desglose.

Ante «37 × 48» caben dos maneras de acertar. La primera es haber visto esa cuenta tantas veces que el resultado se sabe de memoria. La segunda es haber aprendido cómo se multiplica y aplicarlo a cualquier par de números. Queremos la segunda, porque es la única que generaliza, y la segunda obliga a encadenar competencias más pequeñas, como multiplicar una cifra por otra, llevarse una o sumar en columna. Es como construir con piezas de Lego, que se colocan de una en una. El problema es que, para escribir cada token, el modelo hace una sola pasada por la red, con un número fijo de capas. Si la cadena de piezas es más larga de lo que cabe en esa pasada, no puede montarla de golpe, y solo le queda adivinar o tirar de memoria.

> En concreto, Feng et al. (2023) demuestran que, bajo supuestos habituales de teoría de la complejidad, un transformer de profundidad fija no puede dar directamente la respuesta a problemas aritméticos básicos, salvo que su tamaño crezca de forma desmesurada con la longitud del problema. Y hay tareas de planificación sencillas en las que el entrenamiento con NTP aprende un atajo que imita bien los datos, pero no aprende a planificar (Bachmann y Nagarajan, 2024).

No es solo una intuición. Hay resultados teóricos que lo demuestran (Feng et al., 2023), y en la práctica pasaba justo eso. GPT-3 sumaba sin fallos números de dos cifras, pero con cinco cifras acertaba menos del 10 % de las veces (Brown et al., 2020). Y que un modelo acierte muchos ejemplos no quiere decir que haya aprendido el procedimiento. Los transformers tienden a resolver estos problemas reconociendo trozos de cálculos que ya han visto, no con un método sistemático, y por eso el acierto se desploma a medida que el problema crece (Dziri et al., 2023).

Imagina aprender matemáticas solo con el solucionario, cientos de enunciados, cada uno con su resultado y ni un solo desarrollo. Con el tiempo reconocerías patrones («si el enunciado habla de porcentajes, el resultado suele ser redondo») y acertarías bastantes ejercicios parecidos a los que ya has visto. Pero ante uno nuevo solo podrías tirar de intuición y, cuando la intuición fallase, no tendrías manera de darte cuenta, porque nunca aprendiste a comprobar nada. Así es un LLM entrenado solo con NTP, un estudiante brillante que se ha aprendido el solucionario de memoria. Tiene una intuición excelente, pero es solo intuición.

> Los autores de LIMA lo llaman la **hipótesis del alineamiento superficial**. El conocimiento y las capacidades de un modelo se aprenden casi por completo en el preentrenamiento, y el ajuste posterior solo le enseña qué formato usar al responder.

Ahora bien, el solucionario enseña mucho. Casi todo lo que sabe un modelo lo aprende en el preentrenamiento, y las fases posteriores sirven sobre todo para sacarlo a la luz. Me gusta pensarlo con dos palabras, alcance y control. El preentrenamiento da el alcance, es decir, lo que el modelo puede llegar a resolver. El posentrenamiento da el control, que es saber cuándo seguir trabajando en un problema y cuándo parar. LIMA lo mostró con un experimento muy limpio. Bastaron mil ejemplos bien elegidos para ajustar un modelo preentrenado, sin aprendizaje por refuerzo ni preferencias humanas, y sus respuestas resultaron iguales o mejores que las de GPT-4 en el 43 % de los casos (Zhou et al., 2023). Y en sentido contrario, cuando se intenta enseñarle hechos nuevos durante el ajuste, el modelo los aprende mucho más despacio que los que ya conocía y, cuando por fin los aprende, alucina más (Gekhman et al., 2024).

El conocimiento, por tanto, está ahí desde el preentrenamiento. Lo que falta es una manera de usarlo en problemas que necesitan muchos pasos. Y si hacen falta muchos pasos, la solución parece obvia. Hay que dejar que el modelo los dé de uno en uno, por escrito.

## La cadena de pensamiento y el posentrenamiento

> Hubo un precedente. En 2021, un modelo entrenado para escribir sus cálculos intermedios en un «borrador» ya aprendía a hacer sumas largas y a ejecutar programas (Nye et al., 2021).

Después llegó el «razonamiento». En 2022, un equipo de Google Brain, con Jason Wei como primer autor y Denny Zhou al frente, publicó el artículo que dio nombre a la *chain of thought* (CoT), la cadena de pensamiento (Wei et al., 2022). La idea es muy simple y muy potente. Si en lugar de pedirle la respuesta directamente se le muestran al modelo unos pocos ejemplos resueltos paso a paso, el modelo también resuelve paso a paso, y acierta mucho más. Poco después se vio que ni siquiera hacían falta los ejemplos. Bastaba con añadir «Pensemos paso a paso» a la pregunta para que un modelo de OpenAI pasase del 17,7 % al 78,7 % de aciertos en un conjunto de problemas aritméticos (Kojima et al., 2022). A partir de ahí empezamos a enseñar a los modelos a encarar los problemas poco a poco (figura 2).

> **Figura 2.** El ejemplo de la figura 1 de Wei et al. (2022), traducido. Cada token que escribe el modelo es una pasada por la red, con las mismas capas. Paso a paso, el modelo hace muchas más pasadas antes de responder, y cada resultado intermedio queda escrito para las siguientes. *(figura interactiva, en la web: https://latent-universe.pages.dev/el-camino-de-las-ias-hacia-la-inteligencia/#el-camino-de-las-ias-hacia-la-inteligencia-fig-2)*

> Dos trabajos más en la misma línea. Cuando dos datos inventados se le enseñan por separado, el modelo no consigue combinarlos por dentro, sin escribir el paso intermedio (Balesni et al., 2024). Y razonar paso a paso ayuda justamente porque los datos de entrenamiento son locales. El modelo ha visto juntas las piezas vecinas, pero casi nunca los dos extremos de la cadena, y encadenar lo que sí ha visto es más fiable que adivinar el resultado directamente (Prystawski et al., 2023).

Por qué funciona tiene que ver con lo anterior. Cada token escrito es una pasada más por la red, y los resultados intermedios quedan en el texto, donde las pasadas siguientes los pueden leer. Es la otra mitad de ese resultado teórico, porque con una cadena de pensamiento un transformer de tamaño fijo sí puede resolver los problemas que no podía resolver de golpe (Feng et al., 2023). Pero creo que hay algo más. Escribir los pasos obliga al modelo a construir la solución pieza por pieza, desde la base, en lugar de saltar a una respuesta recordada, y hay trabajos que apuntan en esa dirección. Los modelos responden bien a cada subpregunta por separado y aun así fallan la pregunta que las combina, un hueco que no se cierra al hacer el modelo más grande pero sí al pedirle que se haga las subpreguntas en voz alta (Press et al., 2022). Eso sí, la CoT no funcionaba con cualquier modelo. En el artículo original solo mejoraba los resultados a partir de unos 100.000 millones de parámetros, y los modelos pequeños escribían cadenas fluidas pero sin lógica (Wei et al., 2022). Es una pista de que la cadena organiza un conocimiento que ya tiene que estar ahí.

La CoT tiene muchas ventajas y pocos inconvenientes. Es barata, no obliga a cambiar el modelo y deja ver por dónde va el razonamiento, aunque no siempre refleje lo que el modelo calcula por dentro (Chen et al., 2025). Hoy está presente, de una forma u otra, en todos los modelos punteros. Con esta herramienta en la caja podíamos soñar con resolver problemas más complejos, pero faltaba una pieza. ¿Cómo conseguir que los modelos aprendiesen *por sí solos* a resolver problemas con la CoT?

> En 2022, STaR ya generaba razonamientos, se quedaba con los que acertaban y volvía a entrenar al modelo con ellos (Zelikman et al., 2022). Hoy a este tipo de entrenamiento se le llama RL con recompensas verificables, o RLVR (Lambert et al., 2024).

La respuesta fue el aprendizaje por refuerzo (*reinforcement learning*, RL). Ante un problema verificable, el modelo propone varias soluciones, se comprueba cuáles llegan a la respuesta correcta y se ajusta el modelo para que las que han funcionado sean más probables. Es una idea elegante, y no es nueva, pero a partir de 2024 llegó a una escala enorme. OpenAI lo presentó con o1 (OpenAI, 2024) y DeepSeek publicó los detalles con R1 (DeepSeek-AI, 2025), entrenado con GRPO, un algoritmo que compara cada intento con la media de su grupo (Shao et al., 2024). La figura 3 lo reproduce en pequeño.

> **Figura 3.** RL con recompensas verificables, en pequeño. En cada paso, el modelo intenta el problema ocho veces, se comprueba cada intento y se refuerzan las estrategias de los que superan la media del grupo. Entrena varios pasos, y también desde cero más de una vez. El acierto sube, la diversidad se hunde y, a veces, el modelo se queda con la estrategia B aunque la A sea mejor. *(figura interactiva, en la web: https://latent-universe.pages.dev/el-camino-de-las-ias-hacia-la-inteligencia/#el-camino-de-las-ias-hacia-la-inteligencia-fig-3)*

El RL no solo enseñó a los modelos a trabajar de forma más autónoma. También abrió un eje nuevo para escalar. Hasta entonces, mejorar un modelo quería decir hacerlo más grande o darle más datos, y ahora también se le puede dejar pensar más antes de responder. La CoT nos dio la herramienta para escalar en tiempo, y el RL, el método para aprovecharla. Durante el entrenamiento de R1-Zero, las respuestas se alargan solas. Nadie le pide que piense más, pero pensar más da más recompensa (DeepSeek-AI, 2025). Es lo que se conoce como cómputo en inferencia (*test-time compute*), y funciona. A igualdad de cómputo total, un modelo pequeño que piensa más puede superar a uno catorce veces mayor, siempre que el pequeño ya acierte el problema de vez en cuando (Snell et al., 2025).

> Sobre el mérito de Navier–Stokes, Tristan Buckmaster, matemático de la Universidad de Nueva York, sostiene que OpenAI siguió una línea de ataque que él mismo estaba desarrollando, y OpenAI lo niega (Kahn, 2026 · Stan, 2026).

Así empezamos a dedicar cantidades enormes de cómputo a problemas muy difíciles, y en julio de 2025 una versión de Gemini alcanzó oficialmente el nivel de medalla de oro en la Olimpiada Internacional de Matemáticas (Luong y Lockhart, 2025). En septiembre de 2026, OpenAI fue mucho más lejos. Un sistema de unos 10.000 agentes, con un gasto de millones de dólares en cómputo, produjo una demostración de que las ecuaciones de Navier–Stokes en tres dimensiones pueden desarrollar una singularidad en tiempo finito cuando actúa sobre el fluido una fuerza externa suave (OpenAI, 2026a · Kahn, 2026). Es una de las alternativas que admite el enunciado oficial del problema del milenio, así que, si se confirma, sería el primero de esos problemas resuelto con una máquina. La demostración ocupa 166 páginas y viene con una formalización en Lean (OpenAI, 2026b), pero la comunidad todavía la está revisando y hay una disputa abierta sobre el mérito. Cuanto más tiempo (y, por tanto, dinero) le damos a la máquina, *mejor*.

Sin embargo, el cuento no es tan bonito como parece. El RL tiene efectos secundarios.

-   **Hace que el modelo repita lo que ya le ha funcionado.** Las soluciones premiadas se vuelven cada vez más probables y las demás desaparecen, así que la diversidad de respuestas colapsa y el modelo explora cada vez menos (Cui et al., 2025). Pasa porque cada refuerzo hace todavía más probable lo que ya salía a menudo, mientras que lo que casi nunca sale no llega a reforzarse. Es como quien encuentra un restaurante que le gusta y ya no prueba ningún otro. Nunca sabrá si había uno mejor a dos calles.
-   **Depende de que el modelo ya tenga el conocimiento necesario** (las *features*) para resolver el problema. Con recompensas de acierto o fallo a secas, no vamos a resolver un problema para el que el modelo no esté mínimamente preparado. No es un límite del RL como tal, sino de cómo lo usamos. Con el mismo entrenamiento, un modelo que ya trae de serie hábitos como comprobar sus cálculos o dar marcha atrás mejora mucho, y otro que no los trae apenas se mueve (Gandhi et al., 2025). En experimentos controlados, el RL solo amplía de verdad lo que el modelo resuelve cuando se entrena en el borde de su competencia (Zhang et al., 2025). Son problemas difíciles pero no fuera de su alcance, que el modelo todavía resuelve de vez en cuando. En ese estudio, por ejemplo, son problemas algo más largos que los del preentrenamiento, que el modelo base aún acierta en alguno de 128 intentos.
-   **Las soluciones pueden aportar poco y ser larguísimas.** Aunque el modelo resuelva problemas muy difíciles, sus razonamientos pueden ser tan largos que resulten ininteligibles. R1-Zero mezclaba idiomas y costaba leerlo (DeepSeek-AI, 2025), y optimizar solo el acierto hace que las soluciones sean más difíciles de comprobar para una persona (Kirchner et al., 2024). Además, estos modelos piensan de más incluso ante problemas triviales, como sumar 2 + 3 (Chen et al., 2024). Es la consecuencia de llevar el cómputo en inferencia al límite.

Para entender de dónde salen estos límites me ayuda volver al Lego. El preentrenamiento llena la caja de piezas, que son hechos, operaciones y maneras de razonar. La cadena de pensamiento permite montarlas de una en una, y el RL es la práctica que hace que el montaje salga bien más a menudo. Pero si falta una pieza en la caja, no hay práctica que valga (figura 4).

> **Figura 4.** Construir con piezas. Cada pieza colocada es un paso de la cadena de pensamiento, y puede caerse. Sin cadena de pensamiento, hay que colocarlo todo de golpe. La práctica con RL hace que cada pieza se caiga menos, pero ningún ajuste pone en la caja la pieza que le falta a «Algo nuevo». *(figura interactiva, en la web: https://latent-universe.pages.dev/el-camino-de-las-ias-hacia-la-inteligencia/#el-camino-de-las-ias-hacia-la-inteligencia-fig-4)*

Los dos primeros efectos se ven con claridad en otro juguete (figuras 5 y 6). Imagina doscientos problemas y, para cada uno, la probabilidad de que el modelo lo acierte en un intento. GRPO intenta cada problema $G$ veces, da a cada intento $i$ una recompensa $r_i$ (1 si acierta y 0 si falla) y lo compara con la media de su grupo. Esa comparación es la ventaja del intento,

$$
A_i = \frac{r_i - \operatorname{media}(r_1, \dots, r_G)}{\operatorname{desv}(r_1, \dots, r_G)},
$$

y el modelo sube la probabilidad de los intentos con ventaja positiva y baja la de los que la tienen negativa (Shao et al., 2024). El problema está en el numerador. Si todos los intentos aciertan, o todos fallan, cada $r_i$ es igual a la media, así que todas las ventajas valen cero y no hay nada que reforzar (el denominador también vale cero, y en la práctica se le suma un número muy pequeño para no dividir entre cero). El aprendizaje solo ocurre en una banda de dificultad intermedia. De hecho, DAPO descarta directamente los problemas que siempre se aciertan o siempre se fallan, porque no aportan nada (Yu et al., 2025).

> **Figura 5.** Cada punto es un problema, colocado según la probabilidad de que el modelo lo acierte en un intento. La curva es la señal de aprendizaje, la probabilidad de que entre los intentos de un paso haya aciertos y fallos. Al mover los pasos de RL, lo que está dentro de la banda sube hacia el 100 %, y lo que casi nunca se acierta no da señal y se hunde hacia el 0 %. Con más intentos por problema, la banda se ensancha. *(figura interactiva, en la web: https://latent-universe.pages.dev/el-camino-de-las-ias-hacia-la-inteligencia/#el-camino-de-las-ias-hacia-la-inteligencia-fig-5)*

El resultado se parece mucho a una votación. Si a un modelo le pides dieciséis respuestas y te quedas con la más repetida (*majority vote*), aciertas bastante más que con una sola (Wang et al., 2023). El RL consigue algo parecido sin votar. Afila la distribución hacia las respuestas correctas que ya salían a menudo y deja caer las que casi nunca salían. DeepSeekMath lo midió. Tras el RL mejoraba el acierto por votación, pero no la probabilidad de acertar alguna vez en muchos intentos. Según sus autores, el RL vuelve más robusta la distribución de respuestas, pero no mejora las capacidades de fondo (Shao et al., 2024). Redistribuye las respuestas que ya había, pero no crea otras nuevas. Tanto es así que, sin entrenar nada, muestreando el modelo base de forma más afilada se iguala al RL en muchas tareas, y sin perder diversidad (Karan y Du, 2025).

> No hay consenso del todo. Con entrenamientos de RL mucho más largos y tareas más variadas, ProRL encuentra problemas que el modelo base no resolvía ni con 256 intentos. Aun así, esas mejoras dependen de lo competente que ya fuera el modelo base en cada tarea (Liu et al., 2025).

Lo segundo se ve con *pass@k*, la probabilidad de acertar al menos una vez en *k* intentos. Con *k* = 1, el modelo entrenado con RL gana con claridad. Pero si se deja que los dos lo intenten cientos de veces, el modelo base acaba resolviendo más problemas (Yue et al., 2025). El RL no amplía lo que el modelo puede resolver. Concentra la probabilidad en lo que ya podía resolver y, por el camino, pierde parte de lo demás. Los mismos autores encuentran que destilar de un modelo mejor sí puede aportar patrones de razonamiento nuevos, algo que el RL, tal como lo usamos hoy, no consigue.

> **Figura 6.** pass@k del modelo base y del entrenado con RL, con los mismos doscientos problemas de la figura 5. Pasa el puntero por el gráfico para leer los valores. La forma de las curvas es la que miden Yue et al. (2025) en modelos reales, pero los números no. *(figura interactiva, en la web: https://latent-universe.pages.dev/el-camino-de-las-ias-hacia-la-inteligencia/#el-camino-de-las-ias-hacia-la-inteligencia-fig-6)*

> Ojo con el juguete. Supone que lo que el RL hace con un problema depende solo de su probabilidad de acierto inicial, y no es así. Además, muchos de los cruces de pass@k publicados no son estadísticamente sólidos (Yang et al., 2026).

> Sobre esta hipótesis hay trabajos en las dos direcciones. A favor, el RL de hoy se queda dentro de lo que el modelo base ya podía generar (Wu et al., 2025), y casi todo su efecto se concentra en unas pocas decisiones en las que el modelo dudaba entre opciones que ya conocía (Akgül et al., 2026). En contra, con entrenamientos largos, pistas de un profesor o recompensas parciales, el RL resuelve problemas que el modelo base no resolvía (Liu et al., 2025 · Cai et al., 2026 · Sun et al., 2025). Y sobre las ideas en sí, más de cien investigadores juzgaron más novedosas las ideas de investigación de un LLM que las de expertos humanos (Si et al., 2024), pero al llevarlas a la práctica perdieron mucho más valor que las humanas (Si et al., 2025).

Esta es, para mí, la mejor respuesta que tenemos a la tercera pregunta del principio. Un modelo de razonamiento combina muy bien lo que ya sabe, y eso a veces parece creatividad. El RL sí aprende a encadenar más piezas de las que vio al entrenar. Con composiciones de dos funciones, un modelo pasa de acertar un 5 % a un 30 % de las cadenas de tres que nunca ha visto, cosa que el ajuste supervisado con los mismos datos no consigue (Yuan et al., 2025). Pero es la forma más sencilla de componer, repetir el mismo paso con el resultado anterior, y un modelo preentrenado ha visto muchísimo código con llamadas anidadas. Incluso con un modelo entrenado desde cero, lo que el RL alarga es la profundidad de la cadena, no el tipo de composición (Zhang et al., 2025). Proponer un método nuevo exige, muchas veces, una pieza que no estaba en los datos, o una forma de combinarlas que no es repetir. Esto último ya no es un resultado, sino mi hipótesis.

Aun así, en mi opinión, con estos modelos llegaron los primeros resultados de verdad grandes. Por momentos parecen inteligentes. Pero seguían lejos de funcionar bien en situaciones reales, incluso en los terrenos donde más brillan, como la programación o las matemáticas. Resolver un ejercicio cerrado no es lo mismo que trabajar durante horas en un proyecto de verdad.

El siguiente eje para escalar siguió siendo el RL, pero esta vez dándole al modelo herramientas reales que pudiera usar dentro de un entorno controlado. Los propios Yue et al. (2025) apuntan en esa dirección. Para ir más allá del modelo base, proponen seguir escalando el RL y que el modelo interactúe con un entorno a lo largo de varios turnos.

## Entornos de RL y agentes, ¿hacia los *world models*?

Un entorno de RL es un pequeño mundo con reglas en el que el modelo puede actuar. En cada paso, el modelo, al que ahora llamamos *agente*, ve el estado (un repositorio de código, una terminal, una página web), decide una acción (leer un fichero, ejecutar un comando, editar una línea) y el entorno le responde con lo que ha pasado. Razonar y actuar se alternan. El agente piensa, actúa, mira el resultado y vuelve a pensar (Yao et al., 2023). Al final del episodio, un verificador decide si la tarea está resuelta, por ejemplo ejecutando unos tests. Si pasan, la recompensa es 1, y si no, 0. El entrenamiento es el mismo RL de antes, pero a lo grande, con miles de episodios, cada uno con decenas o cientos de acciones, en los que se refuerzan las trayectorias que acaban bien. Para programación hay, por ejemplo, entornos construidos a partir de *issues* reales de GitHub. El agente tiene que arreglar el fallo y los tests del propio proyecto hacen de verificador (Jimenez et al., 2024 · Pan et al., 2025).

> **Figura 7.** Un episodio en un entorno de programación, paso a paso. Compara las tres trayectorias, que pueden acabar las tres con recompensa 1. Activa los tests ocultos para ver cuál deja de cobrarla. *(figura interactiva, en la web: https://latent-universe.pages.dev/el-camino-de-las-ias-hacia-la-inteligencia/#el-camino-de-las-ias-hacia-la-inteligencia-fig-7)*

> Con vídeo, Genie aprende qué acciones se pueden hacer sin que nadie se las etiquete y genera mundos que se controlan fotograma a fotograma (Bruce et al., 2024). V-JEPA 2 se preentrena con más de un millón de horas de vídeo y, con menos de 62 horas de vídeos de un robot, aprende a predecir qué pasará si actúa, lo bastante bien como para planificar con ello (Assran et al., 2025). Y Dreamer 4 consigue diamantes en Minecraft entrenándose solo dentro de un modelo del mundo aprendido, sin tocar el juego (Hafner et al., 2025).

Aquí aparece la idea de los *world models*, un modelo interno de cómo funciona el mundo que permite prever qué pasará al hacer algo sin necesidad de hacerlo (Ha y Schmidhuber, 2018). Mi intuición es que darle acciones a un modelo le empuja a construir uno, y hay trabajos que apuntan en esa dirección. Para predecir qué devolverá un comando, el agente necesita saber en qué estado está el sistema, y ese estado cambia con cada cosa que hace. Meta lo está probando a lo grande. Entrenó un modelo de 32.000 millones de parámetros con trayectorias de observación y acción de un intérprete de Python y de entornos Docker, precisamente para que aprendiera un modelo del mundo del código (FAIR CodeGen team, 2025). Con imágenes y vídeo pasa algo parecido (Bruce et al., 2024 · Assran et al., 2025 · Hafner et al., 2025). Y algo así ocurre también dentro de los modelos de lenguaje. Un transformer entrenado solo para predecir jugadas legales de Othello acaba representando por dentro el estado del tablero, sin que nadie se lo haya enseñado (Li et al., 2023). Pero también hay motivos para la cautela. Modelos que dan indicaciones casi perfectas para moverse por Nueva York tienen por dentro un mapa incoherente, y fallan en cuanto la tarea cambia un poco, por ejemplo con un desvío (Vafa et al., 2024). En conducción pasa algo parecido. DriveBench examina a doce modelos de visión y lenguaje con más de 20.000 preguntas sobre escenas de tráfico reales, y descubre que a menudo responden de forma convincente aunque la imagen esté degradada o ni siquiera esté, tirando de conocimiento general y de pistas del texto en lugar de mirar la escena (Xie et al., 2025). Acertar la siguiente acción no garantiza entender el mundo.

Y se está escalando en todas las direcciones, con agentes de programación que trabajan durante horas en repositorios reales, agentes que navegan por la web, modelos que generan en tiempo real mundos 3D interactivos donde entrenar a otros agentes (Parker-Holder y Fruchter, 2025) o modelos del mundo para la conducción, que generan escenas de tráfico realistas con las que entrenar y poner a prueba coches autónomos (Hu et al., 2023). La apuesta de fondo la resumen Silver y Sutton (2025). Después de la era de los datos humanos vendría la «era de la experiencia», en la que los agentes aprenderían sobre todo de lo que hacen, y no de lo que hemos escrito nosotros. Aun así, aprender de la experiencia no libra a los agentes de lo anterior. Solo se puede reforzar lo que el agente ya consigue alguna vez, y eso depende en buena parte de las competencias que trae del preentrenamiento.

### Los problemas

> Baker et al. (2025) encontraron algo inquietante. Si se castiga al modelo cuando su cadena de pensamiento revela que va a hacer trampa, no deja de hacerla, sino que aprende a esconderla.

Los problemas son los del RL, y alguno más. El primero es el *reward hacking*, que es cuando el agente encuentra la manera de cobrar la recompensa sin hacer la tarea (Skalse et al., 2022). En los entornos de programación no es un riesgo teórico. Se ha observado en modelos de razonamiento punteros como o3-mini, que en lugar de arreglar el código buscaban la manera de que las comprobaciones dieran el visto bueno (Baker et al., 2025). Es la trayectoria tramposa de la figura 7.

El segundo es la asignación de mérito (*credit assignment*). La recompensa llega al final, después de decenas de acciones, y no dice cuáles contribuyeron al éxito y cuáles sobraban. Recompensar cada paso ayudaría, porque supervisar el proceso funciona mejor que supervisar solo el resultado (Lightman et al., 2024), pero exige saber qué es un buen paso. Es tan difícil que el equipo de DeepSeek lo intentó y lo descartó para R1. No había una manera clara de definir un paso ni de saber si era correcto, y el modelo acababa aprendiendo a engañar al evaluador (DeepSeek-AI, 2025). Hay una tercera vía, que es probar. Desde cada paso intermedio se lanzan varias continuaciones y se mide cuántas acaban bien, y el mérito de un paso es cuánto sube esa proporción (Kazemnejad et al., 2024). No hace falta un juez de pasos, solo el verificador final y mucho más cómputo. La figura 8 lo cuenta con una jugada de fútbol.

> **Figura 8.** Una jugada que acaba en gol. Con solo el resultado final, todas las acciones reciben el mismo mérito. Un comentarista que puntúa cada acción necesita saber qué es una buena jugada, y puede equivocarse. Repetir el resto de la jugada muchas veces desde cada momento, y contar cuántas acaban en gol, encuentra las acciones que importaron, pero con pocas repeticiones sale ruidoso y con muchas cuesta caro. *(figura interactiva, en la web: https://latent-universe.pages.dev/el-camino-de-las-ias-hacia-la-inteligencia/#el-camino-de-las-ias-hacia-la-inteligencia-fig-8)*

> Hay intentos de entrenar sin un verificador automático, con rúbricas escritas por personas, con la propia confianza del modelo como recompensa o con votaciones entre sus respuestas, pero ninguno se ha impuesto todavía (Gunjal et al., 2025 · Zhao et al., 2025 · Zuo et al., 2025).

El tercero es que dependemos de entornos verificables. Solo podemos entrenar así lo que se puede comprobar automáticamente, como un test que pasa, una respuesta numérica o una partida ganada. Parece un detalle técnico, pero decide hacia dónde avanza la IA. Los modelos mejoran muy deprisa justo donde hay comprobaciones baratas, como las matemáticas, la programación o los juegos, y mucho más despacio donde no las hay, como escribir bien, investigar o negociar. El resultado es una inteligencia muy desigual, brillante en unas tareas y torpe en otras que a nosotros nos parecen igual de difíciles. Además, cuando la comprobación no captura del todo lo que queremos, el modelo aprende a satisfacer la comprobación y no el objetivo, que es otra forma de reward hacking. Por eso construir buenos verificadores y buenos entornos se ha vuelto uno de los trabajos más importantes del campo.

En mi opinión, estos dos últimos problemas son el mismo visto desde dos lados. Si supiéramos verificar cada paso intermedio, tendríamos recompensas parciales. Como solo sabemos verificar el resultado final, y solo en algunas tareas, nos quedamos con recompensas escasas, o con pagar en cómputo lo que no sabemos verificar, y con tareas cuyo resultado se puede comprobar. Justo lo contrario de lo que hace falta para proponer ideas nuevas, que no vienen con un test para comprobarlas.

## Lo que queda abierto

Si tuviera que resumir el camino en una frase, diría que primero enseñamos a los modelos a saber (el preentrenamiento), después a encadenar lo que saben (la CoT y el RL) y ahora intentamos que aprendan actuando (los entornos). Cada salto resolvió el problema del anterior y dejó al descubierto uno nuevo. El que tenemos delante, cómo recompensar lo que no se puede verificar, es para mí el que separa a un modelo que resuelve problemas de uno que propone ideas.

Lo desarrollaré en la próxima entrada, *Lo que el post-training no enseña*, porque creo que todo lo anterior cabe en una desigualdad. Si el modelo intenta cada problema $G$ veces y solo aprende cuando alguno de esos intentos acierta, solo puede entrenarse con lo que ya acierta, más o menos, una vez de cada $G$, es decir, $p \gtrsim 1/G$. Por debajo no hay nada que reforzar (es el borde izquierdo de la zona de aprendizaje de la figura 5), y el problema, en lugar de aprenderse, se pierde (Zhou, 2026). Casi todo lo que hoy consigue ir más allá del modelo base es, en el fondo, una manera de saltarse esa desigualdad. O se sube $G$, que cuesta dinero (Hu et al., 2025), o se sube $p$ sin pagarlo en intentos, por ejemplo con un profesor que da pistas en el borde de lo que el modelo sabe hacer (Cai et al., 2026), con una recompensa parcial que premia pasar algunos tests antes de exigirlos todos (Sun et al., 2025) o con un mid-training que prepara al modelo antes del RL (Zhang et al., 2025). Y lo aprendido dentro de la banda puede llegar algo más lejos. Un modelo preentrenado desde cero con problemas de hasta 10 operaciones, al que se aplica RL con problemas de 11 a 14, mejora también con los de 15 a 20, donde antes no acertaba casi nunca (Zhang et al., 2025). Más lejos, sí. Distinto, todavía no.

Vista así, la demostración de Navier–Stokes no contradice nada de lo que he contado. Es esa misma cuenta llevada al extremo. AlphaEvolve ya lo había mostrado a menor escala. Un LLM que propone cambios en un programa, evaluadores automáticos y búsqueda evolutiva encontraron cómo multiplicar dos matrices complejas de 4 × 4 con 48 multiplicaciones, la primera mejora en 56 años sobre el algoritmo de Strassen en ese caso (Novikov et al., 2025). En Navier–Stokes hubo diez mil agentes en paralelo, un resultado que se puede comprobar mecánicamente y, si Buckmaster tiene razón, una línea de ataque que ya existía en trabajo humano. Si tengo razón, la creatividad de las máquinas no se va a decidir en el algoritmo de RL, sino en dos sitios mucho menos glamurosos, cuánto podemos pagar por cada intento y qué sabemos verificar. Y casi nada de lo que llamamos una buena idea viene con un verificador.

Este artículo se escribió originalmente en español, con la asistencia de modelos de IA (Claude Opus 5.5, de Anthropic).

[^1]: Las figuras de esta entrada son modelos de juguete. Sus números sirven para ver el mecanismo y no reproducen ningún experimento.

## Referencias

1.  Akgül, Ö. F., Kannan, R., Neiswanger, W. y Prasanna, V. (2026). Rethinking RL for LLM Reasoning: It’s Sparse Policy Selection, Not Capability Learning. arXiv:2605.06241. [https://arxiv.org/abs/2605.06241](https://arxiv.org/abs/2605.06241)
2.  Assran, M., Bardes, A., Fan, D., Garrido, Q., Howes, R. et al. (2025). V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning. arXiv:2506.09985. [https://arxiv.org/abs/2506.09985](https://arxiv.org/abs/2506.09985)
3.  Bachmann, G. y Nagarajan, V. (2024). The Pitfalls of Next-Token Prediction. En *International Conference on Machine Learning*. [https://arxiv.org/abs/2403.06963](https://arxiv.org/abs/2403.06963)
4.  Baker, B., Huizinga, J., Gao, L., Dou, Z., Guan, M. Y., Madry, A. et al. (2025). Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation. arXiv:2503.11926. [https://arxiv.org/abs/2503.11926](https://arxiv.org/abs/2503.11926)
5.  Balesni, M., Korbak, T. y Evans, O. (2024). Lessons from Studying Two-Hop Latent Reasoning. arXiv:2411.16353. [https://arxiv.org/abs/2411.16353](https://arxiv.org/abs/2411.16353)
6.  Brown, T. B., Mann, B., Ryder, N., Subbiah, M., Kaplan, J., Dhariwal, P. et al. (2020). Language Models are Few-Shot Learners. En *Advances in Neural Information Processing Systems*. [https://arxiv.org/abs/2005.14165](https://arxiv.org/abs/2005.14165)
7.  Bruce, J., Dennis, M., Edwards, A., Parker-Holder, J., Shi, Y., Hughes, E. et al. (2024). Genie: Generative Interactive Environments. arXiv:2402.15391. [https://arxiv.org/abs/2402.15391](https://arxiv.org/abs/2402.15391)
8.  Cai, P., Fang, T., Li, X., Zeng, Q., Li, G. y Chen, J. (2026). Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model. arXiv:2606.22317. [https://arxiv.org/abs/2606.22317](https://arxiv.org/abs/2606.22317)
9.  Chen, X., Xu, J., Liang, T., He, Z., Pang, J., Yu, D. et al. (2024). Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs. arXiv:2412.21187. [https://arxiv.org/abs/2412.21187](https://arxiv.org/abs/2412.21187)
10.  Chen, Y., Benton, J., Radhakrishnan, A., Uesato, J., Denison, C., Schulman, J. et al. (2025). Reasoning Models Don’t Always Say What They Think. arXiv:2505.05410. [https://arxiv.org/abs/2505.05410](https://arxiv.org/abs/2505.05410)
11.  Cui, G., Zhang, Y., Chen, J., Yuan, L., Wang, Z., Zuo, Y. et al. (2025). The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models. arXiv:2505.22617. [https://arxiv.org/abs/2505.22617](https://arxiv.org/abs/2505.22617)
12.  DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. *Nature*, *645*, 633–638. [https://arxiv.org/abs/2501.12948](https://arxiv.org/abs/2501.12948)
13.  Dziri, N., Lu, X., Sclar, M., Li, X. L., Jiang, L., Lin, B. Y. et al. (2023). Faith and Fate: Limits of Transformers on Compositionality. En *Advances in Neural Information Processing Systems*. [https://arxiv.org/abs/2305.18654](https://arxiv.org/abs/2305.18654)
14.  FAIR CodeGen team (2025). CWM: An Open-Weights LLM for Research on Code Generation with World Models. arXiv:2510.02387. [https://arxiv.org/abs/2510.02387](https://arxiv.org/abs/2510.02387)
15.  Feng, G., Zhang, B., Gu, Y., Ye, H., He, D. y Wang, L. (2023). Towards Revealing the Mystery behind Chain of Thought: A Theoretical Perspective. En *Advances in Neural Information Processing Systems*. [https://arxiv.org/abs/2305.15408](https://arxiv.org/abs/2305.15408)
16.  Gandhi, K., Chakravarthy, A., Singh, A., Lile, N. y Goodman, N. D. (2025). Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs. arXiv:2503.01307. [https://arxiv.org/abs/2503.01307](https://arxiv.org/abs/2503.01307)
17.  Gekhman, Z., Yona, G., Aharoni, R., Eyal, M., Feder, A., Reichart, R. y Herzig, J. (2024). Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations? En *Proceedings of the Conference on Empirical Methods in Natural Language Processing*. [https://arxiv.org/abs/2405.05904](https://arxiv.org/abs/2405.05904)
18.  Gunjal, A., Wang, A., Lau, E., Nath, V., He, Y., Liu, B. et al. (2025). Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains. arXiv:2507.17746. [https://arxiv.org/abs/2507.17746](https://arxiv.org/abs/2507.17746)
19.  Ha, D. y Schmidhuber, J. (2018). World Models. arXiv:1803.10122. [https://arxiv.org/abs/1803.10122](https://arxiv.org/abs/1803.10122)
20.  Hafner, D., Yan, W. y Lillicrap, T. (2025). Training Agents Inside of Scalable World Models. arXiv:2509.24527. [https://arxiv.org/abs/2509.24527](https://arxiv.org/abs/2509.24527)
21.  Hu, A., Russell, L., Yeo, H., Murez, Z., Fedoseev, G., Kendall, A. et al. (2023). GAIA-1: A Generative World Model for Autonomous Driving. arXiv:2309.17080. [https://arxiv.org/abs/2309.17080](https://arxiv.org/abs/2309.17080)
22.  Hu, J., Liu, M., Lu, X., Wu, F., Harchaoui, Z. y Diao, S. (2025). BroRL: Scaling Reinforcement Learning via Broadened Exploration. arXiv:2510.01180. [https://arxiv.org/abs/2510.01180](https://arxiv.org/abs/2510.01180)
23.  Jimenez, C. E., Yang, J., Wettig, A., Yao, S., Pei, K., Press, O. y Narasimhan, K. (2024). SWE-bench: Can Language Models Resolve Real-World GitHub Issues? En *International Conference on Learning Representations*. [https://arxiv.org/abs/2310.06770](https://arxiv.org/abs/2310.06770)
24.  Kahn, J. (2026). OpenAI says it cracked one of math’s grand challenges. But there are troubling questions about how they did it—and what it means for us all. *Fortune*. [https://fortune.com/2026/09/08/openai-says-it-cracked-navier-stokes-math-grand-challenge-buckmaster-accusation-cheating-intimidation-tao-lament/](https://fortune.com/2026/09/08/openai-says-it-cracked-navier-stokes-math-grand-challenge-buckmaster-accusation-cheating-intimidation-tao-lament/)
25.  Kalai, A. T., Nachum, O., Vempala, S. S. y Zhang, E. (2025). Why Language Models Hallucinate. arXiv:2509.04664. [https://arxiv.org/abs/2509.04664](https://arxiv.org/abs/2509.04664)
26.  Karan, A. y Du, Y. (2025). Reasoning with Sampling: Your Base Model is Smarter Than You Think. arXiv:2510.14901. [https://arxiv.org/abs/2510.14901](https://arxiv.org/abs/2510.14901)
27.  Kazemnejad, A., Aghajohari, M., Portelance, E., Sordoni, A., Reddy, S., Courville, A. et al. (2024). VinePPO: Refining Credit Assignment in RL Training of LLMs. arXiv:2410.01679. [https://arxiv.org/abs/2410.01679](https://arxiv.org/abs/2410.01679)
28.  Kirchner, J. H., Chen, Y., Edwards, H., Leike, J., McAleese, N. y Burda, Y. (2024). Prover-Verifier Games improve legibility of LLM outputs. arXiv:2407.13692. [https://arxiv.org/abs/2407.13692](https://arxiv.org/abs/2407.13692)
29.  Kojima, T., Gu, S. S., Reid, M., Matsuo, Y. y Iwasawa, Y. (2022). Large Language Models are Zero-Shot Reasoners. En *Advances in Neural Information Processing Systems*. [https://arxiv.org/abs/2205.11916](https://arxiv.org/abs/2205.11916)
30.  Lambert, N., Morrison, J., Pyatkin, V., Huang, S., Ivison, H., Brahman, F. et al. (2024). Tülu 3: Pushing Frontiers in Open Language Model Post-Training. arXiv:2411.15124. [https://arxiv.org/abs/2411.15124](https://arxiv.org/abs/2411.15124)
31.  Li, K., Hopkins, A. K., Bau, D., Viégas, F., Pfister, H. y Wattenberg, M. (2023). Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task. En *International Conference on Learning Representations*. [https://arxiv.org/abs/2210.13382](https://arxiv.org/abs/2210.13382)
32.  Lightman, H., Kosaraju, V., Burda, Y., Edwards, H., Baker, B., Lee, T. et al. (2024). Let’s Verify Step by Step. En *International Conference on Learning Representations*. [https://arxiv.org/abs/2305.20050](https://arxiv.org/abs/2305.20050)
33.  Liu, M., Diao, S., Lu, X., Hu, J., Dong, X., Choi, Y. et al. (2025). ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models. arXiv:2505.24864. [https://arxiv.org/abs/2505.24864](https://arxiv.org/abs/2505.24864)
34.  Luong, T. y Lockhart, E. (2025). Advanced version of Gemini with Deep Think officially achieves gold-medal standard at the International Mathematical Olympiad. *Google DeepMind (blog)*. [https://deepmind.google/discover/blog/advanced-version-of-gemini-with-deep-think-officially-achieves-gold-medal-standard-at-the-international-mathematical-olympiad/](https://deepmind.google/discover/blog/advanced-version-of-gemini-with-deep-think-officially-achieves-gold-medal-standard-at-the-international-mathematical-olympiad/)
35.  Novikov, A., Vũ, N., Eisenberger, M., Dupont, E., Huang, P.-S., Wagner, A. Z. et al. (2025). AlphaEvolve: A coding agent for scientific and algorithmic discovery. arXiv:2506.13131. [https://arxiv.org/abs/2506.13131](https://arxiv.org/abs/2506.13131)
36.  Nye, M., Andreassen, A. J., Gur-Ari, G., Michalewski, H., Austin, J., Bieber, D. et al. (2021). Show Your Work: Scratchpads for Intermediate Computation with Language Models. arXiv:2112.00114. [https://arxiv.org/abs/2112.00114](https://arxiv.org/abs/2112.00114)
37.  OpenAI (2024). Learning to Reason with LLMs. *OpenAI (blog)*. [https://openai.com/index/learning-to-reason-with-llms/](https://openai.com/index/learning-to-reason-with-llms/)
38.  OpenAI (2026a). Finite Time Blowup for Navier–Stokes. *OpenAI*. [https://cdn.openai.com/pdf/32d9f210-8b73-45e0-91bc-82a30aef8a9a/navier-stokes.pdf](https://cdn.openai.com/pdf/32d9f210-8b73-45e0-91bc-82a30aef8a9a/navier-stokes.pdf)
39.  OpenAI (2026b). NavierStokesAndEuler: Lean certificates accompanying Navier–Stokes and Euler results. *GitHub*. [https://github.com/openai/NavierStokesAndEuler](https://github.com/openai/NavierStokesAndEuler)
40.  Ouyang, L., Wu, J., Jiang, X., Almeida, D., Wainwright, C. L., Mishkin, P. et al. (2022). Training language models to follow instructions with human feedback. En *Advances in Neural Information Processing Systems*. [https://arxiv.org/abs/2203.02155](https://arxiv.org/abs/2203.02155)
41.  Pan, J., Wang, X., Neubig, G., Jaitly, N., Ji, H., Suhr, A. y Zhang, Y. (2025). Training Software Engineering Agents and Verifiers with SWE-Gym. En *International Conference on Machine Learning*. [https://arxiv.org/abs/2412.21139](https://arxiv.org/abs/2412.21139)
42.  Parker-Holder, J. y Fruchter, S. (2025). Genie 3: A new frontier for world models. *Google DeepMind (blog)*. [https://deepmind.google/discover/blog/genie-3-a-new-frontier-for-world-models/](https://deepmind.google/discover/blog/genie-3-a-new-frontier-for-world-models/)
43.  Press, O., Zhang, M., Min, S., Schmidt, L., Smith, N. A. y Lewis, M. (2022). Measuring and Narrowing the Compositionality Gap in Language Models. arXiv:2210.03350. [https://arxiv.org/abs/2210.03350](https://arxiv.org/abs/2210.03350)
44.  Prystawski, B., Li, M. Y. y Goodman, N. D. (2023). Why think step by step? Reasoning emerges from the locality of experience. En *Advances in Neural Information Processing Systems*. [https://arxiv.org/abs/2304.03843](https://arxiv.org/abs/2304.03843)
45.  Radford, A., Wu, J., Child, R., Luan, D., Amodei, D. y Sutskever, I. (2019). Language Models are Unsupervised Multitask Learners. *OpenAI*. [https://cdn.openai.com/better-language-models/language\_models\_are\_unsupervised\_multitask\_learners.pdf](https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf)
46.  Shao, Z., Wang, P., Zhu, Q., Xu, R., Song, J., Bi, X. et al. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv:2402.03300. [https://arxiv.org/abs/2402.03300](https://arxiv.org/abs/2402.03300)
47.  Si, C., Yang, D. y Hashimoto, T. (2024). Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers. arXiv:2409.04109. [https://arxiv.org/abs/2409.04109](https://arxiv.org/abs/2409.04109)
48.  Si, C., Hashimoto, T. y Yang, D. (2025). The Ideation-Execution Gap: Execution Outcomes of LLM-Generated versus Human Research Ideas. arXiv:2506.20803. [https://arxiv.org/abs/2506.20803](https://arxiv.org/abs/2506.20803)
49.  Silver, D. y Sutton, R. S. (2025). Welcome to the Era of Experience. *Preprint, capítulo de «Designing an Intelligence» (MIT Press)*. [https://storage.googleapis.com/deepmind-media/Era-of-Experience%20/The%20Era%20of%20Experience%20Paper.pdf](https://storage.googleapis.com/deepmind-media/Era-of-Experience%20/The%20Era%20of%20Experience%20Paper.pdf)
50.  Skalse, J., Howe, N. H. R., Krasheninnikov, D. y Krueger, D. (2022). Defining and Characterizing Reward Hacking. En *Advances in Neural Information Processing Systems*. [https://arxiv.org/abs/2209.13085](https://arxiv.org/abs/2209.13085)
51.  Snell, C., Lee, J., Xu, K. y Kumar, A. (2025). Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. En *International Conference on Learning Representations*. [https://arxiv.org/abs/2408.03314](https://arxiv.org/abs/2408.03314)
52.  Stan, A. M. (2026). The mathematicians published machine-checkable proofs. OpenAI announced its result on a call with reporters. *The Next Web*. [https://thenextweb.com/news/openai-navier-stokes-claim-verification-credit](https://thenextweb.com/news/openai-navier-stokes-claim-verification-credit)
53.  Sun, Y., Cao, Y., Huang, P., Bai, H., Hajishirzi, H., Dziri, N. y Song, D. (2025). RL Grokking Recipe: How Does RL Unlock and Transfer New Algorithms in LLMs? arXiv:2509.21016. [https://arxiv.org/abs/2509.21016](https://arxiv.org/abs/2509.21016)
54.  Vafa, K., Chen, J. Y., Rambachan, A., Kleinberg, J. y Mullainathan, S. (2024). Evaluating the World Model Implicit in a Generative Model. En *Advances in Neural Information Processing Systems*. [https://arxiv.org/abs/2406.03689](https://arxiv.org/abs/2406.03689)
55.  Wang, X., Wei, J., Schuurmans, D., Le, Q., Chi, E., Narang, S. et al. (2023). Self-Consistency Improves Chain of Thought Reasoning in Language Models. En *International Conference on Learning Representations*. [https://arxiv.org/abs/2203.11171](https://arxiv.org/abs/2203.11171)
56.  Wei, J., Wang, X., Schuurmans, D., Bosma, M., Ichter, B., Xia, F. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. En *Advances in Neural Information Processing Systems*. [https://arxiv.org/abs/2201.11903](https://arxiv.org/abs/2201.11903)
57.  Wu, F., Xuan, W., Lu, X., Liu, M., Dong, Y., Harchaoui, Z. y Choi, Y. (2025). The Invisible Leash: Why RLVR May or May Not Escape Its Origin. arXiv:2507.14843. [https://arxiv.org/abs/2507.14843](https://arxiv.org/abs/2507.14843)
58.  Xie, S., Kong, L., Dong, Y., Sima, C., Zhang, W., Chen, Q. A. et al. (2025). Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives. En *International Conference on Computer Vision*. [https://arxiv.org/abs/2501.04003](https://arxiv.org/abs/2501.04003)
59.  Yang, C., Zhang, X. y Chen, J. (2026). RLVR is a Kernel, Not a Function: Statistical Inference for pass@$k$ Crossovers. arXiv:2609.22547. [https://arxiv.org/abs/2609.22547](https://arxiv.org/abs/2609.22547)
60.  Yao, S., Zhao, J., Yu, D., Du, N., Shafran, I., Narasimhan, K. y Cao, Y. (2023). ReAct: Synergizing Reasoning and Acting in Language Models. En *International Conference on Learning Representations*. [https://arxiv.org/abs/2210.03629](https://arxiv.org/abs/2210.03629)
61.  Yu, Q., Zhang, Z., Zhu, R., Yuan, Y., Zuo, X., Yue, Y. et al. (2025). DAPO: An Open-Source LLM Reinforcement Learning System at Scale. arXiv:2503.14476. [https://arxiv.org/abs/2503.14476](https://arxiv.org/abs/2503.14476)
62.  Yuan, L., Chen, W., Zhang, Y., Cui, G., Wang, H., You, Z. et al. (2025). From $f(x)$ and $g(x)$ to $f(g(x))$: LLMs Learn New Skills in RL by Composing Old Ones. arXiv:2509.25123. [https://arxiv.org/abs/2509.25123](https://arxiv.org/abs/2509.25123)
63.  Yue, Y., Chen, Z., Lu, R., Zhao, A., Wang, Z., Yue, Y. et al. (2025). Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model? En *Advances in Neural Information Processing Systems*. [https://arxiv.org/abs/2504.13837](https://arxiv.org/abs/2504.13837)
64.  Zelikman, E., Wu, Y., Mu, J. y Goodman, N. D. (2022). STaR: Bootstrapping Reasoning With Reasoning. En *Advances in Neural Information Processing Systems*. [https://arxiv.org/abs/2203.14465](https://arxiv.org/abs/2203.14465)
65.  Zhang, C., Neubig, G. y Yue, X. (2025). On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models. arXiv:2512.07783. [https://arxiv.org/abs/2512.07783](https://arxiv.org/abs/2512.07783)
66.  Zhao, X., Kang, Z., Feng, A., Levine, S. y Song, D. (2025). Learning to Reason without External Rewards. arXiv:2505.19590. [https://arxiv.org/abs/2505.19590](https://arxiv.org/abs/2505.19590)
67.  Zhou, C., Liu, P., Xu, P., Iyer, S., Sun, J., Mao, Y. et al. (2023). LIMA: Less Is More for Alignment. En *Advances in Neural Information Processing Systems*. [https://arxiv.org/abs/2305.11206](https://arxiv.org/abs/2305.11206)
68.  Zhou, T. (2026). When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion. arXiv:2607.20543. [https://arxiv.org/abs/2607.20543](https://arxiv.org/abs/2607.20543)
69.  Zuo, Y., Zhang, K., Sheng, L., Qu, S., Cui, G., Zhu, X. et al. (2025). TTRL: Test-Time Reinforcement Learning. arXiv:2504.16084. [https://arxiv.org/abs/2504.16084](https://arxiv.org/abs/2504.16084)
