● Universo Latente/ itzalgorri

El camino de las IA hacia la «inteligencia»

Del modelo que predice la siguiente palabra al agente que actúa en un entorno. Qué resolvió cada salto y qué dejó sin resolver.

TLDR

En este artículo propongo una forma de leer cómo han avanzado los modelos de lenguaje grandes (LLM, por sus siglas en inglés) en los últimos años, a partir de tres preguntas.

  • ¿Por qué los primeros LLM, los de antes de los modelos de razonamiento de 2024, parecían tan «tontos»? Porque aprendieron de un internet lleno de resultados y casi vacío de procesos, y tenían que dar cada respuesta de golpe, sin ir paso a paso.
  • ¿Qué cambió con el razonamiento? La cadena de pensamiento les dejó resolver los problemas pieza por pieza, y el aprendizaje por refuerzo les enseñó a hacerlo por su cuenta y a pensar más cuando hace falta.
  • ¿Por qué los modelos de razonamiento actuales no son capaces de proponer métodos o ideas nuevas? Mi hipótesis es que el refuerzo solo afina lo que el modelo ya consigue alguna vez, y que casi ninguna idea nueva viene con una forma automática de comprobarla.

Para las dos primeras me apoyo en artículos de los últimos años. La tercera todavía no tiene una respuesta establecida, así que ahí paso al terreno hipotético.

Los primeros LLM predecían la siguiente palabra

Un modelo de lenguaje hace una sola cosa. Dado un texto, reparte la probabilidad entre todas las formas posibles de continuarlo, elige el siguiente token (un trozo de palabra), lo añade y vuelve a empezar. Es la predicción del siguiente token (next-token prediction, NTP), y el entrenamiento consiste justo en eso, repetido con cientos de miles de millones de tokens de internet, libros y código. GPT-2 y, sobre todo, GPT-3 mostraron que, con suficientes datos y parámetros, esta tarea tan simple da para mucho. Traducían, resumían o respondían preguntas sin que nadie los hubiera entrenado para ninguna de esas tareas (Radford et al., 2019 · Brown et al., 2020).

Los ChatGPT de 2022 y 2023 se entrenaban un poco más para que sus respuestas agradasen a las personas, a partir de ejemplos de qué respuestas preferían (Ouyang et al., 2022). Ese ajuste los hizo mucho más útiles, pero aquí lo dejo de lado, porque no creo que sea una pieza clave del camino hacia la inteligencia. En el fondo, seguían siendo máquinas de continuar texto.

Dos problemas aparecían una y otra vez. El primero eran las alucinaciones, respuestas falsas dichas con total seguridad, como una cita que no existe o una fecha inventada. No son un fallo raro, sino la consecuencia natural de cómo se entrenan y se evalúan estos modelos. Igual que en un examen tipo test que no penaliza los errores, arriesgar una respuesta sale más a cuenta que admitir que no se sabe (Kalai et al., 2025). El segundo eran los problemas de varios pasos, como una multiplicación larga, un acertijo lógico o un plan. Los modelos acertaban los casos fáciles y se hundían en cuanto había que encadenar muchos pasos (Dziri et al., 2023). La figura 1 lo muestra con tres ejemplos.[1]

Figura 1 Predicción del siguiente token en tres casos. Pulsa «Siguiente token» o elige tú una de las barras. En «Un dato», el modelo no puede saber la respuesta, pero decir «no lo sé» es casi imposible. En «Una cuenta», tiene que escribir el resultado dígito a dígito sin haber hecho la multiplicación.

Hay una razón de fondo para lo segundo. Internet está lleno de resultados y casi vacío de procesos. Se publica la solución del problema y no los veinte borradores, el artículo terminado y no las semanas de callejones sin salida, «37 × 48 = 1776» y no la multiplicación en columna. A las personas nos pasa algo parecido. Cuando ya dominamos un proceso, lo interiorizamos y dejamos de escribirlo, porque ya no lo necesitamos. Un niño, en cambio, necesita verlo todo desglosado para aprender a multiplicar. Un LLM que aprende de lo que escribimos los adultos se encuentra con los resultados, pero casi nunca con el desglose.

Ante «37 × 48» caben dos maneras de acertar. La primera es haber visto esa cuenta tantas veces que el resultado se sabe de memoria. La segunda es haber aprendido cómo se multiplica y aplicarlo a cualquier par de números. Queremos la segunda, porque es la única que generaliza, y la segunda obliga a encadenar competencias más pequeñas, como multiplicar una cifra por otra, llevarse una o sumar en columna. Es como construir con piezas de Lego, que se colocan de una en una. El problema es que, para escribir cada token, el modelo hace una sola pasada por la red, con un número fijo de capas. Si la cadena de piezas es más larga de lo que cabe en esa pasada, no puede montarla de golpe, y solo le queda adivinar o tirar de memoria.

No es solo una intuición. Hay resultados teóricos que lo demuestran (Feng et al., 2023), y en la práctica pasaba justo eso. GPT-3 sumaba sin fallos números de dos cifras, pero con cinco cifras acertaba menos del 10 % de las veces (Brown et al., 2020). Y que un modelo acierte muchos ejemplos no quiere decir que haya aprendido el procedimiento. Los transformers tienden a resolver estos problemas reconociendo trozos de cálculos que ya han visto, no con un método sistemático, y por eso el acierto se desploma a medida que el problema crece (Dziri et al., 2023).

Imagina aprender matemáticas solo con el solucionario, cientos de enunciados, cada uno con su resultado y ni un solo desarrollo. Con el tiempo reconocerías patrones («si el enunciado habla de porcentajes, el resultado suele ser redondo») y acertarías bastantes ejercicios parecidos a los que ya has visto. Pero ante uno nuevo solo podrías tirar de intuición y, cuando la intuición fallase, no tendrías manera de darte cuenta, porque nunca aprendiste a comprobar nada. Así es un LLM entrenado solo con NTP, un estudiante brillante que se ha aprendido el solucionario de memoria. Tiene una intuición excelente, pero es solo intuición.

Ahora bien, el solucionario enseña mucho. Casi todo lo que sabe un modelo lo aprende en el preentrenamiento, y las fases posteriores sirven sobre todo para sacarlo a la luz. Me gusta pensarlo con dos palabras, alcance y control. El preentrenamiento da el alcance, es decir, lo que el modelo puede llegar a resolver. El posentrenamiento da el control, que es saber cuándo seguir trabajando en un problema y cuándo parar. LIMA lo mostró con un experimento muy limpio. Bastaron mil ejemplos bien elegidos para ajustar un modelo preentrenado, sin aprendizaje por refuerzo ni preferencias humanas, y sus respuestas resultaron iguales o mejores que las de GPT-4 en el 43 % de los casos (Zhou et al., 2023). Y en sentido contrario, cuando se intenta enseñarle hechos nuevos durante el ajuste, el modelo los aprende mucho más despacio que los que ya conocía y, cuando por fin los aprende, alucina más (Gekhman et al., 2024).

El conocimiento, por tanto, está ahí desde el preentrenamiento. Lo que falta es una manera de usarlo en problemas que necesitan muchos pasos. Y si hacen falta muchos pasos, la solución parece obvia. Hay que dejar que el modelo los dé de uno en uno, por escrito.

La cadena de pensamiento y el posentrenamiento

Después llegó el «razonamiento». En 2022, un equipo de Google Brain, con Jason Wei como primer autor y Denny Zhou al frente, publicó el artículo que dio nombre a la chain of thought (CoT), la cadena de pensamiento (Wei et al., 2022). La idea es muy simple y muy potente. Si en lugar de pedirle la respuesta directamente se le muestran al modelo unos pocos ejemplos resueltos paso a paso, el modelo también resuelve paso a paso, y acierta mucho más. Poco después se vio que ni siquiera hacían falta los ejemplos. Bastaba con añadir «Pensemos paso a paso» a la pregunta para que un modelo de OpenAI pasase del 17,7 % al 78,7 % de aciertos en un conjunto de problemas aritméticos (Kojima et al., 2022). A partir de ahí empezamos a enseñar a los modelos a encarar los problemas poco a poco (figura 2).

Figura 2 El ejemplo de la figura 1 de Wei et al. (2022), traducido. Cada token que escribe el modelo es una pasada por la red, con las mismas capas. Paso a paso, el modelo hace muchas más pasadas antes de responder, y cada resultado intermedio queda escrito para las siguientes.

Por qué funciona tiene que ver con lo anterior. Cada token escrito es una pasada más por la red, y los resultados intermedios quedan en el texto, donde las pasadas siguientes los pueden leer. Es la otra mitad de ese resultado teórico, porque con una cadena de pensamiento un transformer de tamaño fijo sí puede resolver los problemas que no podía resolver de golpe (Feng et al., 2023). Pero creo que hay algo más. Escribir los pasos obliga al modelo a construir la solución pieza por pieza, desde la base, en lugar de saltar a una respuesta recordada, y hay trabajos que apuntan en esa dirección. Los modelos responden bien a cada subpregunta por separado y aun así fallan la pregunta que las combina, un hueco que no se cierra al hacer el modelo más grande pero sí al pedirle que se haga las subpreguntas en voz alta (Press et al., 2022). Eso sí, la CoT no funcionaba con cualquier modelo. En el artículo original solo mejoraba los resultados a partir de unos 100.000 millones de parámetros, y los modelos pequeños escribían cadenas fluidas pero sin lógica (Wei et al., 2022). Es una pista de que la cadena organiza un conocimiento que ya tiene que estar ahí.

La CoT tiene muchas ventajas y pocos inconvenientes. Es barata, no obliga a cambiar el modelo y deja ver por dónde va el razonamiento, aunque no siempre refleje lo que el modelo calcula por dentro (Chen et al., 2025). Hoy está presente, de una forma u otra, en todos los modelos punteros. Con esta herramienta en la caja podíamos soñar con resolver problemas más complejos, pero faltaba una pieza. ¿Cómo conseguir que los modelos aprendiesen por sí solos a resolver problemas con la CoT?

La respuesta fue el aprendizaje por refuerzo (reinforcement learning, RL). Ante un problema verificable, el modelo propone varias soluciones, se comprueba cuáles llegan a la respuesta correcta y se ajusta el modelo para que las que han funcionado sean más probables. Es una idea elegante, y no es nueva, pero a partir de 2024 llegó a una escala enorme. OpenAI lo presentó con o1 (OpenAI, 2024) y DeepSeek publicó los detalles con R1 (DeepSeek-AI, 2025), entrenado con GRPO, un algoritmo que compara cada intento con la media de su grupo (Shao et al., 2024). La figura 3 lo reproduce en pequeño.

Figura 3 RL con recompensas verificables, en pequeño. En cada paso, el modelo intenta el problema ocho veces, se comprueba cada intento y se refuerzan las estrategias de los que superan la media del grupo. Entrena varios pasos, y también desde cero más de una vez. El acierto sube, la diversidad se hunde y, a veces, el modelo se queda con la estrategia B aunque la A sea mejor.

El RL no solo enseñó a los modelos a trabajar de forma más autónoma. También abrió un eje nuevo para escalar. Hasta entonces, mejorar un modelo quería decir hacerlo más grande o darle más datos, y ahora también se le puede dejar pensar más antes de responder. La CoT nos dio la herramienta para escalar en tiempo, y el RL, el método para aprovecharla. Durante el entrenamiento de R1-Zero, las respuestas se alargan solas. Nadie le pide que piense más, pero pensar más da más recompensa (DeepSeek-AI, 2025). Es lo que se conoce como cómputo en inferencia (test-time compute), y funciona. A igualdad de cómputo total, un modelo pequeño que piensa más puede superar a uno catorce veces mayor, siempre que el pequeño ya acierte el problema de vez en cuando (Snell et al., 2025).

Así empezamos a dedicar cantidades enormes de cómputo a problemas muy difíciles, y en julio de 2025 una versión de Gemini alcanzó oficialmente el nivel de medalla de oro en la Olimpiada Internacional de Matemáticas (Luong y Lockhart, 2025). En septiembre de 2026, OpenAI fue mucho más lejos. Un sistema de unos 10.000 agentes, con un gasto de millones de dólares en cómputo, produjo una demostración de que las ecuaciones de Navier–Stokes en tres dimensiones pueden desarrollar una singularidad en tiempo finito cuando actúa sobre el fluido una fuerza externa suave (OpenAI, 2026a · Kahn, 2026). Es una de las alternativas que admite el enunciado oficial del problema del milenio, así que, si se confirma, sería el primero de esos problemas resuelto con una máquina. La demostración ocupa 166 páginas y viene con una formalización en Lean (OpenAI, 2026b), pero la comunidad todavía la está revisando y hay una disputa abierta sobre el mérito. Cuanto más tiempo (y, por tanto, dinero) le damos a la máquina, mejor.

Sin embargo, el cuento no es tan bonito como parece. El RL tiene efectos secundarios.

  • Hace que el modelo repita lo que ya le ha funcionado. Las soluciones premiadas se vuelven cada vez más probables y las demás desaparecen, así que la diversidad de respuestas colapsa y el modelo explora cada vez menos (Cui et al., 2025). Pasa porque cada refuerzo hace todavía más probable lo que ya salía a menudo, mientras que lo que casi nunca sale no llega a reforzarse. Es como quien encuentra un restaurante que le gusta y ya no prueba ningún otro. Nunca sabrá si había uno mejor a dos calles.
  • Depende de que el modelo ya tenga el conocimiento necesario (las features) para resolver el problema. Con recompensas de acierto o fallo a secas, no vamos a resolver un problema para el que el modelo no esté mínimamente preparado. No es un límite del RL como tal, sino de cómo lo usamos. Con el mismo entrenamiento, un modelo que ya trae de serie hábitos como comprobar sus cálculos o dar marcha atrás mejora mucho, y otro que no los trae apenas se mueve (Gandhi et al., 2025). En experimentos controlados, el RL solo amplía de verdad lo que el modelo resuelve cuando se entrena en el borde de su competencia (Zhang et al., 2025). Son problemas difíciles pero no fuera de su alcance, que el modelo todavía resuelve de vez en cuando. En ese estudio, por ejemplo, son problemas algo más largos que los del preentrenamiento, que el modelo base aún acierta en alguno de 128 intentos.
  • Las soluciones pueden aportar poco y ser larguísimas. Aunque el modelo resuelva problemas muy difíciles, sus razonamientos pueden ser tan largos que resulten ininteligibles. R1-Zero mezclaba idiomas y costaba leerlo (DeepSeek-AI, 2025), y optimizar solo el acierto hace que las soluciones sean más difíciles de comprobar para una persona (Kirchner et al., 2024). Además, estos modelos piensan de más incluso ante problemas triviales, como sumar 2 + 3 (Chen et al., 2024). Es la consecuencia de llevar el cómputo en inferencia al límite.

Para entender de dónde salen estos límites me ayuda volver al Lego. El preentrenamiento llena la caja de piezas, que son hechos, operaciones y maneras de razonar. La cadena de pensamiento permite montarlas de una en una, y el RL es la práctica que hace que el montaje salga bien más a menudo. Pero si falta una pieza en la caja, no hay práctica que valga (figura 4).

Figura 4 Construir con piezas. Cada pieza colocada es un paso de la cadena de pensamiento, y puede caerse. Sin cadena de pensamiento, hay que colocarlo todo de golpe. La práctica con RL hace que cada pieza se caiga menos, pero ningún ajuste pone en la caja la pieza que le falta a «Algo nuevo».

Los dos primeros efectos se ven con claridad en otro juguete (figuras 5 y 6). Imagina doscientos problemas y, para cada uno, la probabilidad de que el modelo lo acierte en un intento. GRPO intenta cada problema GG veces, da a cada intento ii una recompensa rir_i (1 si acierta y 0 si falla) y lo compara con la media de su grupo. Esa comparación es la ventaja del intento,

Ai=ri−media⁡(r1,…,rG)desv⁡(r1,…,rG),A_i = \frac{r_i - \operatorname{media}(r_1, \dots, r_G)}{\operatorname{desv}(r_1, \dots, r_G)},

y el modelo sube la probabilidad de los intentos con ventaja positiva y baja la de los que la tienen negativa (Shao et al., 2024). El problema está en el numerador. Si todos los intentos aciertan, o todos fallan, cada rir_i es igual a la media, así que todas las ventajas valen cero y no hay nada que reforzar (el denominador también vale cero, y en la práctica se le suma un número muy pequeño para no dividir entre cero). El aprendizaje solo ocurre en una banda de dificultad intermedia. De hecho, DAPO descarta directamente los problemas que siempre se aciertan o siempre se fallan, porque no aportan nada (Yu et al., 2025).

Figura 5 Cada punto es un problema, colocado según la probabilidad de que el modelo lo acierte en un intento. La curva es la señal de aprendizaje, la probabilidad de que entre los intentos de un paso haya aciertos y fallos. Al mover los pasos de RL, lo que está dentro de la banda sube hacia el 100 %, y lo que casi nunca se acierta no da señal y se hunde hacia el 0 %. Con más intentos por problema, la banda se ensancha.

El resultado se parece mucho a una votación. Si a un modelo le pides dieciséis respuestas y te quedas con la más repetida (majority vote), aciertas bastante más que con una sola (Wang et al., 2023). El RL consigue algo parecido sin votar. Afila la distribución hacia las respuestas correctas que ya salían a menudo y deja caer las que casi nunca salían. DeepSeekMath lo midió. Tras el RL mejoraba el acierto por votación, pero no la probabilidad de acertar alguna vez en muchos intentos. Según sus autores, el RL vuelve más robusta la distribución de respuestas, pero no mejora las capacidades de fondo (Shao et al., 2024). Redistribuye las respuestas que ya había, pero no crea otras nuevas. Tanto es así que, sin entrenar nada, muestreando el modelo base de forma más afilada se iguala al RL en muchas tareas, y sin perder diversidad (Karan y Du, 2025).

Lo segundo se ve con pass@k, la probabilidad de acertar al menos una vez en k intentos. Con k = 1, el modelo entrenado con RL gana con claridad. Pero si se deja que los dos lo intenten cientos de veces, el modelo base acaba resolviendo más problemas (Yue et al., 2025). El RL no amplía lo que el modelo puede resolver. Concentra la probabilidad en lo que ya podía resolver y, por el camino, pierde parte de lo demás. Los mismos autores encuentran que destilar de un modelo mejor sí puede aportar patrones de razonamiento nuevos, algo que el RL, tal como lo usamos hoy, no consigue.

Figura 6 pass@k del modelo base y del entrenado con RL, con los mismos doscientos problemas de la figura 5. Pasa el puntero por el gráfico para leer los valores. La forma de las curvas es la que miden Yue et al. (2025) en modelos reales, pero los números no.

Esta es, para mí, la mejor respuesta que tenemos a la tercera pregunta del principio. Un modelo de razonamiento combina muy bien lo que ya sabe, y eso a veces parece creatividad. El RL sí aprende a encadenar más piezas de las que vio al entrenar. Con composiciones de dos funciones, un modelo pasa de acertar un 5 % a un 30 % de las cadenas de tres que nunca ha visto, cosa que el ajuste supervisado con los mismos datos no consigue (Yuan et al., 2025). Pero es la forma más sencilla de componer, repetir el mismo paso con el resultado anterior, y un modelo preentrenado ha visto muchísimo código con llamadas anidadas. Incluso con un modelo entrenado desde cero, lo que el RL alarga es la profundidad de la cadena, no el tipo de composición (Zhang et al., 2025). Proponer un método nuevo exige, muchas veces, una pieza que no estaba en los datos, o una forma de combinarlas que no es repetir. Esto último ya no es un resultado, sino mi hipótesis.

Aun así, en mi opinión, con estos modelos llegaron los primeros resultados de verdad grandes. Por momentos parecen inteligentes. Pero seguían lejos de funcionar bien en situaciones reales, incluso en los terrenos donde más brillan, como la programación o las matemáticas. Resolver un ejercicio cerrado no es lo mismo que trabajar durante horas en un proyecto de verdad.

El siguiente eje para escalar siguió siendo el RL, pero esta vez dándole al modelo herramientas reales que pudiera usar dentro de un entorno controlado. Los propios Yue et al. (2025) apuntan en esa dirección. Para ir más allá del modelo base, proponen seguir escalando el RL y que el modelo interactúe con un entorno a lo largo de varios turnos.

Entornos de RL y agentes, ¿hacia los world models?

Un entorno de RL es un pequeño mundo con reglas en el que el modelo puede actuar. En cada paso, el modelo, al que ahora llamamos agente, ve el estado (un repositorio de código, una terminal, una página web), decide una acción (leer un fichero, ejecutar un comando, editar una línea) y el entorno le responde con lo que ha pasado. Razonar y actuar se alternan. El agente piensa, actúa, mira el resultado y vuelve a pensar (Yao et al., 2023). Al final del episodio, un verificador decide si la tarea está resuelta, por ejemplo ejecutando unos tests. Si pasan, la recompensa es 1, y si no, 0. El entrenamiento es el mismo RL de antes, pero a lo grande, con miles de episodios, cada uno con decenas o cientos de acciones, en los que se refuerzan las trayectorias que acaban bien. Para programación hay, por ejemplo, entornos construidos a partir de issues reales de GitHub. El agente tiene que arreglar el fallo y los tests del propio proyecto hacen de verificador (Jimenez et al., 2024 · Pan et al., 2025).

Figura 7 Un episodio en un entorno de programación, paso a paso. Compara las tres trayectorias, que pueden acabar las tres con recompensa 1. Activa los tests ocultos para ver cuál deja de cobrarla.

Aquí aparece la idea de los world models, un modelo interno de cómo funciona el mundo que permite prever qué pasará al hacer algo sin necesidad de hacerlo (Ha y Schmidhuber, 2018). Mi intuición es que darle acciones a un modelo le empuja a construir uno, y hay trabajos que apuntan en esa dirección. Para predecir qué devolverá un comando, el agente necesita saber en qué estado está el sistema, y ese estado cambia con cada cosa que hace. Meta lo está probando a lo grande. Entrenó un modelo de 32.000 millones de parámetros con trayectorias de observación y acción de un intérprete de Python y de entornos Docker, precisamente para que aprendiera un modelo del mundo del código (FAIR CodeGen team, 2025). Con imágenes y vídeo pasa algo parecido (Bruce et al., 2024 · Assran et al., 2025 · Hafner et al., 2025). Y algo así ocurre también dentro de los modelos de lenguaje. Un transformer entrenado solo para predecir jugadas legales de Othello acaba representando por dentro el estado del tablero, sin que nadie se lo haya enseñado (Li et al., 2023). Pero también hay motivos para la cautela. Modelos que dan indicaciones casi perfectas para moverse por Nueva York tienen por dentro un mapa incoherente, y fallan en cuanto la tarea cambia un poco, por ejemplo con un desvío (Vafa et al., 2024). En conducción pasa algo parecido. DriveBench examina a doce modelos de visión y lenguaje con más de 20.000 preguntas sobre escenas de tráfico reales, y descubre que a menudo responden de forma convincente aunque la imagen esté degradada o ni siquiera esté, tirando de conocimiento general y de pistas del texto en lugar de mirar la escena (Xie et al., 2025). Acertar la siguiente acción no garantiza entender el mundo.

Y se está escalando en todas las direcciones, con agentes de programación que trabajan durante horas en repositorios reales, agentes que navegan por la web, modelos que generan en tiempo real mundos 3D interactivos donde entrenar a otros agentes (Parker-Holder y Fruchter, 2025) o modelos del mundo para la conducción, que generan escenas de tráfico realistas con las que entrenar y poner a prueba coches autónomos (Hu et al., 2023). La apuesta de fondo la resumen Silver y Sutton (2025). Después de la era de los datos humanos vendría la «era de la experiencia», en la que los agentes aprenderían sobre todo de lo que hacen, y no de lo que hemos escrito nosotros. Aun así, aprender de la experiencia no libra a los agentes de lo anterior. Solo se puede reforzar lo que el agente ya consigue alguna vez, y eso depende en buena parte de las competencias que trae del preentrenamiento.

Los problemas

Los problemas son los del RL, y alguno más. El primero es el reward hacking, que es cuando el agente encuentra la manera de cobrar la recompensa sin hacer la tarea (Skalse et al., 2022). En los entornos de programación no es un riesgo teórico. Se ha observado en modelos de razonamiento punteros como o3-mini, que en lugar de arreglar el código buscaban la manera de que las comprobaciones dieran el visto bueno (Baker et al., 2025). Es la trayectoria tramposa de la figura 7.

El segundo es la asignación de mérito (credit assignment). La recompensa llega al final, después de decenas de acciones, y no dice cuáles contribuyeron al éxito y cuáles sobraban. Recompensar cada paso ayudaría, porque supervisar el proceso funciona mejor que supervisar solo el resultado (Lightman et al., 2024), pero exige saber qué es un buen paso. Es tan difícil que el equipo de DeepSeek lo intentó y lo descartó para R1. No había una manera clara de definir un paso ni de saber si era correcto, y el modelo acababa aprendiendo a engañar al evaluador (DeepSeek-AI, 2025). Hay una tercera vía, que es probar. Desde cada paso intermedio se lanzan varias continuaciones y se mide cuántas acaban bien, y el mérito de un paso es cuánto sube esa proporción (Kazemnejad et al., 2024). No hace falta un juez de pasos, solo el verificador final y mucho más cómputo. La figura 8 lo cuenta con una jugada de fútbol.

Figura 8 Una jugada que acaba en gol. Con solo el resultado final, todas las acciones reciben el mismo mérito. Un comentarista que puntúa cada acción necesita saber qué es una buena jugada, y puede equivocarse. Repetir el resto de la jugada muchas veces desde cada momento, y contar cuántas acaban en gol, encuentra las acciones que importaron, pero con pocas repeticiones sale ruidoso y con muchas cuesta caro.

El tercero es que dependemos de entornos verificables. Solo podemos entrenar así lo que se puede comprobar automáticamente, como un test que pasa, una respuesta numérica o una partida ganada. Parece un detalle técnico, pero decide hacia dónde avanza la IA. Los modelos mejoran muy deprisa justo donde hay comprobaciones baratas, como las matemáticas, la programación o los juegos, y mucho más despacio donde no las hay, como escribir bien, investigar o negociar. El resultado es una inteligencia muy desigual, brillante en unas tareas y torpe en otras que a nosotros nos parecen igual de difíciles. Además, cuando la comprobación no captura del todo lo que queremos, el modelo aprende a satisfacer la comprobación y no el objetivo, que es otra forma de reward hacking. Por eso construir buenos verificadores y buenos entornos se ha vuelto uno de los trabajos más importantes del campo.

En mi opinión, estos dos últimos problemas son el mismo visto desde dos lados. Si supiéramos verificar cada paso intermedio, tendríamos recompensas parciales. Como solo sabemos verificar el resultado final, y solo en algunas tareas, nos quedamos con recompensas escasas, o con pagar en cómputo lo que no sabemos verificar, y con tareas cuyo resultado se puede comprobar. Justo lo contrario de lo que hace falta para proponer ideas nuevas, que no vienen con un test para comprobarlas.

Lo que queda abierto

Si tuviera que resumir el camino en una frase, diría que primero enseñamos a los modelos a saber (el preentrenamiento), después a encadenar lo que saben (la CoT y el RL) y ahora intentamos que aprendan actuando (los entornos). Cada salto resolvió el problema del anterior y dejó al descubierto uno nuevo. El que tenemos delante, cómo recompensar lo que no se puede verificar, es para mí el que separa a un modelo que resuelve problemas de uno que propone ideas.

Lo desarrollaré en la próxima entrada, Lo que el post-training no enseña, porque creo que todo lo anterior cabe en una desigualdad. Si el modelo intenta cada problema GG veces y solo aprende cuando alguno de esos intentos acierta, solo puede entrenarse con lo que ya acierta, más o menos, una vez de cada GG, es decir, p≳1/Gp \gtrsim 1/G. Por debajo no hay nada que reforzar (es el borde izquierdo de la zona de aprendizaje de la figura 5), y el problema, en lugar de aprenderse, se pierde (Zhou, 2026). Casi todo lo que hoy consigue ir más allá del modelo base es, en el fondo, una manera de saltarse esa desigualdad. O se sube GG, que cuesta dinero (Hu et al., 2025), o se sube pp sin pagarlo en intentos, por ejemplo con un profesor que da pistas en el borde de lo que el modelo sabe hacer (Cai et al., 2026), con una recompensa parcial que premia pasar algunos tests antes de exigirlos todos (Sun et al., 2025) o con un mid-training que prepara al modelo antes del RL (Zhang et al., 2025). Y lo aprendido dentro de la banda puede llegar algo más lejos. Un modelo preentrenado desde cero con problemas de hasta 10 operaciones, al que se aplica RL con problemas de 11 a 14, mejora también con los de 15 a 20, donde antes no acertaba casi nunca (Zhang et al., 2025). Más lejos, sí. Distinto, todavía no.

Vista así, la demostración de Navier–Stokes no contradice nada de lo que he contado. Es esa misma cuenta llevada al extremo. AlphaEvolve ya lo había mostrado a menor escala. Un LLM que propone cambios en un programa, evaluadores automáticos y búsqueda evolutiva encontraron cómo multiplicar dos matrices complejas de 4 × 4 con 48 multiplicaciones, la primera mejora en 56 años sobre el algoritmo de Strassen en ese caso (Novikov et al., 2025). En Navier–Stokes hubo diez mil agentes en paralelo, un resultado que se puede comprobar mecánicamente y, si Buckmaster tiene razón, una línea de ataque que ya existía en trabajo humano. Si tengo razón, la creatividad de las máquinas no se va a decidir en el algoritmo de RL, sino en dos sitios mucho menos glamurosos, cuánto podemos pagar por cada intento y qué sabemos verificar. Y casi nada de lo que llamamos una buena idea viene con un verificador.

Este artículo se escribió originalmente en español, con la asistencia de modelos de IA (Claude Opus 5.5, de Anthropic).


  1. Las figuras de esta entrada son modelos de juguete. Sus números sirven para ver el mecanismo y no reproducen ningún experimento. ↩︎

Referencias

  1. Akgül, Ö. F., Kannan, R., Neiswanger, W. y Prasanna, V. (2026). Rethinking RL for LLM Reasoning: It’s Sparse Policy Selection, Not Capability Learning. arXiv:2605.06241. https://arxiv.org/abs/2605.06241
  2. Assran, M., Bardes, A., Fan, D., Garrido, Q., Howes, R. et al. (2025). V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning. arXiv:2506.09985. https://arxiv.org/abs/2506.09985
  3. Bachmann, G. y Nagarajan, V. (2024). The Pitfalls of Next-Token Prediction. En International Conference on Machine Learning. https://arxiv.org/abs/2403.06963
  4. Baker, B., Huizinga, J., Gao, L., Dou, Z., Guan, M. Y., Madry, A. et al. (2025). Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation. arXiv:2503.11926. https://arxiv.org/abs/2503.11926
  5. Balesni, M., Korbak, T. y Evans, O. (2024). Lessons from Studying Two-Hop Latent Reasoning. arXiv:2411.16353. https://arxiv.org/abs/2411.16353
  6. Brown, T. B., Mann, B., Ryder, N., Subbiah, M., Kaplan, J., Dhariwal, P. et al. (2020). Language Models are Few-Shot Learners. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2005.14165
  7. Bruce, J., Dennis, M., Edwards, A., Parker-Holder, J., Shi, Y., Hughes, E. et al. (2024). Genie: Generative Interactive Environments. arXiv:2402.15391. https://arxiv.org/abs/2402.15391
  8. Cai, P., Fang, T., Li, X., Zeng, Q., Li, G. y Chen, J. (2026). Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model. arXiv:2606.22317. https://arxiv.org/abs/2606.22317
  9. Chen, X., Xu, J., Liang, T., He, Z., Pang, J., Yu, D. et al. (2024). Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs. arXiv:2412.21187. https://arxiv.org/abs/2412.21187
  10. Chen, Y., Benton, J., Radhakrishnan, A., Uesato, J., Denison, C., Schulman, J. et al. (2025). Reasoning Models Don’t Always Say What They Think. arXiv:2505.05410. https://arxiv.org/abs/2505.05410
  11. Cui, G., Zhang, Y., Chen, J., Yuan, L., Wang, Z., Zuo, Y. et al. (2025). The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models. arXiv:2505.22617. https://arxiv.org/abs/2505.22617
  12. DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. Nature, 645, 633–638. https://arxiv.org/abs/2501.12948
  13. Dziri, N., Lu, X., Sclar, M., Li, X. L., Jiang, L., Lin, B. Y. et al. (2023). Faith and Fate: Limits of Transformers on Compositionality. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2305.18654
  14. FAIR CodeGen team (2025). CWM: An Open-Weights LLM for Research on Code Generation with World Models. arXiv:2510.02387. https://arxiv.org/abs/2510.02387
  15. Feng, G., Zhang, B., Gu, Y., Ye, H., He, D. y Wang, L. (2023). Towards Revealing the Mystery behind Chain of Thought: A Theoretical Perspective. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2305.15408
  16. Gandhi, K., Chakravarthy, A., Singh, A., Lile, N. y Goodman, N. D. (2025). Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs. arXiv:2503.01307. https://arxiv.org/abs/2503.01307
  17. Gekhman, Z., Yona, G., Aharoni, R., Eyal, M., Feder, A., Reichart, R. y Herzig, J. (2024). Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations? En Proceedings of the Conference on Empirical Methods in Natural Language Processing. https://arxiv.org/abs/2405.05904
  18. Gunjal, A., Wang, A., Lau, E., Nath, V., He, Y., Liu, B. et al. (2025). Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains. arXiv:2507.17746. https://arxiv.org/abs/2507.17746
  19. Ha, D. y Schmidhuber, J. (2018). World Models. arXiv:1803.10122. https://arxiv.org/abs/1803.10122
  20. Hafner, D., Yan, W. y Lillicrap, T. (2025). Training Agents Inside of Scalable World Models. arXiv:2509.24527. https://arxiv.org/abs/2509.24527
  21. Hu, A., Russell, L., Yeo, H., Murez, Z., Fedoseev, G., Kendall, A. et al. (2023). GAIA-1: A Generative World Model for Autonomous Driving. arXiv:2309.17080. https://arxiv.org/abs/2309.17080
  22. Hu, J., Liu, M., Lu, X., Wu, F., Harchaoui, Z. y Diao, S. (2025). BroRL: Scaling Reinforcement Learning via Broadened Exploration. arXiv:2510.01180. https://arxiv.org/abs/2510.01180
  23. Jimenez, C. E., Yang, J., Wettig, A., Yao, S., Pei, K., Press, O. y Narasimhan, K. (2024). SWE-bench: Can Language Models Resolve Real-World GitHub Issues? En International Conference on Learning Representations. https://arxiv.org/abs/2310.06770
  24. Kahn, J. (2026). OpenAI says it cracked one of math’s grand challenges. But there are troubling questions about how they did it—and what it means for us all. Fortune. https://fortune.com/2026/09/08/openai-says-it-cracked-navier-stokes-math-grand-challenge-buckmaster-accusation-cheating-intimidation-tao-lament/
  25. Kalai, A. T., Nachum, O., Vempala, S. S. y Zhang, E. (2025). Why Language Models Hallucinate. arXiv:2509.04664. https://arxiv.org/abs/2509.04664
  26. Karan, A. y Du, Y. (2025). Reasoning with Sampling: Your Base Model is Smarter Than You Think. arXiv:2510.14901. https://arxiv.org/abs/2510.14901
  27. Kazemnejad, A., Aghajohari, M., Portelance, E., Sordoni, A., Reddy, S., Courville, A. et al. (2024). VinePPO: Refining Credit Assignment in RL Training of LLMs. arXiv:2410.01679. https://arxiv.org/abs/2410.01679
  28. Kirchner, J. H., Chen, Y., Edwards, H., Leike, J., McAleese, N. y Burda, Y. (2024). Prover-Verifier Games improve legibility of LLM outputs. arXiv:2407.13692. https://arxiv.org/abs/2407.13692
  29. Kojima, T., Gu, S. S., Reid, M., Matsuo, Y. y Iwasawa, Y. (2022). Large Language Models are Zero-Shot Reasoners. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2205.11916
  30. Lambert, N., Morrison, J., Pyatkin, V., Huang, S., Ivison, H., Brahman, F. et al. (2024). Tülu 3: Pushing Frontiers in Open Language Model Post-Training. arXiv:2411.15124. https://arxiv.org/abs/2411.15124
  31. Li, K., Hopkins, A. K., Bau, D., Viégas, F., Pfister, H. y Wattenberg, M. (2023). Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task. En International Conference on Learning Representations. https://arxiv.org/abs/2210.13382
  32. Lightman, H., Kosaraju, V., Burda, Y., Edwards, H., Baker, B., Lee, T. et al. (2024). Let’s Verify Step by Step. En International Conference on Learning Representations. https://arxiv.org/abs/2305.20050
  33. Liu, M., Diao, S., Lu, X., Hu, J., Dong, X., Choi, Y. et al. (2025). ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models. arXiv:2505.24864. https://arxiv.org/abs/2505.24864
  34. Luong, T. y Lockhart, E. (2025). Advanced version of Gemini with Deep Think officially achieves gold-medal standard at the International Mathematical Olympiad. Google DeepMind (blog). https://deepmind.google/discover/blog/advanced-version-of-gemini-with-deep-think-officially-achieves-gold-medal-standard-at-the-international-mathematical-olympiad/
  35. Novikov, A., Vũ, N., Eisenberger, M., Dupont, E., Huang, P.-S., Wagner, A. Z. et al. (2025). AlphaEvolve: A coding agent for scientific and algorithmic discovery. arXiv:2506.13131. https://arxiv.org/abs/2506.13131
  36. Nye, M., Andreassen, A. J., Gur-Ari, G., Michalewski, H., Austin, J., Bieber, D. et al. (2021). Show Your Work: Scratchpads for Intermediate Computation with Language Models. arXiv:2112.00114. https://arxiv.org/abs/2112.00114
  37. OpenAI (2024). Learning to Reason with LLMs. OpenAI (blog). https://openai.com/index/learning-to-reason-with-llms/
  38. OpenAI (2026a). Finite Time Blowup for Navier–Stokes. OpenAI. https://cdn.openai.com/pdf/32d9f210-8b73-45e0-91bc-82a30aef8a9a/navier-stokes.pdf
  39. OpenAI (2026b). NavierStokesAndEuler: Lean certificates accompanying Navier–Stokes and Euler results. GitHub. https://github.com/openai/NavierStokesAndEuler
  40. Ouyang, L., Wu, J., Jiang, X., Almeida, D., Wainwright, C. L., Mishkin, P. et al. (2022). Training language models to follow instructions with human feedback. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2203.02155
  41. Pan, J., Wang, X., Neubig, G., Jaitly, N., Ji, H., Suhr, A. y Zhang, Y. (2025). Training Software Engineering Agents and Verifiers with SWE-Gym. En International Conference on Machine Learning. https://arxiv.org/abs/2412.21139
  42. Parker-Holder, J. y Fruchter, S. (2025). Genie 3: A new frontier for world models. Google DeepMind (blog). https://deepmind.google/discover/blog/genie-3-a-new-frontier-for-world-models/
  43. Press, O., Zhang, M., Min, S., Schmidt, L., Smith, N. A. y Lewis, M. (2022). Measuring and Narrowing the Compositionality Gap in Language Models. arXiv:2210.03350. https://arxiv.org/abs/2210.03350
  44. Prystawski, B., Li, M. Y. y Goodman, N. D. (2023). Why think step by step? Reasoning emerges from the locality of experience. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2304.03843
  45. Radford, A., Wu, J., Child, R., Luan, D., Amodei, D. y Sutskever, I. (2019). Language Models are Unsupervised Multitask Learners. OpenAI. https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf
  46. Shao, Z., Wang, P., Zhu, Q., Xu, R., Song, J., Bi, X. et al. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv:2402.03300. https://arxiv.org/abs/2402.03300
  47. Si, C., Yang, D. y Hashimoto, T. (2024). Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers. arXiv:2409.04109. https://arxiv.org/abs/2409.04109
  48. Si, C., Hashimoto, T. y Yang, D. (2025). The Ideation-Execution Gap: Execution Outcomes of LLM-Generated versus Human Research Ideas. arXiv:2506.20803. https://arxiv.org/abs/2506.20803
  49. Silver, D. y Sutton, R. S. (2025). Welcome to the Era of Experience. Preprint, capítulo de «Designing an Intelligence» (MIT Press). https://storage.googleapis.com/deepmind-media/Era-of-Experience%20/The%20Era%20of%20Experience%20Paper.pdf
  50. Skalse, J., Howe, N. H. R., Krasheninnikov, D. y Krueger, D. (2022). Defining and Characterizing Reward Hacking. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2209.13085
  51. Snell, C., Lee, J., Xu, K. y Kumar, A. (2025). Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. En International Conference on Learning Representations. https://arxiv.org/abs/2408.03314
  52. Stan, A. M. (2026). The mathematicians published machine-checkable proofs. OpenAI announced its result on a call with reporters. The Next Web. https://thenextweb.com/news/openai-navier-stokes-claim-verification-credit
  53. Sun, Y., Cao, Y., Huang, P., Bai, H., Hajishirzi, H., Dziri, N. y Song, D. (2025). RL Grokking Recipe: How Does RL Unlock and Transfer New Algorithms in LLMs? arXiv:2509.21016. https://arxiv.org/abs/2509.21016
  54. Vafa, K., Chen, J. Y., Rambachan, A., Kleinberg, J. y Mullainathan, S. (2024). Evaluating the World Model Implicit in a Generative Model. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2406.03689
  55. Wang, X., Wei, J., Schuurmans, D., Le, Q., Chi, E., Narang, S. et al. (2023). Self-Consistency Improves Chain of Thought Reasoning in Language Models. En International Conference on Learning Representations. https://arxiv.org/abs/2203.11171
  56. Wei, J., Wang, X., Schuurmans, D., Bosma, M., Ichter, B., Xia, F. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2201.11903
  57. Wu, F., Xuan, W., Lu, X., Liu, M., Dong, Y., Harchaoui, Z. y Choi, Y. (2025). The Invisible Leash: Why RLVR May or May Not Escape Its Origin. arXiv:2507.14843. https://arxiv.org/abs/2507.14843
  58. Xie, S., Kong, L., Dong, Y., Sima, C., Zhang, W., Chen, Q. A. et al. (2025). Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives. En International Conference on Computer Vision. https://arxiv.org/abs/2501.04003
  59. Yang, C., Zhang, X. y Chen, J. (2026). RLVR is a Kernel, Not a Function: Statistical Inference for pass@kk Crossovers. arXiv:2609.22547. https://arxiv.org/abs/2609.22547
  60. Yao, S., Zhao, J., Yu, D., Du, N., Shafran, I., Narasimhan, K. y Cao, Y. (2023). ReAct: Synergizing Reasoning and Acting in Language Models. En International Conference on Learning Representations. https://arxiv.org/abs/2210.03629
  61. Yu, Q., Zhang, Z., Zhu, R., Yuan, Y., Zuo, X., Yue, Y. et al. (2025). DAPO: An Open-Source LLM Reinforcement Learning System at Scale. arXiv:2503.14476. https://arxiv.org/abs/2503.14476
  62. Yuan, L., Chen, W., Zhang, Y., Cui, G., Wang, H., You, Z. et al. (2025). From f(x)f(x) and g(x)g(x) to f(g(x))f(g(x)): LLMs Learn New Skills in RL by Composing Old Ones. arXiv:2509.25123. https://arxiv.org/abs/2509.25123
  63. Yue, Y., Chen, Z., Lu, R., Zhao, A., Wang, Z., Yue, Y. et al. (2025). Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model? En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2504.13837
  64. Zelikman, E., Wu, Y., Mu, J. y Goodman, N. D. (2022). STaR: Bootstrapping Reasoning With Reasoning. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2203.14465
  65. Zhang, C., Neubig, G. y Yue, X. (2025). On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models. arXiv:2512.07783. https://arxiv.org/abs/2512.07783
  66. Zhao, X., Kang, Z., Feng, A., Levine, S. y Song, D. (2025). Learning to Reason without External Rewards. arXiv:2505.19590. https://arxiv.org/abs/2505.19590
  67. Zhou, C., Liu, P., Xu, P., Iyer, S., Sun, J., Mao, Y. et al. (2023). LIMA: Less Is More for Alignment. En Advances in Neural Information Processing Systems. https://arxiv.org/abs/2305.11206
  68. Zhou, T. (2026). When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion. arXiv:2607.20543. https://arxiv.org/abs/2607.20543
  69. Zuo, Y., Zhang, K., Sheng, L., Qu, S., Cui, G., Zhu, X. et al. (2025). TTRL: Test-Time Reinforcement Learning. arXiv:2504.16084. https://arxiv.org/abs/2504.16084

WELCOME · bloga · 1 entrada · 2026

Notas desded3ntrode los modelos

Intentando entender las IAs

Cada punto es una entrada de blog, navega las nubes de puntos para saber más, o scrollea hacia abajo.

Pasa sobre un punto: verás a qué atiendeArrastra para girarBaja para el índice

Índice

Todas las entradas

Pasa por una entrada para ver a qué otras atiende. La línea de luz bajo cada título es su peso de atención, en el color de su canal.

  1. t01

    El camino de las IA hacia la «inteligencia»

    Del modelo que predice la siguiente palabra al agente que actúa en un entorno. Qué resolvió cada salto y qué dejó sin resolver.

    Urdina2026.09.2631 min

Esta web: three.js y GSAP. Letra: Archivo, Spectral e IBM Plex Mono. Base en blanco y negro con grano; el color marca el canal de cada entrada: azul, rojo o violeta. La atención entre entradas es softmax(−‖q − k‖² / τ) con τ = 0,5. Inspirada en Mitoaroa 3, de Zetak.