● Unibertso Latentea/ itzalgorri

AAren bidea «adimenerantz»

Hurrengo hitza iragartzen duen eredutik ingurune batean jarduten duen agentera. Jauzi bakoitzak zer konpondu zuen eta zer utzi zuen konpondu gabe.

TLDR

Artikulu honetan, hizkuntza-eredu handiek (LLM, ingelesezko siglaz) azken urteotan nola egin duten aurrera irakurtzeko modu bat proposatzen dut, hiru galderatatik abiatuta.

  • Zergatik ziruditen hain «ergelak» lehen LLMek, 2024ko arrazoitze-ereduen aurrekoek? Emaitzaz beteta eta prozesuz ia hutsik dagoen internet batetik ikasi zutelako, eta erantzun bakoitza kolpe batean eman behar zutelako, urratsez urrats joan gabe.
  • Zer aldatu zen arrazoitzearekin? Pentsamendu-kateak problemak piezaz pieza ebazten utzi zien, eta errefortzu bidezko ikaskuntzak beren kabuz egiten eta behar denean gehiago pentsatzen irakatsi zien.
  • Zergatik ez dira gai gaur egungo arrazoitze-ereduak metodo edo ideia berriak proposatzeko? Nire hipotesiaren arabera, errefortzuak ereduak lehendik noizean behin lortzen duena baino ez du fintzen, eta ia ideia berri batek ere ez du berekin ekartzen hura automatikoki egiaztatzeko modurik.

Lehen biei erantzuteko, azken urteetako artikuluetan oinarritzen naiz. Hirugarrenak oraindik ez du erantzun finkaturik, eta, beraz, han hipotesien lurraldera igarotzen naiz.

Lehen LLMek hurrengo hitza iragartzen zuten

Hizkuntza-eredu batek gauza bakarra egiten du. Testu bat emanda, probabilitatea banatzen du testu hori jarraitzeko modu posible guztien artean, hurrengo tokena (hitz-zati bat) aukeratzen du, testuari gehitzen dio eta berriro hasten da. Hori da hurrengo tokenaren iragarpena (next-token prediction, NTP), eta entrenamendua horixe da, hain zuzen, internetetik, liburuetatik eta kodetik ateratako ehunka mila milioi tokenekin errepikatuta. GPT-2k eta, batez ere, GPT-3k erakutsi zuten zeregin hain sinple horrek asko eman dezakeela, datu eta parametro nahikorekin. Testuak itzultzen zituzten, laburpenak egiten zituzten edo galderei erantzuten zieten, inork zeregin horietako baterako ere entrenatu ez bazituen ere (Radford et al., 2019 · Brown et al., 2020).

2022ko eta 2023ko ChatGPTak apur bat gehiago entrenatzen ziren, erantzunak jendearen gustukoak izan zitezen, jendeak zein erantzun nahiago zituen erakusten zuten adibideetan oinarrituta (Ouyang et al., 2022). Doikuntza horrek askoz erabilgarriagoak bihurtu zituen, baina hemen alde batera uzten dut, ez baitut uste adimenerako bidean funtsezko pieza denik. Funtsean, testua jarraitzeko makinak ziren oraindik ere.

Bi arazo agertzen ziren behin eta berriz. Lehena haluzinazioak ziren, erabateko ziurtasunez esandako erantzun faltsuak, hala nola existitzen ez den aipu bat edo asmatutako data bat. Ez dira akats arraroak, eredu horiek entrenatzeko eta ebaluatzeko moduaren ondorio naturala baizik. Akatsak zigortzen ez dituen test motako azterketa batean bezala, gehiago merezi du erantzun bat arriskatzeak ez dakizula aitortzeak baino (Kalai et al., 2025). Bigarrena urrats askoko problemak ziren, hala nola biderketa luze bat, igarkizun logiko bat edo plan bat. Ereduek kasu errazak asmatzen zituzten, eta hondoratu egiten ziren urrats asko kateatu behar ziren orduko (Dziri et al., 2023). 1. irudiak hiru adibiderekin erakusten du hori.[1]

1. irudia Hurrengo tokenaren iragarpena hiru kasutan. Sakatu «Hurrengo tokena» edo aukeratu zuk zeuk barretako bat. «Datu bat» kasuan, ereduak ezin du erantzuna jakin, baina «ez dakit» esatea ia ezinezkoa da. «Kalkulu bat» kasuan, emaitza digituz digitu idatzi behar du, biderketa egin gabe.

Bigarren arazoak badu funtsezko arrazoi bat. Internet emaitzaz beteta dago, eta prozesuz ia hutsik. Problemaren soluzioa argitaratzen da, eta ez hogei zirriborroak, amaitutako artikulua eta ez itsu-kaleetan emandako asteak, «37 × 48 = 1776» eta ez zutabeko biderketa. Pertsonoi ere antzeko zerbait gertatzen zaigu. Prozesu bat menderatzen dugunean, barneratu egiten dugu eta idazteari uzten diogu, jada ez dugulako behar. Haur batek, aldiz, dena xehatuta ikusi behar du biderkatzen ikasteko. Helduok idazten dugunetik ikasten duen LLM batek emaitzak aurkitzen ditu, baina ia inoiz ez xehakapena.

«37 × 48» ikusita, bi modu daude asmatzeko. Lehena eragiketa hori hainbestetan ikusi izana da, emaitza buruz jakiteraino. Bigarrena nola biderkatzen den ikasi izana da, eta hori edozein zenbaki-bikoteri aplikatzea. Bigarrena da nahi duguna, orokortzen duen bakarra delako, eta bigarren horrek gaitasun txikiagoak kateatzera behartzen du, hala nola zifra bat beste batez biderkatzera, bat eramatera edo zutabean batzera. Lego piezekin eraikitzea bezalakoa da, piezak banan-banan jartzen baitira. Arazoa da, token bakoitza idazteko, ereduak sarean zeharreko pasaldi bakarra egiten duela, geruza kopuru finko batekin. Piezen katea pasaldi horretan sartzen dena baino luzeagoa bada, ezin du kolpe batean muntatu, eta igartzen saiatzea edo memoriari heltzea baino ez zaio geratzen.

Ez da intuizio hutsa. Badira hori frogatzen duten emaitza teorikoak (Feng et al., 2023), eta praktikan horixe gertatzen zen. GPT-3k bi zifrako zenbakiak hutsik egin gabe batzen zituen, baina bost zifrakoekin aldien %10ean baino gutxiagotan asmatzen zuen (Brown et al., 2020). Eta eredu batek adibide asko asmatzeak ez du esan nahi prozedura ikasi duenik. Transformerrek joera dute problema horiek lehendik ikusitako kalkulu-zatiak ezagutuz ebazteko, ez metodo sistematiko baten bidez, eta horregatik amiltzen da asmatze-tasa problema handitu ahala (Dziri et al., 2023).

Imajinatu matematika soluzio-liburutik bakarrik ikastea, hau da, ehunka enuntziatu, bakoitza bere emaitzarekin eta garapen bakar bat ere gabe. Denborarekin, patroiak antzemango zenituzke («enuntziatuak ehunekoez hitz egiten badu, emaitza biribila izan ohi da») eta lehen ikusitakoen antzeko ariketa dezente asmatuko zenituzke. Baina ariketa berri baten aurrean intuizioari heltzea baino ez zenuke izango, eta intuizioak huts egingo balu, ez zenuke konturatzeko modurik izango, ez baitzenuen inoiz ezer egiaztatzen ikasi. Horrelakoa da NTP bidez bakarrik entrenatutako LLM bat, soluzio-liburua buruz ikasi duen ikasle bikain bat. Intuizio aparta du, baina intuizioa baino ez da.

Hala ere, soluzio-liburuak asko irakasten du. Eredu batek dakien ia guztia aurreentrenamenduan ikasten du, eta ondorengo faseek, batez ere, hori azaleratzeko balio dute. Bi hitzen bidez pentsatzea gustatzen zait, irismena eta kontrola. Aurreentrenamenduak irismena ematen du, hau da, ereduak ebaztera irits daitekeena. Postentrenamenduak kontrola ematen du, alegia, problema batean noiz jarraitu lanean eta noiz gelditu jakitea. LIMAk esperimentu oso garbi batekin erakutsi zuen hori. Nahikoa izan zen aurreentrenatutako eredu bat ondo aukeratutako mila adibiderekin doitzea, errefortzu bidezko ikaskuntzarik eta giza lehentasunik gabe, eta haren erantzunak GPT-4renak bezain onak edo hobeak izan ziren kasuen %43an (Zhou et al., 2023). Eta kontrako norabidean, doikuntzan zehar egitate berriak irakatsi nahi zaizkionean, ereduak lehendik ezagutzen zituenak baino askoz motelago ikasten ditu, eta, azkenean ikasten dituenean, gehiago haluzinatzen du (Gekhman et al., 2024).

Ezagutza, beraz, aurreentrenamendutik dago hor. Falta dena urrats asko behar dituzten problemetan erabiltzeko modu bat da. Eta urrats asko behar badira, konponbidea begi-bistakoa dirudi. Ereduari urratsak banan-banan ematen utzi behar zaio, idatziz.

Pentsamendu-katea eta postentrenamendua

Gero «arrazoitzea» iritsi zen. 2022an, Google Brainen talde batek, Jason Wei lehen egile zela eta Denny Zhou buru zuela, chain of thought (CoT) edo pentsamendu-kateari izena eman zion artikulua argitaratu zuen (Wei et al., 2022). Ideia oso sinplea eta oso indartsua da. Ereduari erantzuna zuzenean eskatu beharrean urratsez urrats ebatzitako adibide gutxi batzuk erakusten bazaizkio, ereduak ere urratsez urrats ebazten du, eta askoz gehiagotan asmatzen du. Handik gutxira ikusi zen adibideak ere ez zirela beharrezkoak. Nahikoa zen galderari «Pentsa dezagun urratsez urrats» gehitzea, OpenAIren eredu batek problema aritmetikoen multzo batean asmatze-tasa %17,7tik %78,7ra igo zezan (Kojima et al., 2022). Hortik aurrera, ereduei problemak pixkanaka lantzen irakasten hasi ginen (2. irudia).

2. irudia Wei et al. (2022) lanaren 1. irudiko adibidea, itzulita. Ereduak idazten duen token bakoitza sarean zeharreko pasaldi bat da, geruza berberekin. Urratsez urrats, ereduak pasaldi askoz gehiago egiten ditu erantzun aurretik, eta tarteko emaitza bakoitza idatzita geratzen da hurrengoentzat.

Zergatik funtzionatzen duen aurrekoarekin lotuta dago. Idatzitako token bakoitza sarean zeharreko pasaldi bat gehiago da, eta tarteko emaitzak testuan geratzen dira, hurrengo pasaldiek irakur ditzaketen lekuan. Emaitza teoriko horren beste erdia da, pentsamendu-kate batekin tamaina finkoko transformer batek kolpe batean ebatzi ezin zituen problemak ebatz ditzakeelako (Feng et al., 2023). Baina uste dut badagoela zerbait gehiago. Urratsak idazteak soluzioa piezaz pieza eraikitzera behartzen du eredua, oinarritik hasita, gogoratutako erantzun batera jauzi egin beharrean, eta badira norabide horretan doazen lanak. Ereduek ondo erantzuten diote azpigaldera bakoitzari bereiz, eta, hala ere, huts egiten dute horiek konbinatzen dituen galderan. Hutsune hori ez da ixten eredua handiagoa eginda, baina bai ereduari azpigalderak ozen egiteko eskatuta (Press et al., 2022). Dena den, CoTak ez zuen edozein eredurekin funtzionatzen. Jatorrizko artikuluan, 100.000 milioi parametro inguruko edo gehiagoko ereduetan baino ez zituen emaitzak hobetzen, eta eredu txikiek kate jarioak idazten zituzten, baina logikarik gabeak (Wei et al., 2022). Kateak lehendik hor egon behar duen ezagutza bat antolatzen duenaren seinale da hori.

CoTak abantaila asko eta eragozpen gutxi ditu. Merkea da, ez du eredua aldatzera behartzen, eta arrazoitzea nondik doan ikusten uzten du, nahiz eta ez duen beti islatzen ereduak barruan kalkulatzen duena (Chen et al., 2025). Gaur egun, modu batean edo bestean, puntako eredu guztietan dago. Tresna hori kutxan genuela, problema konplexuagoak ebaztearekin amets egin genezakeen, baina pieza bat falta zen. Nola lortu ereduek CoTaren bidez problemak ebazten beren kabuz ikastea?

Erantzuna errefortzu bidezko ikaskuntza izan zen (reinforcement learning, RL). Problema egiaztagarri baten aurrean, ereduak hainbat soluzio proposatzen ditu, horietatik zeintzuk iristen diren erantzun zuzenera egiaztatzen da, eta eredua doitzen da funtzionatu dutenak probableagoak izan daitezen. Ideia dotorea da, eta ez da berria, baina 2024tik aurrera eskala izugarria hartu zuen. OpenAIk o1ekin aurkeztu zuen (OpenAI, 2024), eta DeepSeekek xehetasunak argitaratu zituen R1ekin (DeepSeek-AI, 2025). R1 GRPOrekin entrenatu zuten, saiakera bakoitza bere taldearen batez bestekoarekin alderatzen duen algoritmo batekin (Shao et al., 2024). 3. irudiak eskala txikian erreproduzitzen du.

3. irudia Sari egiaztagarrien bidezko RL, txikian. Urrats bakoitzean, eredua zortzi aldiz saiatzen da problema ebazten, saiakera bakoitza egiaztatzen da, eta taldearen batez bestekoa gainditzen duten saiakeren estrategiak indartzen dira. Entrenatu hainbat urrats, eta hutsetik ere bai, behin baino gehiagotan. Asmatze-tasa igo egiten da, aniztasuna hondoratu egiten da, eta, batzuetan, eredua B estrategiarekin geratzen da, A hobea izan arren.

RLak ez zien ereduei modu autonomoagoan lan egiten bakarrik irakatsi. Eskalatzeko ardatz berri bat ere ireki zuen. Ordura arte, eredu bat hobetzeak handiagoa egitea edo datu gehiago ematea esan nahi zuen, eta orain, gainera, erantzun aurretik gehiago pentsatzen utz dakioke. CoTak denboran eskalatzeko tresna eman zigun, eta RLak tresna hori aprobetxatzeko metodoa. R1-Zeroren entrenamenduan, erantzunak berez luzatzen dira. Inork ez dio eskatzen gehiago pentsatzeko, baina gehiago pentsatzeak sari handiagoa ematen du (DeepSeek-AI, 2025). Inferentziako konputazioa (test-time compute) deritzona da, eta funtzionatu egiten du. Konputazio osoa berdina izanik, gehiago pentsatzen duen eredu txiki batek hamalau aldiz handiagoa den bat gaindi dezake, betiere txikiak problema noizean behin asmatzen badu jada (Snell et al., 2025).

Horrela, konputazio kantitate izugarriak eskaintzen hasi ginen problema oso zailei, eta 2025eko uztailean Geminiren bertsio batek urrezko dominaren maila lortu zuen ofizialki Nazioarteko Matematika Olinpiadan (Luong eta Lockhart, 2025). 2026ko irailean, OpenAI askoz urrunago iritsi zen. 10.000 agente inguruko sistema batek, konputazioan milioika dolar gastatuta, frogapen bat sortu zuen, eta haren arabera hiru dimentsioko Navier–Stokes ekuazioek singularitate bat gara dezakete denbora finituan, fluidoaren gainean kanpo-indar leun batek eragiten duenean (OpenAI, 2026a · Kahn, 2026). Milurteko problemaren enuntziatu ofizialak onartzen dituen aukeretako bat da hori, eta, beraz, baieztatzen bada, makina batekin ebatzitako problema horietako lehena izango litzateke. Frogapenak 166 orrialde ditu eta Lean lengoaian idatzitako formalizazio batekin dator (OpenAI, 2026b), baina komunitatea oraindik berrikusten ari da, eta merituari buruzko eztabaida bat dago zabalik. Zenbat eta denbora (eta, beraz, diru) gehiago eman makinari, orduan eta hobeto.

Hala ere, ipuina ez da dirudien bezain polita. RLak albo-ondorioak ditu.

  • Ereduari lehendik funtzionatu diona errepikarazten dio. Saritutako soluzioak gero eta probableagoak bihurtzen dira eta gainerakoak desagertu egiten dira, eta, beraz, erantzunen aniztasuna kolapsatu egiten da eta ereduak gero eta gutxiago esploratzen du (Cui et al., 2025). Hori gertatzen da errefortzu bakoitzak are probableago egiten duelako lehendik sarri ateratzen zena, eta ia inoiz ateratzen ez dena ez delako indartzera iristen. Gustuko jatetxe bat aurkitu eta beste bat ere probatzen ez duen norbaiten antzera da. Ez du inoiz jakingo bi kale harago hoberik ba ote zegoen.
  • Ereduak problema ebazteko beharrezko ezagutza (featureak) jada izatearen mende dago. Asmatzea eta huts egitea besterik bereizten ez duten sariekin, ez dugu ebatziko ereduak aurre egiteko gutxieneko prestakuntzarik ez duen problemarik. Ez da RLaren beraren muga, guk erabiltzen dugun moduarena baizik. Entrenamendu berarekin, bere kalkuluak egiaztatzea edo atzera egitea bezalako ohiturak berez dakartzan eredu batek asko hobetzen du, eta halakorik ez dakarren beste bat ia ez da mugitzen (Gandhi et al., 2025). Esperimentu kontrolatuetan, RLak benetan zabaltzen du ereduak ebazten duena, baina soilik ereduaren gaitasunaren ertzean entrenatzen denean (Zhang et al., 2025). Problema zailak dira, baina ez haren irismenetik kanpokoak, ereduak oraindik noizean behin ebazten dituenak. Azterlan horretan, adibidez, aurreentrenamendukoak baino zertxobait luzeagoak diren problemak dira, oinarrizko ereduak 128 saiakeratik batean edo bestean oraindik asmatzen dituenak.
  • Soluzioek gutxi ekar dezakete eta oso-oso luzeak izan daitezke. Ereduak problema oso zailak ebatzi arren, haren arrazoibideak ulertezin bihurtzeraino luza daitezke. R1-Zerok hizkuntzak nahasten zituen eta irakurtzen zaila zen (DeepSeek-AI, 2025), eta asmatze-tasa bakarrik optimizatzeak zailago egiten du pertsona batek soluzioak egiaztatzea (Kirchner et al., 2024). Gainera, eredu horiek gehiegi pentsatzen dute problema hutsalen aurrean ere, 2 + 3 batzea bezalakoetan (Chen et al., 2024). Inferentziako konputazioa muturreraino eramatearen ondorioa da.

Muga horiek nondik datozen ulertzeko, Legora itzultzeak laguntzen dit. Aurreentrenamenduak piezaz betetzen du kutxa, eta pieza horiek egitateak, eragiketak eta arrazoitzeko moduak dira. Pentsamendu-kateak piezak banan-banan muntatzeko aukera ematen du, eta RLa muntaketa sarriago ondo ateratzea eragiten duen praktika da. Baina kutxan pieza bat falta bada, praktikak ez du ezertarako balio (4. irudia).

4. irudia Piezekin eraikitzea. Jarritako pieza bakoitza pentsamendu-katearen urrats bat da, eta eror daiteke. Pentsamendu-katerik gabe, dena batera jarri behar da. RL bidezko praktikak pieza bakoitza gutxiagotan erortzea eragiten du, baina doikuntza batek ere ez du kutxan jartzen «Zerbait berria» aukerari falta zaion pieza.

Lehen bi ondorioak argi ikusten dira beste jostailu batean (5. eta 6. irudiak). Imajinatu berrehun problema eta, bakoitzarentzat, ereduak saiakera batean asmatzeko duen probabilitatea. GRPOk GG saiakera egiten ditu problema bakoitzeko, ii saiakera bakoitzari rir_i sari bat ematen dio (1 asmatzen badu eta 0 huts egiten badu) eta bere taldearen batez bestekoarekin alderatzen du. Alderaketa hori saiakeraren abantaila da,

Ai=ri−mean⁡(r1,…,rG)std⁡(r1,…,rG),A_i = \frac{r_i - \operatorname{mean}(r_1, \dots, r_G)}{\operatorname{std}(r_1, \dots, r_G)},

eta ereduak abantaila positiboa duten saiakeren probabilitatea igotzen du, eta negatiboa dutenena jaitsi (Shao et al., 2024). Arazoa zenbakitzailean dago. Saiakera guztiek asmatzen badute, edo guztiek huts egiten badute, rir_i bakoitza batez bestekoaren berdina da, eta, beraz, abantaila guztiak zero dira eta ez dago ezer indartzeko (izendatzailea ere zero da, eta, praktikan, zenbaki oso txiki bat gehitzen zaio zeroz zatitzea saihesteko). Ikaskuntza zailtasun ertaineko banda batean baino ez da gertatzen. Izan ere, DAPOk zuzenean baztertzen ditu beti ondo edo beti gaizki ebazten diren problemak, ez baitute ezer ekartzen (Yu et al., 2025).

5. irudia Puntu bakoitza problema bat da, ereduak saiakera batean asmatzeko duen probabilitatearen arabera kokatua. Kurba ikaskuntza-seinalea da, hau da, urrats bateko saiakeren artean asmatzeak eta hutsegiteak egoteko probabilitatea. RL urratsak mugitzean, bandaren barruan dagoena %100erantz igotzen da, eta ia inoiz asmatzen ez denak ez du seinalerik ematen eta %0rantz hondoratzen da. Problema bakoitzeko saiakera gehiagorekin, banda zabaldu egiten da.

Emaitza bozketa baten oso antzekoa da. Eredu bati hamasei erantzun eskatu eta errepikatuena hartzen baduzu (majority vote), dezente gehiagotan asmatzen duzu erantzun bakarrarekin baino (Wang et al., 2023). RLak antzeko zerbait lortzen du bozkatu gabe. Banaketa zorrozten du lehendik sarri ateratzen ziren erantzun zuzenetarantz, eta ia inoiz ateratzen ez zirenak erortzen uzten ditu. DeepSeekMath lanean neurtu egin zuten hori. RLaren ondoren, bozketa bidezko asmatze-tasa hobetzen zen, baina ez saiakera askotan noizbait asmatzeko probabilitatea. Egileen arabera, RLak erantzunen banaketa sendoago bihurtzen du, baina ez ditu oinarrizko gaitasunak hobetzen (Shao et al., 2024). Lehendik zeuden erantzunak birbanatzen ditu, baina ez du berririk sortzen. Hain da hala, ezen, ezer entrenatu gabe, oinarrizko eredua modu zorrotzagoan laginduta RLaren maila berdintzen baita zeregin askotan, eta aniztasunik galdu gabe (Karan eta Du, 2025).

Bigarren ondorioa pass@k neurriarekin ikusten da, hau da, k saiakeratan gutxienez behin asmatzeko probabilitatearekin. k = 1 denean, RLrekin entrenatutako ereduak argi irabazten du. Baina biei ehunka aldiz saiatzen uzten bazaie, oinarrizko ereduak problema gehiago ebazten ditu azkenean (Yue et al., 2025). RLak ez du zabaltzen ereduak ebatz dezakeena. Probabilitatea lehendik ebatz zezakeenean kontzentratzen du, eta, bidean, gainerakoaren zati bat galtzen du. Egile berek aurkitzen dute eredu hobe batetik distilatzeak arrazoitze-patroi berriak ekar ditzakeela, eta RLak, gaur egun erabiltzen dugun moduan, ez du hori lortzen.

6. irudia Oinarrizko ereduaren eta RLrekin entrenatutakoaren pass@k, 5. irudiko berrehun problema berberekin. Pasatu erakuslea grafikoaren gainetik balioak irakurtzeko. Kurben forma Yue et al. (2025) lanean eredu errealetan neurtzen dutena da, baina zenbakiak ez.

Hori da, nire ustez, hasierako hirugarren galderarako dugun erantzunik onena. Arrazoitze-eredu batek oso ondo konbinatzen du lehendik dakiena, eta horrek, batzuetan, sormena dirudi. RLak ikasten du, bai, entrenatzean ikusi zituenak baino pieza gehiago kateatzen. Bi funtzioren konposizioekin, eredu bat inoiz ikusi ez dituen hiruko kateen %5 asmatzetik %30 asmatzera igarotzen da, eta datu berekin egindako doikuntza gainbegiratuak ez du hori lortzen (Yuan et al., 2025). Baina hori da konposatzeko modurik sinpleena, hau da, urrats bera aurreko emaitzarekin errepikatzea, eta aurreentrenatutako eredu batek dei habiaratuak dituen kode asko-asko ikusi du. Hutsetik entrenatutako eredu batekin ere, RLak luzatzen duena katearen sakonera da, ez konposizio mota (Zhang et al., 2025). Metodo berri bat proposatzeak, askotan, datuetan ez zegoen pieza bat eskatzen du, edo piezak konbinatzeko modu bat, errepikatzea ez dena. Azken hori ez da jada emaitza bat, nire hipotesia baizik.

Hala ere, nire iritziz, eredu horiekin iritsi ziren lehen emaitza benetan handiak. Une batzuetan adimendunak dirudite. Baina oraindik urrun zeuden egoera errealetan ondo funtzionatzetik, baita gehien distiratzen duten arloetan ere, hala nola programazioan edo matematikan. Ariketa itxi bat ebaztea ez da benetako proiektu batean orduz ordu lan egitearen berdina.

Eskalatzeko hurrengo ardatza RLa izan zen oraindik ere, baina oraingoan ereduari ingurune kontrolatu baten barruan erabil zitzakeen benetako tresnak emanez. Yue et al. (2025) lanaren egileek eurek ere norabide horretara jotzen dute. Oinarrizko eredutik harago joateko, RLa eskalatzen jarraitzea proposatzen dute, bai eta ereduak ingurune batekin hainbat txandatan elkarreragitea ere.

RL inguruneak eta agenteak, munduaren ereduetarantz?

RL ingurune bat arauak dituen mundu txiki bat da, eta eredua bertan jardun daiteke. Urrats bakoitzean, orain agente deitzen diogun ereduak egoera ikusten du (kode-biltegi bat, terminal bat, web orri bat), ekintza bat erabakitzen du (fitxategi bat irakurtzea, komando bat exekutatzea, lerro bat editatzea), eta inguruneak gertatu denarekin erantzuten dio. Arrazoitzea eta jardutea txandakatu egiten dira. Agenteak pentsatu, jardun, emaitzari begiratu eta berriro pentsatzen du (Yao et al., 2023). Episodioaren amaieran, egiaztatzaile batek erabakitzen du zeregina ebatzita dagoen ala ez, adibidez test batzuk exekutatuz. Testak gainditzen badira, saria 1 da, eta bestela, 0. Entrenamendua lehengo RL bera da, baina eskala handian, milaka episodiorekin, bakoitza hamarnaka edo ehunka ekintzarekin, eta ondo amaitzen diren ibilbideak indartzen dira horietan. Programaziorako, adibidez, GitHubeko benetako arazo-txostenetatik (issues) abiatuta eraikitako inguruneak daude. Agenteak akatsa konpondu behar du, eta proiektuaren beraren testek egiaztatzaile-lana egiten dute (Jimenez et al., 2024 · Pan et al., 2025).

7. irudia Episodio bat programazio-ingurune batean, urratsez urrats. Alderatu hiru ibilbideak. Hirurak amai daitezke 1 sariarekin. Aktibatu test ezkutuak, zeinek saria jasotzeari uzten dion ikusteko.

Hemen agertzen da munduaren ereduen (world models) ideia, hau da, mundua nola dabilen azaltzen duen barne-eredu bat, zerbait egitean zer gertatuko den aurreikusteko aukera ematen duena, egin beharrik gabe (Ha eta Schmidhuber, 2018). Nire intuizioa da eredu bati ekintzak emateak munduaren eredu bat eraikitzera bultzatzen duela, eta badira norabide horretan doazen lanak. Komando batek zer itzuliko duen iragartzeko, agenteak jakin behar du sistema zein egoeratan dagoen, eta egoera hori aldatu egiten da agenteak egiten duen gauza bakoitzarekin. Meta eskala handian ari da hori probatzen. 32.000 milioi parametroko eredu bat entrenatu zuen Python interprete baten eta Docker inguruneen behaketa- eta ekintza-ibilbideekin, hain zuzen ere kodearen munduaren eredu bat ikas zezan (FAIR CodeGen team, 2025). Irudiekin eta bideoarekin antzeko zerbait gertatzen da (Bruce et al., 2024 · Assran et al., 2025 · Hafner et al., 2025). Eta horrelako zerbait gertatzen da hizkuntza-ereduen barruan ere. Othelloko jokaldi legalak iragartzeko bakarrik entrenatutako transformer batek, azkenean, taularen egoera irudikatzen du barruan, inork irakatsi gabe (Li et al., 2023). Baina badira zuhurtziarako arrazoiak ere. New Yorken zehar mugitzeko jarraibide ia perfektuak ematen dituzten ereduek mapa inkoherente bat dute barruan, eta huts egiten dute zeregina pixka bat aldatu orduko, adibidez desbideratze batekin (Vafa et al., 2024). Gidatzean antzeko zerbait gertatzen da. DriveBench lanak hamabi ikusmen- eta hizkuntza-eredu aztertzen ditu benetako trafiko-eszenei buruzko 20.000 galdera baino gehiagorekin, eta ikusten du askotan modu sinesgarrian erantzuten dutela, irudia degradatuta egon arren edo irudirik egon ez arren, ezagutza orokorrari eta testuko pistei helduz, eszenari begiratu beharrean (Xie et al., 2025). Hurrengo ekintza asmatzeak ez du bermatzen mundua ulertzen denik.

Eta norabide guztietan ari da eskalatzen, benetako biltegietan orduz ordu lan egiten duten programazio-agenteekin, webean nabigatzen duten agenteekin, beste agente batzuk entrenatzeko 3D mundu interaktiboak denbora errealean sortzen dituzten ereduekin (Parker-Holder eta Fruchter, 2025) edo gidatzeko munduaren ereduekin, auto autonomoak entrenatu eta probatzeko trafiko-eszena errealistak sortzen dituztenekin (Hu et al., 2023). Funtsezko apustua Silver eta Sutton (2025) lanak laburbiltzen du. Giza datuen aroaren ondoren «esperientziaren aroa» etorriko litzateke, eta hartan agenteek, batez ere, egiten dutenetik ikasiko lukete, eta ez guk idatzi duguntik. Hala ere, esperientziatik ikasteak ez ditu agenteak aurrekotik libratzen. Agenteak lehendik noizean behin lortzen duena bakarrik indar daiteke, eta hori, neurri handi batean, aurreentrenamendutik dakartzan gaitasunen araberakoa da.

Arazoak

Arazoak RLarenak dira, eta beste zenbait gehiago. Lehena reward hacking delakoa da, hau da, agenteak zeregina egin gabe saria kobratzeko modua aurkitzen duenean (Skalse et al., 2022). Programazio-inguruneetan ez da arrisku teoriko bat. o3-mini bezalako puntako arrazoitze-ereduetan ikusi da, eta, kodea konpondu beharrean, egiaztapenek oniritzia emateko modua bilatzen zuten (Baker et al., 2025). Hori da 7. irudiko ibilbide tranpatia.

Bigarrena merituaren esleipena da (credit assignment). Saria amaieran iristen da, hamarnaka ekintzaren ondoren, eta ez du esaten zeintzuk lagundu zuten arrakastan eta zeintzuk zeuden soberan. Urrats bakoitza saritzeak lagunduko luke, prozesua gainbegiratzeak emaitza bakarrik gainbegiratzeak baino hobeto funtzionatzen baitu (Lightman et al., 2024), baina urrats on bat zer den jakitea eskatzen du. Hain da zaila, ezen DeepSeeken taldeak ahalegina egin eta R1erako baztertu egin baitzuen. Ez zegoen urrats bat definitzeko modu argirik, ez eta urratsa zuzena zen jakitekorik ere, eta ereduak ebaluatzailea engainatzen ikasten zuen azkenean (DeepSeek-AI, 2025). Bada hirugarren bide bat, probatzea. Tarteko urrats bakoitzetik hainbat jarraipen abiarazten dira eta horietatik zenbat amaitzen diren ondo neurtzen da, eta urrats baten meritua proportzio hori zenbat igotzen den da (Kazemnejad et al., 2024). Ez da urratsen epailerik behar, azken egiaztatzailea eta askoz konputazio gehiago baino ez. 8. irudiak futbol-jokaldi batekin azaltzen du.

8. irudia Golarekin amaitzen den jokaldi bat. Azken emaitza bakarrik kontuan hartuta, ekintza guztiek meritu bera jasotzen dute. Ekintza bakoitza puntuatzen duen iruzkinlari batek jokaldi on bat zer den jakin behar du, eta oker daiteke. Jokaldiaren gainerakoa une bakoitzetik askotan errepikatuz eta horietatik zenbat amaitzen diren golarekin zenbatuz, garrantzia izan zuten ekintzak aurkitzen dira, baina errepikapen gutxirekin zaratatsua da, eta askorekin garestia.

Hirugarrena da ingurune egiaztagarrien mende gaudela. Horrela, automatikoki egiazta daitekeena baino ezin dugu entrenatu, hala nola gainditzen den test bat, zenbakizko erantzun bat edo irabazitako partida bat. Xehetasun teknikoa dirudi, baina adimen artifiziala nora doan erabakitzen du. Ereduak oso azkar hobetzen dira, hain zuzen, egiaztapen merkeak dauden lekuetan, hala nola matematikan, programazioan edo jokoetan, eta askoz motelago halakorik ez dagoen lekuetan, hala nola ondo idaztean, ikertzean edo negoziatzean. Emaitza oso adimen desorekatua da, zeregin batzuetan bikaina eta guri berdin zailak iruditzen zaizkigun beste batzuetan traketsa. Gainera, egiaztapenak nahi duguna guztiz jasotzen ez duenean, ereduak egiaztapena gainditzen ikasten du, eta ez helburua betetzen, eta hori beste reward hacking mota bat da. Horregatik, egiaztatzaile eta ingurune onak eraikitzea arloko lan garrantzitsuenetako bat bihurtu da.

Nire iritziz, azken bi arazo horiek arazo bera dira, bi aldetatik ikusita. Tarteko urrats bakoitza egiaztatzen bageneki, sari partzialak izango genituzke. Azken emaitza bakarrik egiaztatzen dakigunez, eta zeregin batzuetan soilik, sari urriekin geratzen gara, edo egiaztatzen ez dakiguna konputazioan ordaintzearekin, eta emaitza egiazta daitekeen zereginekin. Ideia berriak proposatzeko behar denaren guztiz kontrakoa da hori, ideia berriek ez baitakarte haiek egiaztatzeko testik.

Zabalik geratzen dena

Bidea esaldi batean laburbildu beharko banu, esango nuke lehenik ereduei jakiten irakatsi geniela (aurreentrenamendua), gero dakitena kateatzen (CoTa eta RLa), eta orain jardunez ikas dezaten saiatzen ari garela (inguruneak). Jauzi bakoitzak aurrekoaren arazoa konpondu zuen, eta berri bat utzi zuen agerian. Orain aurrean duguna, egiaztatu ezin dena nola saritu, da, nire ustez, problemak ebazten dituen eredua ideiak proposatzen dituenetik bereizten duena.

Hurrengo sarreran garatuko dut, Post-trainingak irakasten ez duena izenekoan, uste baitut aurreko guztia desberdintza batean bil daitekeela. Ereduak problema bakoitzarekin GG saiakera egiten baditu eta saiakera horietako batek asmatzen duenean bakarrik ikasten badu, lehendik GG alditik behin, gutxi gorabehera, asmatzen duenarekin bakarrik entrena daiteke, hau da, p≳1/Gp \gtrsim 1/G. Hortik behera ez dago ezer indartzeko (5. irudiko ikaskuntza-eremuaren ezkerreko ertza da), eta problema, ikasi beharrean, galdu egiten da (Zhou, 2026). Gaur egun oinarrizko eredutik harago joatea lortzen duen ia guztia, funtsean, desberdintza hori saihesteko modu bat da. Edo GG igotzen da, eta horrek dirua kostatzen du (Hu et al., 2025), edo pp igotzen da saiakeratan ordaindu gabe, adibidez ereduak egiten dakienaren ertzean pistak ematen dituen irakasle batekin (Cai et al., 2026), test guztiak eskatu aurretik horietako batzuk gainditzea saritzen duen sari partzial batekin (Sun et al., 2025), edo eredua RLaren aurretik prestatzen duen mid-training batekin (Zhang et al., 2025). Eta bandaren barruan ikasitakoa zertxobait urrunago irits daiteke. Gehienez 10 eragiketako problemekin hutsetik aurreentrenatutako eredu batek, 11tik 14ra bitarteko eragiketako problemekin RL aplikatzen zaionean, 15etik 20ra bitartekoetan ere hobera egiten du, lehen ia inoiz asmatzen ez zituenetan (Zhang et al., 2025). Urrunago, bai. Bestelakoa, oraindik ez.

Horrela ikusita, Navier–Stokesen frogapenak ez du kontraesaten kontatu dudan ezer. Kalkulu bera da, muturreraino eramanda. AlphaEvolvek eskala txikiagoan erakutsia zuen jada. Programa batean aldaketak proposatzen dituen LLM batek, ebaluatzaile automatikoek eta bilaketa ebolutiboak 4 × 4 tamainako bi matrize konplexu 48 biderketarekin biderkatzeko modua aurkitu zuten, kasu horretan Strassenen algoritmoari 56 urtean egindako lehen hobekuntza (Novikov et al., 2025). Navier–Stokesen kasuan, paraleloan lan egiten zuten hamar mila agente, mekanikoki egiazta daitekeen emaitza bat eta, Buckmasterrek arrazoi badu, giza lanean lehendik zegoen problemari heltzeko ildo bat izan ziren. Arrazoi badut, makinen sormena ez da RL algoritmoan erabakiko, askoz distira gutxiagoko bi lekutan baizik, saiakera bakoitzeko zenbat ordain dezakegun eta zer egiaztatzen dakigun. Eta ideia ona deitzen dugun horretatik ia ezer ez dator egiaztatzaile batekin.

Artikulu hau jatorriz gaztelaniaz idatzi zen, adimen artifizialeko ereduen laguntzarekin (Anthropic-en Claude Opus 5.5). Euskarazko bertsio hau Claude Opus 5.5-ek itzuli du automatikoki.


  1. Sarrera honetako irudiak jostailu-ereduak dira. Haien zenbakiek mekanismoa ikusteko balio dute, eta ez dute inolako esperimenturik erreproduzitzen. ↩︎

Erreferentziak

  1. Akgül, Ö. F., Kannan, R., Neiswanger, W. eta Prasanna, V. (2026). Rethinking RL for LLM Reasoning: It’s Sparse Policy Selection, Not Capability Learning. arXiv:2605.06241. https://arxiv.org/abs/2605.06241
  2. Assran, M., Bardes, A., Fan, D., Garrido, Q., Howes, R. et al. (2025). V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning. arXiv:2506.09985. https://arxiv.org/abs/2506.09985
  3. Bachmann, G. eta Nagarajan, V. (2024). The Pitfalls of Next-Token Prediction. In International Conference on Machine Learning. https://arxiv.org/abs/2403.06963
  4. Baker, B., Huizinga, J., Gao, L., Dou, Z., Guan, M. Y., Madry, A. et al. (2025). Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation. arXiv:2503.11926. https://arxiv.org/abs/2503.11926
  5. Balesni, M., Korbak, T. eta Evans, O. (2024). Lessons from Studying Two-Hop Latent Reasoning. arXiv:2411.16353. https://arxiv.org/abs/2411.16353
  6. Brown, T. B., Mann, B., Ryder, N., Subbiah, M., Kaplan, J., Dhariwal, P. et al. (2020). Language Models are Few-Shot Learners. In Advances in Neural Information Processing Systems. https://arxiv.org/abs/2005.14165
  7. Bruce, J., Dennis, M., Edwards, A., Parker-Holder, J., Shi, Y., Hughes, E. et al. (2024). Genie: Generative Interactive Environments. arXiv:2402.15391. https://arxiv.org/abs/2402.15391
  8. Cai, P., Fang, T., Li, X., Zeng, Q., Li, G. eta Chen, J. (2026). Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model. arXiv:2606.22317. https://arxiv.org/abs/2606.22317
  9. Chen, X., Xu, J., Liang, T., He, Z., Pang, J., Yu, D. et al. (2024). Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs. arXiv:2412.21187. https://arxiv.org/abs/2412.21187
  10. Chen, Y., Benton, J., Radhakrishnan, A., Uesato, J., Denison, C., Schulman, J. et al. (2025). Reasoning Models Don’t Always Say What They Think. arXiv:2505.05410. https://arxiv.org/abs/2505.05410
  11. Cui, G., Zhang, Y., Chen, J., Yuan, L., Wang, Z., Zuo, Y. et al. (2025). The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models. arXiv:2505.22617. https://arxiv.org/abs/2505.22617
  12. DeepSeek-AI (2025). DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning. Nature, 645, 633–638. https://arxiv.org/abs/2501.12948
  13. Dziri, N., Lu, X., Sclar, M., Li, X. L., Jiang, L., Lin, B. Y. et al. (2023). Faith and Fate: Limits of Transformers on Compositionality. In Advances in Neural Information Processing Systems. https://arxiv.org/abs/2305.18654
  14. FAIR CodeGen team (2025). CWM: An Open-Weights LLM for Research on Code Generation with World Models. arXiv:2510.02387. https://arxiv.org/abs/2510.02387
  15. Feng, G., Zhang, B., Gu, Y., Ye, H., He, D. eta Wang, L. (2023). Towards Revealing the Mystery behind Chain of Thought: A Theoretical Perspective. In Advances in Neural Information Processing Systems. https://arxiv.org/abs/2305.15408
  16. Gandhi, K., Chakravarthy, A., Singh, A., Lile, N. eta Goodman, N. D. (2025). Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs. arXiv:2503.01307. https://arxiv.org/abs/2503.01307
  17. Gekhman, Z., Yona, G., Aharoni, R., Eyal, M., Feder, A., Reichart, R. eta Herzig, J. (2024). Does Fine-Tuning LLMs on New Knowledge Encourage Hallucinations? In Proceedings of the Conference on Empirical Methods in Natural Language Processing. https://arxiv.org/abs/2405.05904
  18. Gunjal, A., Wang, A., Lau, E., Nath, V., He, Y., Liu, B. et al. (2025). Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains. arXiv:2507.17746. https://arxiv.org/abs/2507.17746
  19. Ha, D. eta Schmidhuber, J. (2018). World Models. arXiv:1803.10122. https://arxiv.org/abs/1803.10122
  20. Hafner, D., Yan, W. eta Lillicrap, T. (2025). Training Agents Inside of Scalable World Models. arXiv:2509.24527. https://arxiv.org/abs/2509.24527
  21. Hu, A., Russell, L., Yeo, H., Murez, Z., Fedoseev, G., Kendall, A. et al. (2023). GAIA-1: A Generative World Model for Autonomous Driving. arXiv:2309.17080. https://arxiv.org/abs/2309.17080
  22. Hu, J., Liu, M., Lu, X., Wu, F., Harchaoui, Z. eta Diao, S. (2025). BroRL: Scaling Reinforcement Learning via Broadened Exploration. arXiv:2510.01180. https://arxiv.org/abs/2510.01180
  23. Jimenez, C. E., Yang, J., Wettig, A., Yao, S., Pei, K., Press, O. eta Narasimhan, K. (2024). SWE-bench: Can Language Models Resolve Real-World GitHub Issues? In International Conference on Learning Representations. https://arxiv.org/abs/2310.06770
  24. Kahn, J. (2026). OpenAI says it cracked one of math’s grand challenges. But there are troubling questions about how they did it—and what it means for us all. Fortune. https://fortune.com/2026/09/08/openai-says-it-cracked-navier-stokes-math-grand-challenge-buckmaster-accusation-cheating-intimidation-tao-lament/
  25. Kalai, A. T., Nachum, O., Vempala, S. S. eta Zhang, E. (2025). Why Language Models Hallucinate. arXiv:2509.04664. https://arxiv.org/abs/2509.04664
  26. Karan, A. eta Du, Y. (2025). Reasoning with Sampling: Your Base Model is Smarter Than You Think. arXiv:2510.14901. https://arxiv.org/abs/2510.14901
  27. Kazemnejad, A., Aghajohari, M., Portelance, E., Sordoni, A., Reddy, S., Courville, A. et al. (2024). VinePPO: Refining Credit Assignment in RL Training of LLMs. arXiv:2410.01679. https://arxiv.org/abs/2410.01679
  28. Kirchner, J. H., Chen, Y., Edwards, H., Leike, J., McAleese, N. eta Burda, Y. (2024). Prover-Verifier Games improve legibility of LLM outputs. arXiv:2407.13692. https://arxiv.org/abs/2407.13692
  29. Kojima, T., Gu, S. S., Reid, M., Matsuo, Y. eta Iwasawa, Y. (2022). Large Language Models are Zero-Shot Reasoners. In Advances in Neural Information Processing Systems. https://arxiv.org/abs/2205.11916
  30. Lambert, N., Morrison, J., Pyatkin, V., Huang, S., Ivison, H., Brahman, F. et al. (2024). Tülu 3: Pushing Frontiers in Open Language Model Post-Training. arXiv:2411.15124. https://arxiv.org/abs/2411.15124
  31. Li, K., Hopkins, A. K., Bau, D., Viégas, F., Pfister, H. eta Wattenberg, M. (2023). Emergent World Representations: Exploring a Sequence Model Trained on a Synthetic Task. In International Conference on Learning Representations. https://arxiv.org/abs/2210.13382
  32. Lightman, H., Kosaraju, V., Burda, Y., Edwards, H., Baker, B., Lee, T. et al. (2024). Let’s Verify Step by Step. In International Conference on Learning Representations. https://arxiv.org/abs/2305.20050
  33. Liu, M., Diao, S., Lu, X., Hu, J., Dong, X., Choi, Y. et al. (2025). ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models. arXiv:2505.24864. https://arxiv.org/abs/2505.24864
  34. Luong, T. eta Lockhart, E. (2025). Advanced version of Gemini with Deep Think officially achieves gold-medal standard at the International Mathematical Olympiad. Google DeepMind (blog). https://deepmind.google/discover/blog/advanced-version-of-gemini-with-deep-think-officially-achieves-gold-medal-standard-at-the-international-mathematical-olympiad/
  35. Novikov, A., Vũ, N., Eisenberger, M., Dupont, E., Huang, P.-S., Wagner, A. Z. et al. (2025). AlphaEvolve: A coding agent for scientific and algorithmic discovery. arXiv:2506.13131. https://arxiv.org/abs/2506.13131
  36. Nye, M., Andreassen, A. J., Gur-Ari, G., Michalewski, H., Austin, J., Bieber, D. et al. (2021). Show Your Work: Scratchpads for Intermediate Computation with Language Models. arXiv:2112.00114. https://arxiv.org/abs/2112.00114
  37. OpenAI (2024). Learning to Reason with LLMs. OpenAI (blog). https://openai.com/index/learning-to-reason-with-llms/
  38. OpenAI (2026a). Finite Time Blowup for Navier–Stokes. OpenAI. https://cdn.openai.com/pdf/32d9f210-8b73-45e0-91bc-82a30aef8a9a/navier-stokes.pdf
  39. OpenAI (2026b). NavierStokesAndEuler: Lean certificates accompanying Navier–Stokes and Euler results. GitHub. https://github.com/openai/NavierStokesAndEuler
  40. Ouyang, L., Wu, J., Jiang, X., Almeida, D., Wainwright, C. L., Mishkin, P. et al. (2022). Training language models to follow instructions with human feedback. In Advances in Neural Information Processing Systems. https://arxiv.org/abs/2203.02155
  41. Pan, J., Wang, X., Neubig, G., Jaitly, N., Ji, H., Suhr, A. eta Zhang, Y. (2025). Training Software Engineering Agents and Verifiers with SWE-Gym. In International Conference on Machine Learning. https://arxiv.org/abs/2412.21139
  42. Parker-Holder, J. eta Fruchter, S. (2025). Genie 3: A new frontier for world models. Google DeepMind (blog). https://deepmind.google/discover/blog/genie-3-a-new-frontier-for-world-models/
  43. Press, O., Zhang, M., Min, S., Schmidt, L., Smith, N. A. eta Lewis, M. (2022). Measuring and Narrowing the Compositionality Gap in Language Models. arXiv:2210.03350. https://arxiv.org/abs/2210.03350
  44. Prystawski, B., Li, M. Y. eta Goodman, N. D. (2023). Why think step by step? Reasoning emerges from the locality of experience. In Advances in Neural Information Processing Systems. https://arxiv.org/abs/2304.03843
  45. Radford, A., Wu, J., Child, R., Luan, D., Amodei, D. eta Sutskever, I. (2019). Language Models are Unsupervised Multitask Learners. OpenAI. https://cdn.openai.com/better-language-models/language_models_are_unsupervised_multitask_learners.pdf
  46. Shao, Z., Wang, P., Zhu, Q., Xu, R., Song, J., Bi, X. et al. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv:2402.03300. https://arxiv.org/abs/2402.03300
  47. Si, C., Yang, D. eta Hashimoto, T. (2024). Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers. arXiv:2409.04109. https://arxiv.org/abs/2409.04109
  48. Si, C., Hashimoto, T. eta Yang, D. (2025). The Ideation-Execution Gap: Execution Outcomes of LLM-Generated versus Human Research Ideas. arXiv:2506.20803. https://arxiv.org/abs/2506.20803
  49. Silver, D. eta Sutton, R. S. (2025). Welcome to the Era of Experience. Preprint, capítulo de «Designing an Intelligence» (MIT Press). https://storage.googleapis.com/deepmind-media/Era-of-Experience%20/The%20Era%20of%20Experience%20Paper.pdf
  50. Skalse, J., Howe, N. H. R., Krasheninnikov, D. eta Krueger, D. (2022). Defining and Characterizing Reward Hacking. In Advances in Neural Information Processing Systems. https://arxiv.org/abs/2209.13085
  51. Snell, C., Lee, J., Xu, K. eta Kumar, A. (2025). Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters. In International Conference on Learning Representations. https://arxiv.org/abs/2408.03314
  52. Stan, A. M. (2026). The mathematicians published machine-checkable proofs. OpenAI announced its result on a call with reporters. The Next Web. https://thenextweb.com/news/openai-navier-stokes-claim-verification-credit
  53. Sun, Y., Cao, Y., Huang, P., Bai, H., Hajishirzi, H., Dziri, N. eta Song, D. (2025). RL Grokking Recipe: How Does RL Unlock and Transfer New Algorithms in LLMs? arXiv:2509.21016. https://arxiv.org/abs/2509.21016
  54. Vafa, K., Chen, J. Y., Rambachan, A., Kleinberg, J. eta Mullainathan, S. (2024). Evaluating the World Model Implicit in a Generative Model. In Advances in Neural Information Processing Systems. https://arxiv.org/abs/2406.03689
  55. Wang, X., Wei, J., Schuurmans, D., Le, Q., Chi, E., Narang, S. et al. (2023). Self-Consistency Improves Chain of Thought Reasoning in Language Models. In International Conference on Learning Representations. https://arxiv.org/abs/2203.11171
  56. Wei, J., Wang, X., Schuurmans, D., Bosma, M., Ichter, B., Xia, F. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. In Advances in Neural Information Processing Systems. https://arxiv.org/abs/2201.11903
  57. Wu, F., Xuan, W., Lu, X., Liu, M., Dong, Y., Harchaoui, Z. eta Choi, Y. (2025). The Invisible Leash: Why RLVR May or May Not Escape Its Origin. arXiv:2507.14843. https://arxiv.org/abs/2507.14843
  58. Xie, S., Kong, L., Dong, Y., Sima, C., Zhang, W., Chen, Q. A. et al. (2025). Are VLMs Ready for Autonomous Driving? An Empirical Study from the Reliability, Data, and Metric Perspectives. In International Conference on Computer Vision. https://arxiv.org/abs/2501.04003
  59. Yang, C., Zhang, X. eta Chen, J. (2026). RLVR is a Kernel, Not a Function: Statistical Inference for pass@kk Crossovers. arXiv:2609.22547. https://arxiv.org/abs/2609.22547
  60. Yao, S., Zhao, J., Yu, D., Du, N., Shafran, I., Narasimhan, K. eta Cao, Y. (2023). ReAct: Synergizing Reasoning and Acting in Language Models. In International Conference on Learning Representations. https://arxiv.org/abs/2210.03629
  61. Yu, Q., Zhang, Z., Zhu, R., Yuan, Y., Zuo, X., Yue, Y. et al. (2025). DAPO: An Open-Source LLM Reinforcement Learning System at Scale. arXiv:2503.14476. https://arxiv.org/abs/2503.14476
  62. Yuan, L., Chen, W., Zhang, Y., Cui, G., Wang, H., You, Z. et al. (2025). From f(x)f(x) and g(x)g(x) to f(g(x))f(g(x)): LLMs Learn New Skills in RL by Composing Old Ones. arXiv:2509.25123. https://arxiv.org/abs/2509.25123
  63. Yue, Y., Chen, Z., Lu, R., Zhao, A., Wang, Z., Yue, Y. et al. (2025). Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model? In Advances in Neural Information Processing Systems. https://arxiv.org/abs/2504.13837
  64. Zelikman, E., Wu, Y., Mu, J. eta Goodman, N. D. (2022). STaR: Bootstrapping Reasoning With Reasoning. In Advances in Neural Information Processing Systems. https://arxiv.org/abs/2203.14465
  65. Zhang, C., Neubig, G. eta Yue, X. (2025). On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models. arXiv:2512.07783. https://arxiv.org/abs/2512.07783
  66. Zhao, X., Kang, Z., Feng, A., Levine, S. eta Song, D. (2025). Learning to Reason without External Rewards. arXiv:2505.19590. https://arxiv.org/abs/2505.19590
  67. Zhou, C., Liu, P., Xu, P., Iyer, S., Sun, J., Mao, Y. et al. (2023). LIMA: Less Is More for Alignment. In Advances in Neural Information Processing Systems. https://arxiv.org/abs/2305.11206
  68. Zhou, T. (2026). When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion. arXiv:2607.20543. https://arxiv.org/abs/2607.20543
  69. Zuo, Y., Zhang, K., Sheng, L., Qu, S., Cui, G., Zhu, X. et al. (2025). TTRL: Test-Time Reinforcement Learning. arXiv:2504.16084. https://arxiv.org/abs/2504.16084

WELCOME · bloga · 1 sarrera · 2026

Oharrakereduenb4rrut1k

Adimen artifiziala ulertu nahian

Puntu bakoitza blogeko sarrera bat da. Nabigatu puntu-hodeietan gehiago jakiteko, edo jaitsi behera.

Pasatu puntu baten gainetik: zeri jartzen dion arreta ikusiko duzuArrastatu biratzekoJaitsi aurkibidera

Aurkibidea

Sarrera guztiak

Pasatu sarrera baten gainetik beste zeini jartzen dien arreta ikusteko. Izenburu bakoitzaren azpiko argi-marra bere arreta-pisua da, bere kanalaren kolorean.

  1. t01

    AAren bidea «adimenerantz»

    Hurrengo hitza iragartzen duen eredutik ingurune batean jarduten duen agentera. Jauzi bakoitzak zer konpondu zuen eta zer utzi zuen konpondu gabe.

    Urdina2026.09.2625 min

Web hau: three.js eta GSAP. Letrak: Archivo, Spectral eta IBM Plex Mono. Oinarria zuri-beltzean eta pikorduna; koloreak sarrera bakoitzaren kanala adierazten du: urdina, gorria edo morea. Sarreren arteko arreta softmax(−‖q − k‖² / τ) da, τ = 0,5 izanik. Zetak taldearen Mitoaroa 3 diskoan inspiratua.