Llevo semanas mirando qué pasa dentro de un modelo de 7B cuando resuelve problemas de aritmética. En muchas trazas aparece una frase del tipo «espera, déjame comprobarlo», seguida de una corrección. Parece razonamiento. La pregunta es si el modelo corrige algo o solo representa que corrige.[1]
Qué medimos
Leemos la respuesta final desde el flujo residual en cada posición, con una sonda lineal entrenada aparte (Alain y Bengio, 2016). Si el modelo de verdad revisa, la respuesta debería aparecer después del «espera».
La respuesta es legible varios tokens antes de la duda. El texto de revisión llega tarde.
El modelo no duda: interpreta a alguien que duda.
Los números de esta entrada son de ejemplo. ↩︎
Referencias
- Alain, G. y Bengio, Y. (2016). Understanding intermediate layers using linear classifier probes. arXiv:1610.01644. https://arxiv.org/abs/1610.01644
- Belinkov, Y. (2022). Probing Classifiers: Promises, Shortcomings, and Advances. Computational Linguistics, 48(1), 207–219.