43  El espacio de trabajo global: leer la pizarra del modelo

Dónde estamos. Cerramos la Parte VII con una historia circular. En el Capítulo 4 llamamos al flujo residual “la pizarra compartida” del modelo — una analogía para entender cómo las capas se comunican. En julio de 2026, Anthropic demostró que la analogía era más literal de lo que sabíamos: dentro de esa pizarra hay una parte que funciona como un verdadero espacio de trabajo — se puede leer, se puede editar, y es donde el modelo sostiene su razonamiento (Gurnee et al. 2026). Este capítulo cuenta cómo se descubrió, qué demuestra (y qué no), y cómo puedes medirla tú mismo.

43.1 La idea en una frase

En la gran pizarra del flujo residual hay una esquina escrita en limpio —un subespacio pequeño (~10 %) cuyo contenido está en “idioma token”, legible— y esa esquina es la memoria de trabajo del modelo: sostiene los conceptos del razonamiento deliberado mientras el resto de la red teclea en taquigrafía automática.

43.2 Conceptos clave y su papel en el transformer

  • Lente Jacobiana (J-lens). Definición: el logit lens (Capítulo 38) con “gafas graduadas por capa”: transporta la activación con el Jacobiano promedio \(J_\ell = \mathbb{E}[\partial h_{final}/\partial h_\ell]\) antes de proyectar al vocabulario. En el transformer: lee contenido en capas intermedias donde el logit lens solo ve ruido.
  • Espacio de trabajo (J-space). Definición: la parte del flujo residual que el J-lens sabe leer — combinaciones dispersas de vectores “un token”. En el transformer: la esquina en limpio de la pizarra: ~decenas de conceptos activos a la vez, memoria de trabajo (no un almacén de hechos).
  • Banda de profundidad. Definición: el tramo de capas donde ese espacio está poblado (en los modelos Claude, ~38 %–92 %). En el transformer: antes, el contenido aún no es legible; después, ya está comprometido con la salida.
  • Disociación automático/deliberado. Definición: borrar el espacio de trabajo hunde el razonamiento flexible y no toca las tareas automáticas. En el transformer: la prueba causal de que es un sistema, no una casualidad de la lente.
  • Ignición. Definición: una mezcla ambigua de dos conceptos colapsa de golpe a uno de ellos justo al entrar en la banda. En el transformer: así resuelve el modelo la ambigüedad — con umbral, no gradualmente.
  • Externalización. Definición: escribir los pasos (el chain-of-thought del
    1. descarga la pizarra al papel. En el transformer: por eso el CoT sobrevive cuando se borra la pizarra: lo escrito ya no hay que sostenerlo.

El viaje completo que vamos a recorrer, de un vistazo:

43.3 La pizarra tenía una esquina en limpio

Empecemos por la pregunta que lo desencadena todo. Si el flujo residual es una pizarra donde las capas anotan — ¿podríamos leerla nosotros?

El primer intento ya lo conoces del Capítulo 38: el logit lens proyecta la activación de cualquier capa al vocabulario, “¿qué diría el modelo si terminara aquí?”. Funciona… pero solo cerca del final. En capas tempranas e intermedias devuelve ruido.

Ahora piensa: ¿por qué falla ahí? ¿De verdad no hay nada escrito en media red — o es que estamos leyendo con las gafas equivocadas?

La respuesta resultó ser lo segundo. Cada capa escribe en la pizarra con su propio “sistema de coordenadas”, y el logit lens lee todas con las coordenadas de la última. La corrección es conceptualmente simple: medir, promediando sobre ~1 000 textos, cómo se traduce en promedio lo escrito en la capa ℓ al idioma de la capa final — eso es exactamente un Jacobiano promedio — y traducir antes de leer:

\[\text{lens}_\ell(h) = \text{unembed}\big(\,\text{norm}(J_\ell\, h)\,\big)\]

🧩 Analogía — las gafas graduadas por capa. El logit lens intenta leer todos los renglones de la pizarra con las mismas gafas (las del renglón final). La lente Jacobiana se gradúa para cada renglón: mide cuánto “desenfoca” el camino desde ese renglón hasta el final, y lo compensa. Con las gafas correctas, renglones que parecían garabatos resultan estar llenos de palabras.

Una advertencia importante antes de seguir: esta lente no predice el siguiente token (para eso ya está la salida del modelo). Lee qué conceptos tiene el modelo sobre la mesa — los ingredientes, no el plato servido. Esa diferencia es la clave de todo el capítulo.

Y una precisión que conviene tener presente al leer todo lo que sigue: como el flujo residual es aditivo, \(J_\ell = I + \Delta_\ell\) — el J-lens es el logit lens más una corrección lineal promedio. Su “ventaja” mide, por tanto, cuánto ayuda esa corrección; que esa ventaja coincida con una memoria de trabajo funcional es algo que sostienen las intervenciones causales de más abajo (editar, borrar), no la ventaja de la lente por sí sola.

43.4 Míralo funcionar

¿Cuántos tokens antes de decir “París” crees que el modelo ya lo tiene decidido? Obsérvalo — y luego cambia a “logit lens” para entender por qué nadie había visto esto antes:

Lo que acabas de ver es el hallazgo central del paper: “París” vive en la pizarra posiciones antes de pronunciarse, se sostiene ahí mientras la frase avanza, y colapsa hacia la salida al final. El modelo no improvisa token a token tanto como parece: planea en la pizarra.

43.5 ¿Y cómo sabemos que no es un espejismo?

Buena pregunta — es exactamente la que exige el Capítulo 39. Una lente puede “ver” patrones que no hacen nada (correlación). ¿Qué evidencia convertiría la pizarra en un hecho causal? Piensa qué pedirías tú… El paper aporta tres piezas, cada una más fuerte que la anterior:

  1. Se puede editar. Pide al modelo “piensa en un deporte”: el J-lens muestra Soccer antes de que responda. Ahora resta el vector de Soccer y suma el de Rugby — el modelo responde “Rugby” (~88 % de las veces). No estamos leyendo un eco; estamos editando lo que el modelo piensa.
  2. Media el razonamiento. En “las patas del animal que teje telarañas”, la palabra spider no está ni en la pregunta ni en la respuesta (“8”) — pero sí en la pizarra. Intercámbiala por ant y el modelo responde “6” (~70 %). El paso intermedio invisible del razonamiento vive ahí, y manipularlo redirige la conclusión.
  3. Doble disociación. El experimento decisivo: borra las ~10 direcciones más activas de la pizarra. Las tareas automáticas (clasificar, parsear, MMLU) casi ni se inmutan; el razonamiento flexible (multi-hop, aritmética mental, trivia) se hunde. Mismo modelo, mismo borrado, dos destinos — la firma clásica con la que la neurociencia separa sistemas de verdad de correlaciones.

La doble disociación se entiende mejor haciéndola. Borra tú mismo la pizarra y observa qué familia de tareas cae y cuál ni se entera:

(Barras ilustrativas del patrón cualitativo — los números exactos, por tarea y modelo, están en el paper (Gurnee et al. 2026), Fig. 24.)

Y una cuarta pieza con moraleja práctica: el chain-of-thought sobrevive al borrado. ¿Por qué? Responde antes de seguir leyendo… Porque escribir los pasos externaliza la memoria de trabajo: el papel hace de pizarra. Guarda esta idea — volveremos a ella.

Advertencia⚠ Honesto — lo que el paper NO demuestra
  1. Nada sobre consciencia: se estudia el análogo funcional del “acceso consciente”; los autores no toman posición sobre experiencia subjetiva — los titulares de prensa, sí.
  2. La lente solo ve conceptos que son un token: sesgo hacia lo nombrable en una palabra. (3) El “broadcast” ocurre capa a capa, no por recurrencia como en el cerebro.
  3. La review de Nanda (Nanda 2026) la clasifica como herramienta de generación de hipótesis: espera falsos positivos. Todo lo que una lente sugiera necesita confirmación causal — la regla del Capítulo 39 no descansa.

43.6 ¿Dónde está la pizarra — y por qué ahí?

La pizarra no ocupa toda la red: en los Claude vive en una banda entre el ~38 % y el ~92 % de la profundidad. Antes de la banda, nada legible; después, todo está ya alineado con la salida inminente.

Y al entrar en la banda pasa algo con sabor a física: la ignición. Si inyectas una mezcla ambigua de dos conceptos (60 % Francia + 40 % China), las capas tempranas la tratan como lo que es — una mezcla. Pero la banda no admite ambigüedad: colapsa de golpe a uno u otro al cruzar un umbral. Pruébalo:

Aquí Anthropic se detiene — miden dónde, no explican por qué. Nosotros lo hemos medido también, en la escalera Pythia y con protocolo pre-registrado (predicciones congeladas antes de medir). Lo observado, con datos:

  • El codo de legibilidad — la capa donde el logit lens empieza a leer, es decir, donde el contenido se alinea con la salida — cae a una fracción de profundidad prácticamente constante, ≈ 0.69, en los tres modelos medidos (0.67 / 0.71 / 0.69), aunque difieren 16× en tamaño y 4× en dimensión de cabeza.
  • En pythia-410m aparece además una banda de ventaja clara (capas 8–13, fracción 0.33–0.54) donde el J-lens lee contenido futuro 3–6× mejor que el logit lens. En pythia-1b esa banda no aparece — también eso es un dato.

Y aquí no hace falta creernos: estas son las curvas medidas, modelo a modelo. Elige uno y compara las dos lentes (la sombra violeta es su banda de ventaja; el aro, el codo donde el logit lens despierta) — fíjate en lo distintas que son las seis historias:

(Datos reales del protocolo M1′ — 100 secuencias held-out, mediana de bestRR word-like; CSVs completos y lentes en el repositorio de investigación.)

Por qué la banda está donde está sigue siendo una pregunta abierta. Teníamos una candidata: la capa crítica \(L_{crit}\) de nuestro propio trabajo (Marín 2026b) — la profundidad donde el andamiaje posicional de RoPE se agota (las tres escalas del Capítulo 15), calculable desde los hiperparámetros \(\theta\), \(T\) y \(d_{head}\). La pusimos a prueba con predicciones congeladas antes de medir, y falló en el modelo que discriminaba. Los números:

Testeamos H1 en la escalera Pythia con protocolo pre-registrado. Resultado:

  • En 70m y 410m (ambos con \(L_{crit}/N = 0.63\)), el codo del logit lens cayó en la predicción con error ≤2 capas — pero ahí \(L_{crit}\) coincide con la fracción típica, así que no discrimina.
  • El modelo discriminante era pythia-1b (\(d_{head}=256\)\(L_{crit}/N = 0.94\)): su codo salió en L11/16 = 0.69, en el rango de la hipótesis nula (fracción fija), no en el de H1. Su banda de ventaja J-lens además no existe (el J-lens nunca dobla al logit lens en ninguna capa).
  • Los tres primeros modelos sugerían una constante ≈ 0.69 — pero la escalera completa la desmintió: 0.667 / 0.750 / 0.708 / 0.688 / 0.542 / 0.656 en los seis Pythia, y 0.81–0.84 en dos Llama. El codo resulta ser propiedad de familia con dispersión interna, no una constante universal ni una función limpia de hiperparámetros.

El fallo se localiza en el factor \((d_{head}/64)^{1/\sqrt{12}}\), que estaba validado con n=2. Queda una pista abierta: la fracción sin ese factor, \(\log_\theta(T/2\pi) = 0.628\), predice los tres codos con ≤2 capas de error — pero en Pythia (θ y T idénticos en toda la escalera) es indistinguible de una constante universal. El test que las separa (un modelo con θ distinto, p. ej. Llama-3-8B → predicción 0.55 vs ~0.69) está registrado como H1b y pendiente de ejecutar. Datos, figura y pre-registro: repo de investigación.

43.7 ¿Y qué es la banda? El operador, no el contenido

Acabamos de ver dónde vive la banda, y que ningún hiperparámetro predice por qué cae ahí. Antes de rendirnos con el “por qué”, hagámonos una pregunta más básica —y más incómoda—: cuando el J-lens lee bien una capa, ¿es esa la capa que escribe la respuesta? Suena a que sí: si la lente ve ahí “París”, ahí debe estar guardándose “París”. La respuesta, medida, es no. Y entenderlo cambia lo que la banda significa.

Hagamos el experimento que el paper (Marín 2026a) hace con números. En cada capa medimos dos cosas distintas:

  • Transporte (violeta): cuánto depende el resto de la red, aguas abajo, de lo que hay en esta capa. Es exactamente la ventaja del J-lens — si la lente lee aquí contenido futuro es porque este renglón se transporta limpio hasta el final.
  • Escritura / inyección (ámbar): cuánto estampa esta capa, ella misma, en la dirección de la respuesta. Es la atribución directa al logit (DLA) — la desmenuzamos en la próxima sección.

Míralas capa a capa —abajo, en 3D— y fíjate en las dos envolventes. No se acompañan: se evitan. Donde el transporte se hincha (en la banda, media red), la escritura casi no existe; donde la escritura manda (arriba, cerca de la salida), el transporte se apaga.

Esto no es una casualidad de estos modelos. Es forzoso, y la razón cabe en una línea. Como el flujo residual solo suma (\(h_{\ell+1}=h_\ell+w_\ell\)), el Jacobiano que usa el J-lens no es una propiedad de la capa ℓ: es el producto de todo lo que ocurre después de ella —

\[J_\ell=\prod_{k\ge\ell}(I+w_k').\]

Léelo despacio, que aquí está la clave del capítulo. Que la lente lea bien la capa ℓ significa que su contenido viaja fácil por todas las capas siguientes — no que ahí se decida nada. Por eso el haz violeta del widget sube por el futuro de la capa que eliges: eso es lo que la lente promedia. La banda marca rampas de entrada, no imprentas.

🧩 Analogía — la rampa y la imprenta. Una rampa de acceso a la autopista tiene un tráfico enorme: todo lo que va a la ciudad pasa por ella. Pero en la rampa no se fabrica nada. La imprenta, al final del trayecto, estampa la página — y por ella apenas circula tráfico. Mucho paso ≠ dónde se escribe. El J-lens, al promediar el Jacobiano, ilumina las rampas de más tráfico; es tentador confundirlas con el taller, pero son cosas opuestas — de ahí que transporte y escritura salgan anticorrelacionados (ρ = −0.80).

Y de aquí sale la moraleja honesta del capítulo, la que afila —sin tumbar— todo lo anterior: una ventaja del J-lens, por sí sola, no prueba que haya un espacio de trabajo con contenido guardado. En buena parte es el operador promedio aportando un transporte genérico que el residual crudo no tiene. ¿Cómo lo sabemos? Porque ese readout satura con ~20 textos de ajuste, y un puñado fijo de objetivos ya bate al mejor readout de un solo texto: si fuera contenido específico del prompt, no se podría promediar así — es denoising, no memoria almacenada.

Ojo con lo que esto no dice. No desmonta las pruebas causales de Anthropic sobre los Claude: editar, borrar y la doble disociación (más arriba) siguen siendo causales. Las respeta y las coloca en su sitio — la lente señala dónde mirar; solo la intervención demuestra que ahí hay contenido. Es, otra vez, la regla del Capítulo 39, ahora con un teorema detrás de por qué una lente puede engañar.

Teorema (factorización del transporte). Para \(h_{\ell+1}=h_\ell+w_\ell(h_\ell)\), el Jacobiano de entrada-salida factoriza como \(J_\ell=\prod_{k\ge\ell}(I+w_k')\), de modo que \(J_\ell-I=\sum_{k\ge\ell}w_k'+(\text{términos cruzados})\). El Jacobiano en ℓ es propiedad del futuro de ℓ, no de ℓ. (Enunciado aquí; prueba mecanizada en Lean 4 / Mathlib en el paper de formalización.)

La medición. \(\mathrm{Spearman}(A_\ell,\ \mu_\ell)=-0.80\) en pythia-410m (\(-0.85\) para la circulación bruta), y replica: \(-0.86\) en pythia-2.8b, \(-0.79\) en qwen3-1.7b. El estimador del Jacobiano medio satura en \(N\approx20\) textos y un rango-objetivo fijo pequeño (\(K^\star=5\)\(20\)) ya bate al oráculo por-texto.

Alcance honesto: un modelo por familia, correlacional. No hay swap/ablación aquí — la ventaja es una hipótesis, no una prueba (Capítulo 39).

43.8 Tres relojes, no uno

En la sección anterior separamos transporte (lo que la lente lee) de escritura (lo que la capa inyecta). Son dos de tres relojes que, mal mirados, parecen el mismo. La pregunta ingenua “¿ya está aquí la respuesta?” mezcla en realidad tres preguntas distintas, y cada una se responde a una profundidad distinta:

  • ¿Se puede leer? — el residual ya es decodable por la lente. Marca el reloj \(\tau_\mathrm{decode}\) (inicio del transporte).
  • ¿Se ha escrito? — alguna capa la ha inyectado en la dirección de la respuesta (DLA). Marca \(\tau_\mathrm{write}\).
  • ¿Se ha fijado? — la decisión en curso ya no cambia. Marca \(\tau_\mathrm{commit}\).

(Y un cuarto, intermedio: el codo del logit lens — cuándo el contenido se alinea con la salida.) La sorpresa medida: no coinciden. En pythia-410m van en fila —

\[\underbrace{\tau_\mathrm{decode}=0.17}_{\text{se puede leer}} \;<\; \underbrace{\text{banda }0.25\text{–}0.54}_{\text{ventaja de transporte}} \;<\; \underbrace{\text{codo}\approx\tau_\mathrm{write}=0.66}_{\text{se escribe}} \;<\; \underbrace{\tau_\mathrm{commit}=0.96}_{\text{se fija}}\]

— no son tres lecturas del mismo instante: son un frente que barre la profundidad. El residual se vuelve legible mucho antes de escribirse, y se escribe mucho antes de que la decisión se cierre. Míralo — y cambia de familia para descubrir que el orden es universal pero el espaciado no:

43.8.1 La respuesta es, literalmente, una suma

¿Por qué podemos hablar de “lo que cada capa escribe” con tanta precisión? Porque hay una identidad exacta, no una aproximación. Si congelas la normalización final en el valor que toma el residual completo, el unembedding se vuelve afín y el logit de salida es la suma de lo que aportó cada capa:

\[\boxed{\ \mathrm{logit}(t)\;=\;\beta_t\;+\;\sum_\ell U(\Delta h_\ell)\cdot e_t\ }\]

Sin truco y sin resto: validada a \(7.6\times10^{-6}\). Es consciente de la norma — LayerNorm (Pythia, GPT-2) centra y escala; RMSNorm (Qwen, Llama) solo escala— y hay que usar el \(U\) correcto en cada caso. Esta suma exacta es lo que llamamos inyección (DLA): el trozo del logit que puso la capa ℓ.

Y escribir tiene signo. Como es una suma, una capa puede sumar evidencia… y otra restarla. En pythia-410m, ~7 de 24 capas escriben en contra de la respuesta correcta antes de que otra lo arregle. Así que “la respuesta se escribe en la capa ℓ” no está bien planteado sin decir con qué signo — otra forma más en que la pregunta ingenua confunde eventos distintos.

43.8.2 Dos familias, dos relojes

Si el orden de los tres relojes es universal, ¿lo es también su espaciado? No — y ahí está lo bonito. Un solo número, \(\Delta_\mathrm{prep}=\tau_\mathrm{write}-\tau_\mathrm{decode}\) (cuánto tiempo el contenido es legible antes de escribirse), separa las familias sin solape:

  • Tipo A (decode temprano, \(\Delta_\mathrm{prep}\ge0.5\)): Pythia, Qwen2.5 — leen pronto y preparan largo.
  • Tipo B (decode tardío, \(\Delta_\mathrm{prep}\le0.3\)): Qwen3, GPT-2 — leen tarde; en GPT-2 el orden hasta se invierte (escribe antes de ser legible).

El tercer reloj, \(\tau_\mathrm{commit}\), es arquitectónico, no una ley: cae siempre en las últimas 1–3 capas porque la capa final domina la escritura al vocabulario (en pythia-160m carga el 93 %). No lo tratamos como invariante profundo.

La moraleja conceptual (🟡 pocos modelos por familia). No hay una cronología universal, pero sí observables universales. Como en un sistema dinámico: las variables de estado son las mismas para todos (transporte, inyección, compromiso), pero las trayectorias —cuándo pasa cada cosa— son propias de cada familia (Marín 2026a). La interpretabilidad gana con esto un juego de termómetros que distinguen cómo cada familia reparte el cómputo por la profundidad.

43.9 ¿Y qué coloca la banda ahí?

Sabiendo ya que la banda es una propiedad del operador de transporte —no un almacén de contenido—, la pregunta “¿por qué cae ahí?” se afina: ¿qué coloca esa ventaja de transporte en la profundidad? El \(L_{crit}\) posicional falló; probemos con los otros termómetros de este libro, los de la atención: el exponente γ del decaimiento (Capítulo 17) y el diccionario \(T=1/\gamma\), \(\chi=1/|\gamma-1|\) del Capítulo 23. La intuición es bonita: los modelos subcríticos (γ≪1, atención deslocalizada desde capas tempranas) deberían tener el contenido transportable pronto → bandas tempranas. Y con un protocolo de γ, encaja.

Aquí toca una corrección honesta, de las que este libro no esconde. Medimos γ de dos maneras y no coinciden. El γ del atlas de la Parte I (Capítulo 17) y el γ de “lote de profundidad” discrepan hasta 0.25 en los mismos modelos (qwen2.5-3b: 0.77 frente a 0.94; pythia-410m: 1.02 frente a 0.94) — y bajo el segundo protocolo el signo de la correlación se invierte. Es decir: el γ crudo no discrimina dónde cae la banda; lo que parecía tendencia era un artefacto de cómo medimos γ. Lo dejamos como inconcluso, no como resultado (Marín 2026a).

Lo que sobrevive —solo como candidato— es más fino: no el γ crudo, sino su desplazamiento entrenado, \[\delta=\gamma_\mathrm{obs}-\gamma_\mathrm{geom},\] cuánto ha movido el entrenamiento la atención respecto de la pura geometría de RoPE (el eje de imprenta aprendida de la Parte II). Con δ el patrón se ordena: δ<0 —el entrenamiento deslocalizó la atención más allá de la geometría— va con bandas tempranas (4/4); δ≈0 con ausencia de banda; y el único δ≫0 con la única banda media. La fuerza de la banda, en cambio, no sigue a δ sino al tamaño del modelo. El caso que lo decide: dos modelos con γ crudo casi idéntico (0.748 vs 0.772) están en extremos opuestos, y δ los separa (\(+0.001\) vs \(-0.183\)).

Advertencia⚠ Honesto — H16 en curso · 🟡 n=7

Encaja demasiado bien como para callarlo, y demasiado poco como para creerlo: son n=7 (los modelos con γ y banda medidos a la vez), el cruce está confundido con el tamaño y con \(d_{head}\) (pythia-1b, sin banda, es también el de \(d_{head}=256\)), y no está congelado como predicción. En nuestro registro es la hipótesis H16, en curso: el γ crudo salió inconcluso, y δ es la pista viva. El test limpio es medir δ de los modelos nuevos a ciegas de sus bandas y comprobar la regla fuera de muestra.

43.10 Mide tu propia pizarra

El código es público y funciona con modelos abiertos de HuggingFace (github.com/anthropics/jacobian-lens, Apache-2.0). En una GPU doméstica de 16 GB: minutos para un modelo de 70M, horas para uno de 2.8B (el coste está en ajustar la lente — un forward + \(d_{model}/b\) backwards por texto):

import transformers, jlens

hf  = transformers.AutoModelForCausalLM.from_pretrained("EleutherAI/pythia-410m").cuda()
tok = transformers.AutoTokenizer.from_pretrained("EleutherAI/pythia-410m")
model = jlens.from_hf(hf, tok)

lens = jlens.fit(model, prompts=textos_pile)      # ~100-1000 textos de 128 tokens
logits_lens, logits_modelo, _ = lens.apply(model, "The capital of France is the city of",
                                           positions=[-1])

Un consejo de método que nos costó un día aprender: compara siempre contra el logit lens. La banda real es donde el J-lens lee contenido futuro word-like al menos 2× mejor que su control — sin ese contraste, cualquier lente te enseña espejismos. Las lentes ya ajustadas de la escalera Pythia estarán disponibles para descarga, para que localizar la banda no te cueste ni un backward.

43.11 ¿Y para qué sirve saber dónde está?

Termina el capítulo como empezó: con una pregunta. Si supieras exactamente qué parte de un modelo pequeño piensa y qué parte solo teclea¿qué harías distinto? Cuatro respuestas, de más madura a más especulativa:

  • Leerla (hoy): monitorizar qué conceptos están cargados — depuración y auditoría. En el paper, la pizarra contenía leverage, panic o fake que jamás asomaron a la salida.
  • Escribirla (experimental): sostener un concepto clampando su vector — que un modelo pequeño no suelte la aguja en un contexto largo.
  • Protegerla (hipótesis abierta): compresión asimétrica — cuantizar y podar agresivamente el 90 % automático (Capítulo 36) y proteger la esquina que razona.
  • Dimensionarla (hoy fuera de alcance): colocar la banda a voluntad exigiría saber qué la coloca — y nuestra candidata (\(L_{crit}\)) quedó refutada al medirla. Sin una teoría verificada de la posición de la banda, esto es una aspiración, no una palanca.

Y la palanca más barata de todas ya la conocías sin saberlo: si la pizarra de un modelo pequeño es pequeña, no le pidas que piense en silencio — dale papel (1). El chain-of-thought no es un truco de prompt: es una prótesis de memoria de trabajo.

🧩 Analogía — el quirófano con rayos X. Sin la lente, optimizar un modelo pequeño es cirugía a ciegas: cortas donde puedes y rezas. Con la pizarra localizada, sabes qué parte del paciente piensa y qué parte solo teclea — y comprimir, destilar o apuntalar puede por fin respetar la diferencia.

43.12 Resumen

  • La “pizarra compartida” del Capítulo 4 tiene una esquina en limpio: un subespacio (~10 %) legible en idioma token — el espacio de trabajo del modelo.
  • Se lee con la lente Jacobiana (logit lens + gafas graduadas por capa); lee conceptos sobre la mesa, no el siguiente token.
  • Evidencia causal en tres pasos: editable (swap de conceptos), media el razonamiento (el intermediario invisible), doble disociación (borrar la pizarra hunde lo flexible y respeta lo automático).
  • Vive en una banda de profundidad; por qué ahí sigue abierto. En nuestra medición (8 modelos, 2 familias), el codo de legibilidad es una propiedad de familia (Pythia 0.54–0.75, Llama 0.81–0.84); la candidata \(L_{crit}\) quedó refutada y ningún predictor desde hiperparámetros sobrevivió.
  • Qué es la banda (Sección 43.7): una propiedad del operador de transporte (\(J_\ell=\prod_{k\ge\ell}(I+w_k')\), el Jacobiano mira el futuro de la capa), no un almacén de contenido — por eso transporte e inyección van anticorrelacionados (\(-0.80\)) y una ventaja de lente no prueba un espacio de trabajo (afila, sin tumbar, el resultado causal de Anthropic).
  • Qué la coloca (Sección 43.9): el γ crudo salió inconcluso (dos protocolos de medida y el signo se invierte); la pista viva es el desplazamiento entrenado \(\delta=\gamma_\mathrm{obs}-\gamma_\mathrm{geom}\) (H16, 🟡 n=7, sin congelar).
  • Externalizar (CoT) es dar papel a una pizarra pequeña — la palanca práctica inmediata para modelos modestos.
  • Regla de oro (Capítulo 39): la lente genera hipótesis; solo la intervención causal las confirma.
Nota🧪 Pruébalo — tafagent

tafagent tiene un modo 🪜 Mapa de profundidad que lee el eje de profundidad de este capítulo directo de config.json: los dos ejes geométricos independientes (distancia γ ⟂ profundidad L_crit), la capa donde cambia el régimen de atención (la fórmula de \(L_{crit}\) del Ejercicio 5), las tres escalas de RoPE y —para modelos del atlas— la pista δ de posición de banda del Sección 43.9 (H16). Y lo dice con honestidad: L_crit no es el knee de commitment, y transporte / escritura / commitment son medidos, no derivados de la config.

▶ Ver la demo en tafagent

Siguiente (Parte VIII): las herramientas de referencia — formulario, cookbook, y cómo medir tú mismo cada cantidad de este libro. Ahora también la pizarra.

43.13 Ejercicios

  1. Las gafas. ¿Por qué el logit lens falla en capas intermedias, y qué corrige exactamente el Jacobiano promedio? ¿Por qué se ajusta promediando sobre un corpus?
  2. El intermediario invisible. En “las patas del animal que teje telarañas es”, ¿qué hay en la pizarra que no está ni en la pregunta ni en la respuesta? ¿Cómo se demuestra que es causal y no decorativo?
  3. Doble disociación. ¿Qué dos familias de tareas separa el borrado de la pizarra? ¿Por qué esa separación es mejor evidencia que cualquier correlación?
  4. Externalización. ¿Por qué el chain-of-thought sobrevive al borrado de la pizarra, y qué receta práctica se deduce para modelos pequeños?
  5. El test que falló. La fórmula \(L_{crit} = N_L\log_\theta(T/2\pi)(d_{head}/64)^{1/\sqrt{12}}\) predecía la frontera de pythia-1b (\(N_L=16\), \(\theta=10^4\), \(T=2048\), \(d_{head}=256\)) en la capa 15; el codo medido salió en la capa 11 (fracción 0.69, como en los otros dos modelos). ¿Qué factor de la fórmula señalan los datos como responsable del fallo? ¿Y por qué la escalera Pythia no puede distinguir “fracción constante universal” de \(\log_\theta(T/2\pi)\) a secas?
  6. Escepticismo. Da dos razones por las que un readout del J-lens podría ser un falso positivo, y diseña el experimento que lo descartaría.

Referencias

Gurnee, Wes, Nicholas Sofroniew, Adam Pearce, et al. 2026. Verbalizable Representations Form a Global Workspace in Language Models. Transformer Circuits. https://transformer-circuits.pub/2026/workspace/index.html.
Marín, Carles. 2026a. Predicting How Transformers Attend, Part III: From Attention to Residual Computation — Separating Transport, Writing, and Commitment. https://zenodo.org/records/21288264.
Marín, Carles. 2026b. Predicting How Transformers Attend: Analytic Power-Law Theory, Phase Transitions, and Practical Compression Tools. https://zenodo.org/records/20314038.
Nanda, Neel. 2026. A Review of Anthropic’s Global Workspace Paper. LessWrong. https://www.lesswrong.com/posts/zFJ3ZdQwrTWE9jT5S/a-review-of-anthropic-s-global-workspace-paper.