Experimento 002

El umbral de cristalización conceptual

Ronda 1 completa · hipótesis evaluadas

¿A qué escala un modelo de lenguaje deja de improvisar y empieza a sostener una organización estable del significado? Cuatro tamaños de una misma familia, mismo instrumento, hipótesis fijadas antes de ver los datos.

De dónde nace

En el Experimento 001 los modelos grandes sostuvieron mapas conceptuales estables entre corridas (Claude ρ = 0.94, Gemini ρ = 0.79), mientras los pequeños mostraron estabilidad cercana a cero (Llama 3.2 3B ρ = 0.06, DeepSeek R1 1.5B ρ = −0.10). Como esos modelos difieren en familia, datos, arquitectura y tamaño, este experimento reduce parte de esa confusión al comparar cuatro tamaños de Qwen 2.5; la escala aún co-varía con otras diferencias arquitectónicas y de entrenamiento.

La literatura sobre «habilidades emergentes» mide rendimiento en tareas. Aquí medimos otra cosa, poco caracterizada: la emergencia de coherencia — que un sistema dibuje el mismo mapa del significado cada vez que se le pregunta.

Diseño

Una sola familia —Qwen 2.5 Instruct— en cuatro tamaños: 0.5B, 1.5B, 3B y 7B parámetros, ejecutados localmente con cuantización idéntica. Mismo instrumento del Experimento 001 (las tres tareas sobre los ocho conceptos, byte a byte, hash registrado), 10 repeticiones por tamaño en conversaciones independientes, muestreo por defecto. Todo lo demás constante; solo varía el tamaño.

El preregistro completo —hipótesis formales, plan de análisis, criterios de exclusión y limitaciones declaradas de antemano— está publicado en preregistro.md, sellado en el historial del repositorio antes del primer dato.

Hipótesis preregistradas

  1. H1 · Monotonía de la estabilidadLa estabilidad test-retest del mapa conceptual aumenta con el número de parámetros. Con 4 tamaños, el orden perfecto tiene probabilidad ≈ 0.042 bajo la hipótesis nula.
  2. H2 · Monotonía del formatoLa proporción de respuestas que respetan el formato pedido no disminuye con el tamaño.
  3. H3 · Cristalización (exploratoria)El aumento no es gradual: el mayor salto entre dos tamaños adyacentes concentra más de la mitad del rango total. Con 4 puntos se evalúa descriptivamente, como generadora de hipótesis.

Ficha de reproducibilidad

La identidad local de cada modelo quedó fijada por digest. La ficha se reconstruye automáticamente desde el protocolo, los 40 archivos crudos y el agregado de resultados.

Verificando manifiesto y artefactos…

Resultados

Recolección en curso. Esta sección se dibuja en vivo desde resultados.json a medida que los datos llegan.

Estabilidad del mapa conceptual según tamaño del modelo

ρ = correlación de Spearman media entre repeticiones (1 = mapa idéntico siempre; 0 = azar). Puntos huecos: modelos del Experimento 001 como referencia cross-familia (análisis exploratorio).

Observaciones · Ronda 1 (15 de julio de 2026)

1 · Las tres hipótesis preregistradas resultaron compatibles con los datos. La estabilidad creció estrictamente con el tamaño: ρ = 0.00 (0.5B) → 0.14 (1.5B) → 0.19 (3B) → 0.56 (7B), el orden perfecto que bajo azar tiene probabilidad ≈ 0.042 (H1). La tasa de formato respetado subió 50% → 80% → 100% → 100% (H2). Y el crecimiento no fue uniforme: el salto entre 3B y 7B (+0.37) concentra el 66% del rango total — compatible con un umbral de cristalización entre esos dos tamaños (H3, exploratoria).

2 · La convergencia cross-familia refuerza el patrón. Los modelos pequeños de otras familias medidos en el Experimento 001 caen cerca de la curva Qwen: Llama 3.2 3B (ρ = 0.06) junto al Qwen 3B, DeepSeek R1 1.5B (ρ = −0.10) bajo el Qwen 1.5B. Los modelos grandes de nube (ρ = 0.79–0.94) marcan el techo: el 7B, con ρ = 0.56, cristalizó pero aún está lejos de ese techo — la consolidación continúa a escalas mayores.

3 · La incoherencia empieza antes del contenido. El 0.5B no solo carece de mapa estable: la mitad de sus respuestas ni siquiera fueron JSON parseable. La capacidad de sostener la forma de la tarea y la de sostener su contenido emergen en ese orden — primero el formato (completo ya en 3B), después la organización conceptual (despegando en 7B).

Lectura (interpretación, separada de los datos)

Dentro de esta familia, la coherencia conceptual no aparece gradualmente ni está presente desde el inicio en miniatura: hay un tramo (hasta 3B) donde el modelo produce respuestas bien formadas pero organizadas casi al azar, y un tramo (7B) donde la misma pregunta empieza a recibir el mismo mapa. Si «tener un mapa del significado» admite grados, esta curva sugiere que el grado no se compra parejo con la escala — se concentra. Cautelas: son cuatro puntos y una familia; el diseño no separa parámetros de capacidad de absorber el corpus; y la cristalización observada es parcial (0.56 contra el techo de 0.94 de los modelos grandes). Próximos pasos naturales: extender la escalera hacia arriba (14B, 32B) para ubicar dónde la curva se aplana, y replicar en una segunda familia para descartar que el umbral sea una particularidad de Qwen. Nada de esto se afirma como definitivo: se anota, y se sigue midiendo.

Volver al Laboratorio