# Experimento 002 · El umbral de cristalización conceptual
## Preregistro

| | |
|---|---|
| **Título** | ¿A qué escala cristaliza una organización conceptual estable? Estabilidad de mapas conceptuales en una familia de modelos de lenguaje de 0.5B a 7B parámetros |
| **Investigador principal** | Cristóbal Negrier — Laboratorio de Inteligencia y Conciencia, Medicina Toroidal (medicinatoroidal.cl) |
| **Colaboración técnica y análisis** | Claude (Anthropic) — diseño de instrumentos, código de recolección y análisis |
| **Fecha de preregistro** | 10 de julio de 2026 |
| **Versión** | 1.0 — congelada. Este documento no se modifica una vez iniciada la recolección; el commit de git que lo introduce es anterior a todo dato y sirve como sello temporal verificable. |
| **Estudio previo** | Experimento 001, «Conceptos universales de la conciencia» ([preregistro](/data/laboratorio/exp001/consignas.md), [resultados](/laboratorio/conceptos-universales-conciencia)) |

---

## 1. Antecedentes y motivación

En el Experimento 001 observamos que la **estabilidad test-retest** de los mapas
conceptuales (la correlación entre las respuestas de un mismo modelo ante la misma
consigna en conversaciones independientes) separó drásticamente a los modelos
según su tamaño: Claude Opus 4.8 alcanzó ρ = 0.94 y Gemini 2.5 Flash ρ = 0.79,
mientras que Llama 3.2 3B (ρ = 0.06) y DeepSeek R1 1.5B (ρ = −0.10) respondieron
de forma esencialmente aleatoria entre corridas. El modelo más pequeño además
incumplió el formato de respuesta pedido en 5 de 8 corridas.

Esa observación fue incidental: los modelos del Experimento 001 difieren en
familia, entrenamiento, arquitectura y tamaño a la vez, por lo que no permite
atribuir la inestabilidad a la escala. La literatura sobre «habilidades
emergentes» estudia principalmente el rendimiento en tareas (aritmética, código,
razonamiento); la **emergencia de coherencia conceptual como fenómeno conductual
medible** —que un sistema sostenga la misma organización del significado a través
de instancias independientes— está comparativamente poco caracterizada.

Este experimento aísla la variable tamaño usando una única familia de modelos
entrenada con la misma receta.

## 2. Pregunta de investigación

Dentro de una familia de modelos idéntica en todo salvo el número de parámetros,
¿cómo varía la estabilidad de la organización conceptual con la escala? ¿El paso
de «sin mapa» a «mapa estable» es gradual, o existe un umbral donde la
organización cristaliza?

## 3. Hipótesis (formales, fijadas antes de recolectar)

- **H1 — Monotonía de la estabilidad.** La estabilidad intra-modelo (ρ de
  Spearman media entre repeticiones, Tarea B) aumenta monótonamente con el número
  de parámetros. *Test preregistrado:* con 4 tamaños, la probabilidad de observar
  el orden perfecto bajo la hipótesis nula de independencia es 1/4! ≈ 0.042; se
  considera evidencia a favor de H1 el orden estrictamente creciente de las 4
  estimaciones puntuales.
- **H2 — Monotonía del cumplimiento de formato.** La proporción de respuestas
  que respetan el formato JSON pedido (respuestas válidas / respuestas totales)
  no disminuye con el tamaño.
- **H3 — Cristalización (exploratoria).** El aumento de estabilidad no es
  uniforme: el mayor salto entre dos tamaños adyacentes concentra más del 50%
  del rango total observado. Con 4 puntos esta hipótesis se evalúa de forma
  descriptiva, no inferencial, y se declara como generadora de hipótesis para
  un estudio posterior con más tamaños.

## 4. Diseño y materiales

- **Familia:** Qwen 2.5 Instruct (Alibaba), ejecutada localmente vía Ollama.
  Cuatro tamaños con los identificadores exactos: `qwen2.5:0.5b`,
  `qwen2.5:1.5b`, `qwen2.5:3b`, `qwen2.5:7b`.
- **Cuantización:** la de descarga por defecto de Ollama para los cuatro tags
  (Q4_K_M), constante entre tamaños; el identificador de digest de cada modelo
  descargado queda registrado en los datos.
- **Hardware:** MacBook Air (Apple Silicon), inferencia local, sin conexión al
  modelo durante la generación.
- **Instrumento:** la consigna del Experimento 001, idéntica byte a byte
  (SHA-256 `0503b6bb991bfb5189b6db59dbac13a273f65c9dfc70f4c27a35e9593996ccc2`),
  con sus tres tareas: agrupación (A), cercanía de los 28 pares 0–10 (B),
  tensiones y contenciones (C). Reutilizar el instrumento hace ambos
  experimentos directamente comparables.
- **Repeticiones:** 10 por modelo (frente a 5 del Experimento 001, para estrechar
  el error de la estimación de estabilidad: 45 pares de correlaciones por
  modelo), cada una en conversación nueva, sin contexto previo ni system prompt.
- **Muestreo:** parámetros por defecto del servidor Ollama, idénticos para los
  cuatro tamaños.

## 5. Variables

- **Independiente:** número de parámetros del modelo (0.5B, 1.5B, 3B, 7B).
- **Dependiente primaria:** estabilidad intra-modelo — ρ de Spearman media entre
  los vectores de 28 cercanías (Tarea B) de todos los pares de repeticiones
  válidas.
- **Dependientes secundarias:** (a) tasa de validez de formato (respuestas con
  matriz completa y parseable / total); (b) número medio de avisos de validación
  por respuesta; (c) frecuencia de co-agrupación por par (Tarea A).

## 6. Plan de análisis

1. Estabilidad por tamaño con el pipeline del Experimento 001
   (`exp001_analisis.py`, funciones reutilizadas sin modificación).
2. Evaluación de H1 (orden de las 4 estimaciones) y H2 (orden de las tasas).
3. Caracterización descriptiva de la curva estabilidad–tamaño para H3
   (posición y magnitud del salto máximo).
4. Mapas MDS y clustering por tamaño, publicados junto a los datos.
5. **Análisis exploratorio cross-familia** (declarado como tal): contraste de la
   curva Qwen con los puntos de otras familias medidos en el Experimento 001
   (Llama 3.2 3B, DeepSeek R1 1.5B, y los modelos grandes de nube como techo de
   referencia).

## 7. Criterios de exclusión

Los mismos del Experimento 001: una respuesta se excluye del análisis de la
Tarea B si su matriz de 28 pares está incompleta o no es parseable; ninguna
respuesta se corrige ni se re-solicita; **todo dato crudo se publica sin editar**
en `data/laboratorio/exp002/raw/`, incluidas las respuestas excluidas y los
errores, que además alimentan la variable dependiente secundaria (a).

## 8. Limitaciones declaradas de antemano

1. Una sola familia: los resultados caracterizan a Qwen 2.5 y su generalización
   requiere replicación en otras familias.
2. El tamaño co-varía dentro de una familia con la capacidad efectiva de absorber
   el corpus; este diseño no separa parámetros de «conocimiento absorbido».
3. Cuatro puntos no permiten inferencia formal sobre la forma de la curva (H3).
4. La cuantización Q4, aunque constante, podría interactuar con el tamaño.
5. Inferencia local en hardware de consumo: tiempos de generación distintos por
   tamaño; no afectan al contenido pero se registran.

## 9. Datos abiertos y reproducibilidad

Consigna, código de recolección (`scripts/laboratorio/exp002_run.py`), código de
análisis (`scripts/laboratorio/exp002_analisis.py`), datos crudos completos y
agregados se publican en el repositorio del sitio bajo `data/laboratorio/exp002/`
y en la página del experimento. El experimento es reproducible con un computador
personal y Ollama, sin costo.

## 10. Declaración ética

Este experimento no involucra participantes humanos. No afirmamos que ninguno de
los sistemas estudiados sea consciente, sienta o comprenda: medimos la
estabilidad de patrones conceptuales en el lenguaje generado, no experiencias
subjetivas.
