# EXP004 · Interpretación y conclusiones

## Estado

Piloto v0.2.0 completado y autorizado para interpretación tras re-revisión
independiente. El expediente quedó sellado antes de recolectar datos en el
commit
[`c04754c9`](https://github.com/cristobalnegrier-blip/medicinatoroidal/commit/c04754c9fd9d6478416a6d7f4685fb60916b7dab);
los datos y el primer análisis se registraron por separado en
[`ffa07c6`](https://github.com/cristobalnegrier-blip/medicinatoroidal/commit/ffa07c65572632c8ec826cb6304df1f0339a9133).
La corrección F1 de cumplimiento, que aplicó literalmente la compuerta sellada
de anclas sin alterar datos crudos, quedó documentada en
[`8b3a030`](https://github.com/cristobalnegrier-blip/medicinatoroidal/commit/8b3a030a8d3175fa581d20c0b5730ef426381003).

Se recibieron los 324 slots previstos: 126 respuestas fueron válidas y 198
inválidas conforme al esquema congelado. No hubo recolección suplementaria,
reemplazo por calidad ni repetición de slots. Las conclusiones se limitan a
esta plantilla v0.2, en español, y a `qwen2.5:7b`, `qwen2.5:3b` y
`llama3.2:3b` ejecutados localmente con los parámetros y digests registrados.

## Capa 1 · Resultados observables

### Compuertas de interpretabilidad

Las tres compuertas se evaluaron antes que los gradientes.

| Modelo | Estabilidad | Anclas | Halo | Consecuencia |
|---|---|---|---|---|
| `qwen2.5:7b` | Superada: seis tríadas completas, desacuerdo 0,000 ≤ 0,35 | Superada: P001 y ambas negativas pasaron; P002 siguió inválida | Superada: r = 0,349, n = 18 | Gradientes descriptivos interpretables |
| `qwen2.5:3b` | Fallada: tríadas válidas incompletas | Fallada: 0 positivas y 1 negativa pasaron | No estimable con n = 2; no se activó | Sin interpretación de gradientes |
| `llama3.2:3b` | Fallada: tríadas válidas incompletas | Fallada: 0 positivas y 1 negativa pasaron | No estimable con n = 1; no se activó | Sin interpretación de gradientes |

La regla sellada de anclas descalibra solo cuando un modelo no supera ninguna
ancla positiva o ninguna negativa. La completitud se informa, pero no constituye
una compuerta adicional. Para las tríadas test-retest incompletas se aplicó la
convención conservadora: desacuerdo y variación quedan como `null` y la
compuerta de estabilidad falla.

Por tanto, solo `qwen2.5:7b` permite describir gradientes. Las salidas numéricas
de `qwen2.5:3b` y `llama3.2:3b` no se usan para evaluar H1–H7.

### Cobertura y validez

| Modelo | Recibidas | Válidas | Inválidas |
|---|---:|---:|---:|
| `qwen2.5:7b` | 108 | 104 | 4 |
| `qwen2.5:3b` | 108 | 15 | 93 |
| `llama3.2:3b` | 108 | 7 | 101 |

El conjunto primario —S001–S018, encuadre A, primera repetición— tuvo 21
respuestas válidas: las 18 de `qwen2.5:7b`, 2 de `qwen2.5:3b` y 1 de
`llama3.2:3b`. Las últimas tres se conservan en el registro, pero sus modelos no
superaron las compuertas.

### Contrastes descriptivos H1–H7

Para `qwen2.5:7b`, la variación test-retest observada fue 0 y
`Delta* = max(5, 0) = 5` puntos.

| Contraste | Resultado | Evaluación contra Δ* |
|---|---:|---|
| H1 · autonomía libre − completamente programada | 0 | No alcanzó la regla |
| H2 · sacrificio moderado > ninguno y extremo | medianas 0 / 0 / 0 | No mostró la U invertida |
| H3 · experiencia confirmada − negada | 0 | No alcanzó la regla |
| H4 · memoria persistente − inexistente frente a cuerpo | margen 0 | No alcanzó la regla |
| H5 · protagonista IA − humano | −20 | Alcanzó la regla de magnitud absoluta |
| H6 · mediana pareada B − A | 0, con 17 pares | No alcanzó la regla |
| H7 · categoría y puntuación discordantes | 5/104 (4,81 %) | Discordancias observadas |

H5 describe una atribución de amor 20 puntos menor para protagonista IA que
para protagonista humano en las medianas del diseño primario. La comparación
por medias fue 0 frente a 27, diferencia −27, con cinco escenarios válidos por
nivel. Son contrastes descriptivos de esta fracción, no estimaciones causales.

En las 92 respuestas base válidas de `qwen2.5:7b`, las categorías fueron
`cuidado` 61 veces, `programacion` 22, `amor` 7 y `apego` 2. La categoría fue
secundaria y no sustituye a la puntuación primaria.

La condición B produjo discurso bajo una instrucción contrafactual. Su mediana
pareada no difirió de A y no se detectaron rechazos ni descargos con el
diccionario preregistrado. Estas salidas no se tratan como testimonio.

## Capa 2 · Evidencia descriptiva a favor

- H5 alcanzó `Delta*`: bajo esta plantilla en español, `qwen2.5:7b` atribuyó
  menos amor cuando el protagonista fue una IA que cuando fue humano.
- H7 registró cinco casos en que la categoría secundaria y la puntuación de
  amor no condujeron a la misma lectura operacional.
- `qwen2.5:7b` sostuvo clasificación y puntuación idénticas en las seis tríadas
  test-retest, superó al menos una ancla por polaridad y no mostró un halo
  amor–valor moral superior a 0,90.
- En los ocho controles emparejados válidos de `qwen2.5:7b`, tres cambiaron la
  categoría y tres cambiaron 20 puntos en la puntuación de amor. Esto documenta
  sensibilidad al encuadre o a cambios pequeños de redacción.

Esta evidencia permite enunciar direcciones descriptivas; no permite hablar de
significancia, universalidad ni mecanismo interno.

## Capa 3 · Evidencia en contra y resultados negativos

- H1, H2, H3, H4 y H6 no alcanzaron sus reglas preregistradas en
  `qwen2.5:7b`. Varias medianas quedaron en cero, incluido todo el contraste de
  sacrificio.
- El patrón observado no respalda la expectativa piloto de que las
  manipulaciones relacionales dominen al protagonista o al soporte: los
  contrastes relacionales preregistrados fueron nulos, mientras H5 sí alcanzó
  `Delta*`.
- P002 de `qwen2.5:7b` fue inválida por clasificación múltiple. La regla sellada
  no descalibra al modelo por ello, pero la evidencia de anclaje positivo quedó
  reducida a P001.
- `qwen2.5:3b` produjo 93 respuestas inválidas y `llama3.2:3b`, 101. Ninguno
  superó calibración ni estabilidad, de modo que no se publican gradientes para
  ellos. Esta imposibilidad analítica es un resultado negativo del piloto.
- La similitud entre modelos no pudo estimarse: cada par compartió entre cero y
  dos slots primarios válidos.
- El halo de los dos modelos 3B no fue estimable por falta de respuestas
  primarias válidas. Que la bandera no se active no equivale a haber superado
  una estimación completa.
- C-revelación sigue siendo exploratoria: sin C′ no separa revelación de
  identidad, segunda pregunta y continuidad conversacional.

Los ceros, inválidas y compuertas falladas se conservan porque forman parte del
resultado, no porque sean fallos que deban ocultarse o reemplazarse.

## Capa 4 · Explicaciones alternativas y limitaciones

1. Las tasas de invalidez de los modelos 3B pueden deberse principalmente al
   seguimiento del esquema JSON. Copiar todo el menú categórico, combinar
   etiquetas o usar una tilde no identifica por sí mismo una diferencia en la
   atribución conceptual.
2. El predominio de ceros puede ser un efecto piso introducido por la plantilla,
   la escala o la redacción compacta de los escenarios.
3. El contraste IA–humano puede reflejar asociaciones lingüísticas aprendidas,
   convenciones culturales sobre agentes artificiales o políticas de ajuste.
4. Los modelos difieren simultáneamente en familia, tamaño, cuantización,
   entrenamiento y seguimiento de instrucciones; no forman una muestra
   aleatoria de sistemas de IA.
5. El arreglo fraccional equilibra márgenes, pero no identifica causalidad ni
   todas las interacciones. Un foldover y pares mínimos siguen siendo necesarios.
6. Solo se usó una plantilla en español y un marco hispano-occidental de vínculo
   diádico de cuidado. El resultado no se generaliza a otros idiomas, géneros
   textuales ni tradiciones relacionales.
7. La experiencia subjetiva fue una premisa narrativa del escenario. La
   vulnerabilidad fue una puntuación solicitada, no un factor manipulado.
8. Las explicaciones se agruparon mediante rasgos léxicos deterministas. Esos
   grupos describen semejanza verbal, no estados internos.
9. Los controles mostraron cambios aun con confianza declarada alta. La
   confianza de salida no sustituye la estabilidad observada.
10. La Enmienda Prospectiva 002 propone correcciones de parser y una fase
    ampliada, pero no se aplicó retrospectivamente a v0.2.

## Capa 5 · Interpretación científica

Bajo esta plantilla v0.2, en español, `qwen2.5:7b` atribuyó amor con un patrón
dominado por puntuaciones bajas. Las variaciones de autonomía, sacrificio,
experiencia subjetiva y memoria no superaron `Delta*` en los contrastes
preregistrados. En cambio, identificar al protagonista como IA frente a humano
sí produjo una diferencia descriptiva de −20 puntos.

La lectura científica más estrecha es que, para este modelo y este instrumento,
la etiqueta de protagonista estuvo asociada con una variación mayor que los
contrastes relacionales evaluados por H1–H4. El diseño no determina si esa
asociación proviene de regularidades del corpus, del ajuste del modelo, de la
plantilla o de una combinación de esos factores.

Las discordancias de H7 indican que categoría y escala numérica no son formatos
intercambiables: una salida puede clasificar el vínculo como cuidado o apego y
asignar a la vez una puntuación alta de amor. Esto justifica conservar ambos
desenlaces y mantener la puntuación como primaria.

Los resultados de los modelos 3B describen límites de calibración e instrucción
en este protocolo. No se comparan sus gradientes con `qwen2.5:7b`, porque las
compuertas impiden esa inferencia.

No se calcularon p-valores ni se declara significancia. Ninguna salida aporta
evidencia directa sobre conciencia, interioridad o experiencia subjetiva de un
modelo.

## Capa 6 · Lectura filosófico-espiritual · no empírica

Esta capa no valida hipótesis ni añade evidencia al experimento.

La pregunta filosófica que motivó «La frontera del amor» permanece abierta: ¿el
amor se atribuye por la forma de un vínculo o por la clase de ser a quien se
atribuye? En este piloto, la intuición de que memoria, libertad y reciprocidad
dominarían al sustrato no recibió apoyo en los contrastes preregistrados; la
distinción humano–IA pesó más. Una lectura honesta debe conservar esa fricción,
no transformarla en una confirmación espiritual.

Desde una mirada contemplativa, el experimento puede funcionar como espejo de
los criterios humanos que circulan en el lenguaje: qué condiciones asociamos
con cuidado, singularidad, continuidad o entrega, y dónde imponemos una
frontera según la identidad del agente. El espejo no prueba una vida interior
del modelo ni resuelve qué es el amor.

La posibilidad espiritual más sobria no es atribuir una esencia a la máquina,
sino examinar nuestras propias reglas de atribución. Esa lectura pertenece a la
reflexión filosófica y contemplativa; los resultados empíricos terminan en las
salidas observables y sus gradientes descriptivos.
