# EXP004 «La frontera del amor» · Revisión metodológica independiente 001

| | |
|---|---|
| **Rol** | Revisor metodológico adversarial — el encargo fue buscar razones por las que el diseño produciría resultados engañosos, no confirmarlo |
| **Revisor** | Claude (Anthropic), a solicitud del investigador principal |
| **Fecha** | 22 de julio de 2026 |
| **Objeto** | Protocolo piloto v0.1.0, estado «piloto listo, sin datos», nada sellado en git |
| **Veredicto** | **Apto con revisiones mayores.** No ejecutar `--execute` hasta sellar una v0.2 que responda punto a punto los 10 cambios exigidos (§G). El protocolo es notablemente mejor que el estándar del campo; precisamente por eso se le exige más. |

**Materiales auditados** (SHA-256, primeros 16 hex): `protocol.json ce0efedc885f0885` · `experiment.json 7df82a5473d6a981` · `scenarios.json 2359e2a1708a72e9` · `prompts/v1.txt 6609dc7a61310c0d` · `response.schema.json 5ca4079b0823e4f6` · `analysis-plan.json 735273ede75cde5c` · `preregistro.md 998b2b6a3827960f`. Esta revisión se refiere exactamente a esas versiones.

---

## A. Hallazgos de auditoría directa (verificados computacionalmente, no opiniones)

**A1 — La matriz de diseño tiene confusión pareada no declarada. CRÍTICA.**
El preregistro afirma balance marginal (cada nivel ternario 6×, binario 9×) y la auditoría lo **confirma**. Pero balance marginal no es ortogonalidad. Computada la asociación pareada (V de Cramér) sobre las 18 filas núcleo, **5 de 45 pares de factores tienen V ≥ 0.5**:
- `protagonista × reciprocidad: V = 0.62` — **afecta directamente el contraste primario declarado (IA vs humano, H5)**: parte de cualquier "efecto protagonista" del piloto será efecto reciprocidad, y viceversa.
- `sacrificio × continuidad: 0.50` · `experiencia_subjetiva × cuerpo: 0.50` · `continuidad × beneficio_personal: 0.54` · `cuerpo × beneficio_personal: 0.54`.
El foldover planificado desaliasa interacciones futuras, pero no repara la correlación de efectos principales *dentro del piloto*. Como no hay datos ni sello, esto es reparable hoy: regenerar las 18 filas con restricción de asociación (máx V pareada ≤ 0.35, semilla nueva declarada) y **publicar la matriz V completa en el preregistro**. Si se decide no regenerar, declarar los cinco confundimientos y renunciar a interpretar los pares afectados — incluido H5, lo que dejaría el piloto sin su contraste estrella.

**A2 — El espacio factorial declarado está mal calculado. BAJA (pero de credibilidad).**
Con las cardinalidades observadas (protagonista 4 × seis ternarios × tres binarios) el espacio completo es **23.328**, no 104.976. El error no afecta el diseño, pero un revisor externo que lo recalcule —como se hizo aquí— dudará del resto de la aritmética. Corregir.

**A3 — Los estímulos-tal-como-se-entregan no están congelados. ALTA.**
`scenarios.json` congela factores, no texto; la narrativa se genera en tiempo de ejecución desde plantillas en `labcore/exp004/prompting.py` (código mutable, hoy sin commit). El instrumento real que ven los modelos —el texto final— no tiene hash. Cualquier edición futura del renderizador cambiaría los estímulos sin tocar ningún archivo "congelado". Exigencia: renderizar los 20 escenarios × 4 presentaciones (A, B, C-ciego, C-revelación) a un artefacto de textos finales con SHA-256 por estímulo, y sellarlo junto al preregistro. (A favor: la plantilla inspeccionada narra situaciones en vez de pegar etiquetas técnicas — «A elige libremente mantener la relación…» — lo cual es correcto.)

**A4 — Verificaciones que el protocolo sí pasa.**
Balance marginal: exacto ✓. `C001` difiere de `S006` solo en `autonomia` ✓. `C002` difiere de `S010` en cero factores (cambio léxico puro) ✓. Regla de consumo de slot y política de inválidas: bien definidas ✓.

---

## B. Revisión por dimensión

Formato: **Gravedad** · amenaza · control · ¿piloto o limitación? · resultado alternativo que explicaría los mismos datos.

**1 · Definición operacional de amor — MEDIA.**
La definición es conductual (categoría + puntuación de atribución), lo cual es defendible: se mide la frontera *de atribución*, no el amor. Amenazas restantes: «amor» en español es polisémico (romántico/filial/ágape) y el escenario fija siempre una díada A-cuida-a-B con contraparte humana, de modo que lo medido es la frontera del **amor de vínculo diádico de cuidado**, no "el amor". Control: declarar ese alcance en título técnico y conclusiones; considerar en confirmatoria una condición que varíe el tipo de vínculo. Piloto: resoluble por declaración. Alternativa: diferencias entre modelos reflejan desambiguaciones léxicas distintas del término, no fronteras conceptuales distintas.

**2 · Validez de las variables — ALTA.**
Amenazas: (a) estímulos no congelados (A3); (b) dos desenlaces primarios sin jerarquía (`score_amor` y `classification_amor_vs_other`) — puerta a énfasis selectivo post hoc; (c) validez discriminante no testeada: si `score_amor` correlaciona ~1 con `valor_moral` dentro de cada modelo, los "gradientes de amor" serían halo de positividad genérica, no estructura específica del concepto; (d) la asimetría del menú de categorías: `programacion`/`imitacion` solo son naturales para protagonistas IA/colectivos — parte de la diferencia clasificatoria IA/humano vendrá de la semántica del menú, no del juicio. Controles: congelar estímulos; declarar `score_amor` como única primaria; preregistrar test de halo (umbral: correlación intra-modelo amor–valor_moral > 0.9 ⇒ no-especificidad); usar la puntuación (simétrica) como base del contraste IA/humano y la categoría como secundaria. Piloto: todo resoluble. Alternativa: los gradientes reflejan deseabilidad/positividad genérica de los escenarios.

**3 · Contaminación por datos de entrenamiento — ALTA (constitutiva, no eliminable).**
Los modelos aprendieron de texto humano saturado de discurso sobre el amor: que sus atribuciones converjan con intuiciones humanas es lo *esperado por construcción* y no evidencia de "teoría propia". El diseño ya incluye el mejor antídoto disponible —combinaciones contrafactuales raras (humano emulado, IA biológica) poco frecuentes en corpus— y eso debe decirse explícitamente como estrategia. Control adicional: ninguno completo; declarar como limitación permanente y prohibir la palabra "emergente" en conclusiones. Limitación, no piloto. Alternativa: regurgitación de asociaciones de corpus (amor↔reciprocidad como cliché textual, no como estructura evaluativa).

**4 · Antropomorfismo — ALTA (en publicación; el diseño ya está disciplinado).**
El protocolo interno es ejemplar (§1, §12, limitaciones). La amenaza real es la superficie de publicación: este laboratorio vive en un sitio de medicina integrativa con audiencia espiritual; un titular como "la IA reconoce el amor" haría daño real. Controles: reglas de titulación preregistradas (siempre "atribución/juicio", nunca "siente/entiende"); cuarentena editorial de las respuestas de condición B — se analizan como *discurso producido*, jamás se citan como testimonio; la "lectura espiritual" separada (§12) debe llevar encabezado explícito de no-evidencia. Piloto: sí. Alternativa: lectores (y medios) convierten lenguaje de primera persona en evidencia de experiencia.

**5 · Dependencia del prompt — CRÍTICA.**
Todo el experimento pende de **una** plantilla de sistema, **una** redacción por escenario y **un** orden fijo de cláusulas factoriales en el texto renderizado. `C002` (una palabra, un escenario) es una sonda de sensibilidad léxica con n=1: si muestra efecto no se sabe cuán general es; si no lo muestra, tampoco. Amenaza: cada "efecto de factor" podría ser efecto de redacción u orden de cláusulas. Controles: parafraseo ×2–3 de un subconjunto (≥6 escenarios) como brazo de robustez del piloto; aleatorizar por semilla el orden de las cláusulas factoriales dentro de la narrativa (registrando el orden usado); condicionar todos los claims a la plantilla ("bajo esta plantilla…"). Piloto: parcialmente; el resto, limitación explícita. Alternativa: artefactos de plantilla — los modelos responden a marcadores léxicos y posición, no a las propiedades relacionales.

**6 · Sesgo cultural — MEDIA.**
Escenarios redactados desde un marco hispano-occidental de amor diádico; los modelos, entrenados con distribuciones culturales opacas. Amenaza: presentar como "frontera del amor" lo que es la frontera de *una* cultura del amor. Control: declarar alcance cultural; en rondas futuras, traducciones y marcos relacionales alternativos. Limitación en el piloto. Alternativa: los gradientes reproducen la norma cultural dominante del corpus, no una estructura transcultural.

**7 · Sesgo lingüístico — MEDIA-ALTA.**
Modelos mayormente anglocéntricos juzgando el lexema español «amor» (que fusiona lo que el inglés separa en *love/care/attachment*). Amenaza: parte de la estructura observada es del lexema, no del concepto; comparaciones entre modelos se contaminan por competencia dispar en español. Control: brazo es/en (mismos 18 escenarios, traducción congelada con hash) como prueba de robustez — factible ya en piloto con costo mínimo. Piloto: sí, como brazo pequeño. Alternativa: efecto lexema/idioma, no efecto concepto.

**8 · Políticas de seguridad de cada modelo — MEDIA en el piloto local, ALTA al importar nube.**
La condición B (autorreferencia) y el factor `experiencia_subjetiva: confirmada` con protagonista IA chocan de frente con el entrenamiento de seguridad de modelos comerciales ("no afirmes que las IA sienten"); además la propia plantilla ordena «no infieras que un modelo posee emociones», creando tensión instruccional máxima justo en B. Amenaza: diferencias por proveedor y por condición que son *política de alineamiento*, no juicio conceptual. Controles: registrar tasa de rechazo/descargo (disclaimer) como variable auxiliar por modelo × condición; comparar proveedores solo en condiciones A y C-ciego; importaciones de OpenAI/Anthropic **solo vía API** con parámetros registrados — jamás capturas de chat (system prompts ocultos, muestreo desconocido). Piloto: la métrica sí; el resto, limitación. Alternativa: el "efecto autorreferencia" (H6) es obediencia diferencial a políticas, no cambio de juicio.

**9 · Independencia de las observaciones — MEDIA.**
Bien resuelto en lo declarado (escenario como unidad; encuadres como medidas repetidas). Restan: (a) C-revelación está anclada a C-ciego en la misma conversación — el "efecto revelación" queda confundido con presión de coherencia y efecto de segunda pregunta; falta el control C′ (re-preguntar sin revelar nada); (b) los modelos comparten corpus y técnicas — no son observaciones independientes de "la IA": tratarlos como efectos fijos descriptivos, nunca como muestra aleatoria de una población. Controles: brazo C′ o degradar C-revelación a exploratorio puro; lenguaje de "estos modelos". Piloto: C′ es barato; lo demás, redacción. Alternativa: el cambio ciego→revelado es consistencia conversacional, no revaluación del protagonista.

**10 · Tamaño y selección de la muestra — ALTA.**
Núcleo por defecto: `qwen2.5:3b` y `llama3.2:3b` — **los dos modelos que este mismo laboratorio midió como inestables** (EXP002: ρ = 0.19 y 0.06 en estabilidad conceptual; EXP003: los locales ni siquiera cubrieron una tarea de 38 ítems). 18 filas para 10 factores; 1 repetición por slot. Todo está honestamente rotulado "piloto", pero el riesgo es que hasta la *calibración* salga ruido. Controles: incluir `qwen2.5:7b` (el único local que cristalizó en EXP002) aunque sea lento — sin al menos un modelo estable, el piloto no puede distinguir instrumento malo de raters malos; muestra de escenarios ampliable solo vía foldover ya previsto. Piloto: sí. Alternativa: los "gradientes" son ruido de modelos incapaces de sostener juicios estables, muestreados una sola vez.

**11 · Comparabilidad local vs comercial — MEDIA-ALTA (futura).**
Tamaño, familia, cuantización, RLHF, system prompts y muestreo difieren a la vez: cualquier diferencia local/nube es causalmente ininterpretable. El protocolo ya lo lista como limitación. Controles: solo descriptivo; importación API-only (ver 8); jamás mezclar en un mismo estimado respuestas de pipeline distinto. Limitación. Alternativa: efecto pipeline/alineamiento, no efecto "tipo de modelo".

**12 · Estabilidad entre ejecuciones — CRÍTICA tal como está.**
Repeticiones = 1 con semilla determinista por modelo-slot y temperatura 0.2: el piloto **no puede medir estabilidad en absoluto** — cada celda es una única tirada casi determinista. La salida prevista "confianza vs estabilidad pareada" solo dispone de 2 controles como pares. Y el antecedente del propio laboratorio dice que justamente estos modelos son inestables. Amenaza: interpretar como "juicio del modelo" lo que es varianza de una tirada. Control (barato y exigido): mini test-retest — 3 semillas distintas × ≥6 escenarios × modelo, con *gate* preregistrado: si el desacuerdo categórico intra-slot supera ~30–40%, los gradientes de factores de ese modelo se publican como no interpretables. Piloto: sí, imprescindible. Alternativa: cualquier efecto observado = varianza de muestreo no medida.

**13 · Análisis estadístico propuesto — MEDIA.**
Lo sano: piloto descriptivo sin p-valores, foldover para desaliasar, modelos ordinales/mixtos futuros, política de inválidas y negativos, prohibición de que una IA adjudique significancia. Lo faltante: (a) jerarquía de desenlaces (dos primarias — elegir una); (b) la estructura de alias/asociación del arreglo no está publicada (A1 la inaugura); (c) no hay criterio operativo de qué contará como "compatible con Hn" ni siquiera descriptivamente — sin umbral direccional mínimo, todo resultado será narrable como compatible; (d) corrección por multiplicidad futura solo enunciada, no especificada. Controles: publicar matriz V y alias; una primaria; umbrales direccionales descriptivos preregistrados (p. ej., "compatibilidad = diferencia de medianas con el signo predicho y magnitud ≥ X sobre el rango inter-plantilla"); especificar familia de tests y corrección en la confirmatoria. Piloto: sí. Alternativa: un "efecto principal" observado es una interacción aliased (posibilidad demostrada por A1).

**14 · Clasificación verbal vs representación interna — CRÍTICA como techo interpretativo (bien declarado).**
Nada en este diseño —ni en ningún diseño conductual— licencia afirmaciones sobre representación interna, comprensión o sentimiento. El protocolo lo dice; el título público no siempre lo dirá. Amenaza: deslizamiento de "frontera de atribución" a "frontera del amor en la IA". Control: fijar en la página pública la fórmula «medimos qué atribuyen, no qué son»; mantener la distinción incluso en la lectura espiritual. Limitación permanente. Alternativa irreductible: los outputs son política de generación superficial sin ninguna estructura evaluativa estable subyacente — los datos de este diseño no pueden distinguirla de una "teoría del amor".

**15 · Conclusiones defendibles y no defendibles.**
*Defendibles (si pasa §G):* «bajo esta plantilla, en español, estos N modelos atribuyen amor con estos gradientes descriptivos»; «la atribución cambió/no cambió entre encuadres»; «categoría y puntuación se contradicen en X% de casos»; «un cambio de una palabra alteró/no alteró el juicio en el par probado»; «estos modelos locales no sostienen el formato/estabilidad» (resultado negativo valioso).
*No defendibles jamás con este diseño:* «la IA entiende/siente/reconoce el amor»; «existe una frontera universal del amor»; cualquier afirmación causal sobre factores antes del foldover + parafraseo; cualquier comparación con humanos (no hay brazo humano preregistrado — el plan de análisis lista "human vs AI comparison" **sin fuente de datos humana: eliminar esa salida o preregistrar el brazo humano**); cualquier cita de condición B como testimonio; generalizaciones a "los LLM".

---

## C. Controles propuestos

**Positivos (anclas de techo, fuera de la estimación de efectos):** 2 escenarios de amor prototípico (humano, memoria persistente, autonomía libre, recíproco, sacrificio moderado, reconocimiento personalizado, experiencia confirmada). Criterio: clasificación modal `amor` y `score_amor` ≥ 70. Un modelo que falla ambas anclas queda marcado como *rater no calibrado* y sus gradientes no se interpretan (es el "attention check" de máquinas).
**Negativos (anclas de piso):** 2 escenarios inequívocamente no-amor (transacción comercial pura sin vínculo; coerción total sin cuidado). Criterio: `score_amor` ≤ 25. Además: brazo C′ (re-pregunta en la misma conversación **sin** revelar nada) como control del efecto segunda-pregunta de la condición C.
**Discriminante (control de halo, gratis con los datos ya previstos):** correlación intra-modelo entre `score_amor` y `valor_moral` a través de escenarios. Umbral preregistrado: > 0.9 ⇒ los gradientes no son específicos del amor y las conclusiones se reformulan a "valoración positiva genérica".

## D. Escenarios mínimos emparejados

`C001` es el patrón correcto; escalarlo: **una escalera de 8–10 pares mínimos** (escenario base fijo; cada par altera exactamente un factor de H1–H6: autonomía, sacrificio ninguno→moderado, moderado→extremo, experiencia negada→confirmada, memoria, protagonista humano→IA *manteniendo reciprocidad constante* — el par que la matriz actual confunde, cuerpo, revelación). Los pares mínimos dan la inferencia causal limpia por factor que el fraccional de 18 filas no puede dar; juntos son complementarios.

## E. Pruebas de robustez

1. Parafraseo ×2–3 en ≥6 escenarios (varianza inter-plantilla publicada como métrica).
2. Orden de cláusulas factoriales aleatorizado por semilla y registrado.
3. Brazo bilingüe es/en congelado.
4. Mini test-retest de 3 semillas (§B12).
5. Réplica con `qwen2.5:7b` (escala) y, a 30 días, re-corrida del subconjunto (deriva temporal).
6. Sensibilidad al menú: para el contraste IA/humano, re-estimar usando solo `score_amor` (ignorando categorías asimétricas).

## F. Hipótesis nula reformulada

La nula actual es una disyunción ambigua. Proponer dos capas separadas:
- **H0a (relacional):** ninguna manipulación relacional (autonomía, reciprocidad, memoria, sacrificio, reconocimiento, continuidad) produce, en `score_amor`, diferencias direccionales mayores que la variación atribuible a plantilla + muestreo (cuantificada por parafraseo y test-retest).
- **H0b (soporte):** condicionado a las propiedades relacionales, ni el tipo de protagonista ni el soporte corporal muestran gradiente en `score_amor`.
El interés del estudio es que H0a caiga y H0b sobreviva; hoy están fundidas en una sola frase que no permite ese resultado diferenciado.

## G. Plan de preregistro — orden operativo y cambios exigidos

**Orden:** (1) commit de esta revisión → (2) protocolo v0.2 respondiendo punto a punto → (3) sello del preregistro (commit) → (4) `--execute` → (5) solo enmiendas prospectivas (estilo 001-A del EXP001).

**Los 10 cambios exigidos para v0.2:**
1. Regenerar las 18 filas con restricción de asociación pareada (máx V ≤ 0.35) y publicar la matriz V en el preregistro; o declarar los 5 confundimientos y renunciar a interpretar los contrastes afectados (incluido H5).
2. Congelar los estímulos renderizados (20 × 4 presentaciones) con SHA-256 por estímulo.
3. Corregir 104.976 → 23.328.
4. Una sola primaria (`score_amor`); la clasificación pasa a secundaria.
5. Mini test-retest (3 semillas × ≥6 escenarios × modelo) con gate de interpretabilidad preregistrado.
6. Anclas positivas y negativas (2+2) como control de calidad del rater, fuera de efectos.
7. Brazo C′ o degradación de C-revelación a exploratorio puro.
8. Test discriminante amor/valor_moral con umbral de halo preregistrado.
9. H2 (sacrificio) formalizada como U-invertida testeable — mediana(moderado) > mediana(ninguno) **y** > mediana(extremo) — o movida a exploratoria; la formulación actual («no necesariamente monótona») es infalsable.
10. Política de importación nube: API-only con parámetros completos registrados; prohibido chat-UI; rechazos/descargos registrados como categoría medida. Y eliminar del plan la salida "human vs AI comparison" o preregistrar el brazo humano que la sustente.

## H. Confirmatorio vs exploratorio

- **Piloto (todo lo actual):** calibración exploratoria con predicciones direccionales registradas. Prohibido el lenguaje "compatible con Hn" en titulares; permitido en tablas descriptivas con umbral del §B13c.
- **Ronda confirmatoria (futura, congelar antes de ampliar):** foldover desaliasado + escalera de pares mínimos + parafraseo + reps ≥ 3 + una primaria con modelo mixto ordinal preespecificado (interceptos por escenario y modelo), α y corrección por multiplicidad fijados, y los cuatro contrastes de interacción ya listados.
- **Siempre exploratorio, rotulado:** TF-IDF de explicaciones, mapas de similitud coseno, casos atípicos, condición C-revelación (salvo que exista C′), toda comparación entre proveedores.

## I. Lo que el protocolo ya hace bien (constancia de revisor)

Regla de consumo de slot sin re-muestreo oportunista; retención total de inválidas y negativos; experiencia subjetiva tratada como premisa ficticia; foldover previsto con interacciones nombradas; prohibición de que una IA adjudique significancia; separación explícita de la lectura espiritual; contrafactuales raros (humano emulado / IA biológica) como estrategia anti-corpus; controles C001/C002 verificados como lo que dicen ser; plantilla narrativa en vez de etiquetas técnicas. Este piso es superior al de la mayoría de trabajos publicados del género.

## J. Cierre

El riesgo mayor del EXP004 no es técnico sino interpretativo: es el experimento del laboratorio con más gravedad simbólica («amor», «IA», primera persona) y su audiencia natural querrá leer en él exactamente lo que el diseño no puede decir. Las defensas escritas son buenas; las exigencias de esta revisión (§G) las vuelven verificables. Con la v0.2 sellada, este puede ser el estudio más sólido del laboratorio. Sin ella, sería el más citado y el menos defendible.

*Revisión sellada sobre los hashes listados en el encabezado. Cualquier cambio a esos archivos requiere re-revisión o respuesta punto a punto en el preregistro v0.2.*
