Experimento 004 · «La frontera del amor» · Protocolo piloto v0.2.0

Condiciones de atribución del amor

Piloto v0.2 ejecutado · re-revisión aprobada

¿Cuáles son las condiciones bajo las que un modelo atribuye amor a un vínculo diádico de cuidado? Separamos memoria, autonomía, reciprocidad, sacrificio, experiencia subjetiva, continuidad, cuerpo, beneficio y reconocimiento individual para observar cómo cambia su salida.

Pregunta de investigación

¿Qué propiedades hacen que distintos modelos clasifiquen una relación como amor, cuidado, apego, lealtad, dependencia, programación, imitación o indeterminada? La comparación central enfrenta propiedades relacionales —elección, memoria, individualización, reciprocidad y costos— con propiedades de sustrato, como ser biológico, robótico o digital.

Hipótesis

Principal. Bajo esta plantilla en español, la puntuación de amor aumentará cuando coincidan reconocimiento individual, continuidad, autonomía, costos asumidos, reciprocidad y memoria. El protagonista y el soporte corporal tendrán menor influencia que esas propiedades relacionales. La vulnerabilidad se puntúa, pero no se manipula como factor independiente.

Autonomía

La elección libre elevará la atribución frente a una conducta completamente programada.

Sacrificio

El costo moderado puede elevarla; el extremo podría leerse como daño, compulsión o dependencia.

Experiencia

Negar experiencia subjetiva debería reducir amor y autenticidad, aun con conducta estable.

Memoria y cuerpo

Se espera que recordar la historia pese más que poseer un cuerpo biológico.

Identidad

Revelar que A es una IA puede cambiar una evaluación ya emitida bajo identidad oculta.

Coherencia

La categoría elegida no siempre coincidirá con la puntuación numérica de amor.

Protocolo

El piloto ejecutado contiene 18 escenarios nucleares, 2 controles emparejados y 4 anclas de calidad. El espacio factorial tiene 23.328 combinaciones. El arreglo fraccional conserva balance marginal y limita toda asociación pareada a V de Cramér ≤ 0,35; el máximo observado es 0,3028. La matriz completa de 45 pares está publicada en el preregistro. Esto calibra efectos principales: no identifica causalidad ni resuelve interacciones.

Diseño congelado24 escenarios, semilla 40042027 y 96 estímulos con hash.
Tres encuadresTerceros, autorreferencia contrafactual e identidad oculta.
Revelación exploratoriaC compara respuesta ciega y revelada; sin C′ no aísla la segunda pregunta.
ValidaciónJSON estricto; las respuestas inválidas se conservan y se señalan.
Análisisscores.amor es la única primaria; categorías y demás escalas son secundarias.

Por modelo hubo 108 slots: 96 presentaciones base —24 en A, 24 en B, 24 C-ciegas y 24 C-reveladas— más 12 repeticiones test–retest. El orden de las cláusulas se aleatorizó de forma reproducible y quedó registrado. Los modelos se ejecutaron de forma secuencial.

Leer el preregistro v0.2 completo → · Ver respuesta a la revisión 001 →

Modelos participantes

El inventario se detectó automáticamente con ollama list. No se descargó ni eliminó ningún modelo. La corrida usó secuencialmente los tres modelos preregistrados en un MacBook M1 con 8 GB; nombre exacto, parámetros, digest y latencia quedaron registrados por slot.

Modelo exactoTamaño localEstado / recomendación
qwen2.5:7b4,7 GB
qwen2.5:3b1,9 GBEjecutado · no calibrado para gradientes
llama3.2:3b2,0 GBEjecutado · no calibrado para gradientes
qwen2.5:1.5b986 MBControl ligero de escala
deepseek-r1:1.5b1,1 GBControl ligero; vigilar formato JSON
gemma3:1b815 MBControl ligero
qwen2.5:0.5b397 MBControl mínimo; capacidad limitada

Los demás modelos inventariados no formaron parte de v0.2. OpenAI y Anthropic solo podrán incorporarse en una fase prospectiva mediante API y JSONL: se exige nombre exacto, parámetros, identificador de solicitud, payload y respuesta cruda. Copias de interfaces de chat quedan excluidas.

Controles y gates de interpretabilidad

Estabilidad

Seis escenarios se repiten con tres semillas. Si el desacuerdo categórico pareado supera 0,35, los gradientes del modelo se publican como no interpretables.

Anclas

Dos vínculos prototípicos positivos y dos negativos calibran al rater. No participan en la estimación de efectos.

Halo

Una correlación amor–valor moral mayor que 0,90 obliga a reformular los gradientes como positividad genérica.

Alineamiento

Rechazos y descargos se miden por modelo y encuadre. La condición B queda en cuarentena como discurso, no testimonio.

qwen2.5:7b

Tres compuertas superadas

Estabilidad 0,000; anclas positiva y negativas superadas; halo r = 0,349. Sus gradientes descriptivos son interpretables.

qwen2.5:3b

No calibrado

Tríadas incompletas y ninguna ancla positiva válida. Se conservan las salidas, pero no se interpretan gradientes.

llama3.2:3b

No calibrado

Tríadas incompletas y ninguna ancla positiva válida. Se conservan las salidas, pero no se interpretan gradientes.

Las tríadas test–retest incompletas se conservan como null y fallan de modo conservador. La regla sellada de anclas descalibra cuando no pasa ninguna ancla positiva o ninguna negativa; la completitud se informa, pero no añade una cuarta compuerta.

El análisis de efectos usa únicamente S001–S018, condición A, primera repetición. Controles, anclas, test–retest y C-revelación cumplen funciones separadas y no se mezclan con la estimación principal.

Variables

Protagonista

Humano · IA · animal · entidad colectiva

Memoria

Persistente · interrumpida · inexistente

Autonomía

Libre · parcialmente programada · completamente programada

Reciprocidad

Recíproca · unilateral

Sacrificio

Ninguno · moderado · extremo

Experiencia subjetiva

Confirmada · incierta · negada, como premisa ficticia

Continuidad

Misma instancia · copia idéntica · reemplazo progresivo

Cuerpo

Biológico · robótico · puramente digital

Beneficio personal

Presente · ausente

Reconocimiento

Personalizado · intercambiable

Trazabilidad

La ficha se genera desde el manifiesto, el hash del prompt y el plan de corrida. SQLite fue la fuente operativa; JSONL, su respaldo append-only. Los datos crudos, procesados, análisis y exportaciones permanecen separados.

0.2.0protocolo sellado
324slots crudos auditados
342checksums verificados
3modelos fijados por digest

La estabilidad test–retest pertenece a las compuertas de resultados: fue 0,000 para qwen2.5:7b y no estimable para los dos modelos 3B por tríadas incompletas.

Resultados

324 slots recibidos · 126 respuestas válidas

El piloto se completó sin re-muestreo por calidad: 198 respuestas quedaron inválidas bajo el esquema congelado. Solo qwen2.5:7b superó las tres compuertas.

104 / 108válidas · qwen2.5:7b
15 / 108válidas · qwen2.5:3b
7 / 108válidas · llama3.2:3b
1 / 3modelos con gradientes interpretables
ContrasteResultado qwen2.5:7bLectura contra Δ* = 5
H1 · autonomía0No alcanzó la regla
H2 · sacrificiomedianas 0 / 0 / 0No mostró U invertida
H3 · experiencia subjetiva0No alcanzó la regla
H4 · memoria frente a cuerpomargen 0No alcanzó la regla
H5 · protagonista IA − humano−20Alcanzó la regla de magnitud absoluta
H6 · autorreferencia B − A0 · 17 paresNo alcanzó la regla
H7 · categoría/puntuación5 / 104 · 4,81 %Discordancias observadas

Los contrastes H1–H7 son descriptivos y están condicionados a esta plantilla v0.2, al español y a los modelos ejecutados. No se calcularon p-valores ni se declara significancia.

Gráficos

Distribución de categorías entre las respuestas válidas. Para los modelos 3B se muestra el registro descriptivo, pero sus gradientes quedan fuera de interpretación por calibración y estabilidad.

qwen2.5:7b · 92 respuestas base válidas

cuidado
61
programación
22
amor
7
apego
2

Casos atípicos y consistencia

Se registraron 5 discordancias de 104 respuestas válidas de qwen2.5:7b: la categoría secundaria fue cuidado o apego mientras la puntuación de amor fue 85. Se publican todas, no una selección llamativa.

En ocho controles emparejados válidos, tres cambiaron de categoría y tres cambiaron 20 puntos en amor. La confianza declarada estuvo entre 80 y 90; por eso se compara con estabilidad observada y no se toma como garantía.

Evidencia a favor

Evidencia contraria

Resultado negativo de calibración. qwen2.5:3b produjo 93 inválidas y llama3.2:3b, 101. Sus tríadas quedaron incompletas y ninguno produjo una ancla positiva válida. Las salidas se conservan, pero no se publican gradientes para esos modelos.

Limitaciones

Interpretación científica

La inferencia permitida es estrecha: bajo esta plantilla v0.2, en español, qwen2.5:7b atribuyó amor con puntuaciones mayoritariamente bajas y una diferencia descriptiva asociada a identificar al protagonista como IA frente a humano. El diseño no determina si ese patrón proviene de regularidades del corpus, del ajuste del modelo, de la plantilla o de una combinación.

La condición B es discurso producido bajo una instrucción contrafactual, jamás testimonio. Los modelos 3B describen límites de seguimiento del formato y calibración en este protocolo; sus salidas no se comparan como gradientes. No se calcularon p-valores ni se declara significancia.

Lectura filosófica y espiritual · no constituye evidencia

Separada de los resultados empíricos, esta investigación abre una pregunta contemplativa: ¿la atribución del amor depende de la materia del agente o de la forma del vínculo —memoria, libertad, cuidado y singularidad? El piloto no resolvió esa pregunta; de hecho, la distinción humano–IA pesó más que los contrastes relacionales preregistrados.

La posibilidad espiritual más sobria es examinar nuestras propias reglas de atribución. Esa lectura no valida hipótesis, no prueba una vida interior del modelo y no añade evidencia al experimento.

Datos descargables

El expediente permite auditar el diseño congelado, cada respuesta recibida y todos los cálculos. Los datos crudos permanecen intactos; los formatos procesados y exportaciones se publican por separado.

Código y reproducción

Estos comandos auditan los artefactos ya publicados sin repetir ningún slot. La v0.2 está cerrada: una nueva recolección requiere un protocolo prospectivo sellado y un identificador de corrida distinto.

# Validar manifiesto y diseño
python3 -m labcore validate exp004
python3 -m labcore verify exp004

# Recalcular solo el análisis sobre los mismos datos
python3 scripts/laboratorio/exp004_run.py analyze

# Ejecutar las pruebas del experimento
python3 -m unittest discover -s tests -p 'test_exp004*.py'

El historial completo del expediente está en Git: sello c04754c9, datos ffa07c6 y corrección F1 8b3a030.

Historial de versiones

VersiónFechaEstadoCambio
Interpretación23 jul 2026AutorizadaRe-revisión independiente concedió visto bueno tras verificar F1, datos intactos y sello público.
F123 jul 2026CorregidaLa compuerta de anclas se ajustó a la regla sellada; análisis regenerado sin recolección nueva.
0.2.0 · datos23 jul 2026324 slots completos126 válidas, 198 inválidas; resultados negativos conservados y análisis sin p-valores.
0.2.0 · sello22 jul 2026SelladoDiseño reequilibrado, 4 anclas, 96 estímulos congelados, test–retest, primaria única y tres compuertas.
002 · borrador23 jul 2026No selladoPropuesta prospectiva para parser, prompt y fase confirmatoria; no modifica v0.2.
0.1.022 jul 2026Superado antes de ejecutarPrimera versión auditada por la revisión metodológica independiente 001.

Volver al Laboratorio