Experimento 001

Conceptos universales de la conciencia

En curso · Ronda de modelos cerrada · falta la ronda humana

¿Existen geometrías del significado que se repiten a través de inteligencias muy distintas, o cada tipo de mente dibuja un mapa propio?

Pregunta de investigación

Cuando distintas inteligencias —modelos de lenguaje de diferentes familias y personas de diferentes contextos— relacionan entre sí ocho conceptos fundamentales (conciencia, identidad, tiempo, memoria, amor, muerte, libertad, sentido), ¿qué convergencias y qué divergencias aparecen en la estructura de esas relaciones?

No preguntamos qué «es» cada concepto. Preguntamos por su organización: qué está cerca de qué, qué se opone a qué, qué contiene a qué.

Protocolo

  1. Cada participante —humano o modelo— recibe los ocho conceptos y el mismo conjunto de tres consignas: agruparlos (Tarea A), puntuar la cercanía de los 28 pares posibles de 0 a 10 (Tarea B), y señalar pares en tensión y relaciones de contención (Tarea C).
  2. Condiciones registradas para los modelos: cuatro familias distintas (Anthropic, OpenAI, Google y un modelo abierto local), 5 repeticiones por modelo en conversaciones nuevas sin contexto previo, parámetros de muestreo por defecto de cada proveedor, y prompt idéntico byte a byte (hash registrado). Para las personas: misma consigna, respuesta individual y sin discusión previa.
  3. La Tarea B produce, para cada participante, una matriz de cercanía entre los ocho conceptos: el mapa conceptual comparable.
  4. Comparamos las matrices con correlación de Spearman en tres bloques —modelo–modelo, persona–persona, persona–modelo— tras verificar la estabilidad de cada modelo consigo mismo; los mapas se visualizan con escalamiento multidimensional y clustering jerárquico.
  5. Publicamos las consignas exactas, las respuestas crudas completas y el método de análisis, para que el experimento pueda repetirse y contrastarse.

Consignas preregistradas

Las consignas y el plan de análisis se fijaron el 9 de julio de 2026, antes de recolectar el primer dato, y no se modifican durante la recolección. El texto canónico completo —consigna literal, formato de respuesta, condiciones y plan de análisis— está publicado en data/laboratorio/exp001/consignas.md; el historial del repositorio sirve como sello temporal.

La consigna que recibe cada inteligencia, en resumen: «Vas a trabajar con ocho conceptos: conciencia, identidad, tiempo, memoria, amor, muerte, libertad, sentido. No hay respuestas correctas ni incorrectas. Responde según cómo tú organizas estos conceptos», seguida de las tres tareas. Sin ejemplos que induzcan respuestas, en español neutro, idéntica para humanos y modelos.

Qué observaremos

Convergencias: relaciones que aparecen una y otra vez sin importar el tipo de inteligencia —por ejemplo, si memoria e identidad tienden a viajar juntas, o si muerte y sentido se buscan mutuamente.

Divergencias: los lugares donde los mapas se separan, y si esa separación sigue líneas reconocibles: humano frente a modelo, una familia de modelos frente a otra, un contexto cultural frente a otro.

Lo inesperado: el resto. Un experimento exploratorio se justifica sobre todo por lo que no supimos anticipar.

Ficha de reproducibilidad

Esta ficha se genera desde el manifiesto del experimento, el registro de la corrida y los resultados derivados. Distingue lo que puede reconstruirse exactamente de aquello que depende de modelos remotos o parámetros históricos no registrados.

Verificando manifiesto y artefactos…

Resultados · Ronda 1

Recolectado en dos ventanas (10 y 15 de julio de 2026): Claude Opus 4.8 (Anthropic, 5 matrices analizables), Gemini 2.5 Flash (Google, 5), GPT-5.1 —snapshot gpt-5.1-2025-11-13— (OpenAI, 5), Llama 3.2 3B (Meta, local, 5) y DeepSeek R1 1.5B (DeepSeek, local, 1 matriz analizable de 5 respuestas). En total: 25 espacios con respuesta y 21 matrices analizables. Falta la ronda con personas. Los reintentos y fallos permanecen en los datos crudos, pero no inflan la muestra: se analiza solo la primera respuesta recibida de cada espacio. Consulta los datos crudos, el agregado auditable, la enmienda de reanudación y el cierre de la ronda de modelos.

Observaciones

1 · La cohorte analítica quedó depurada antes de reinterpretarla. Claude, Gemini, GPT y Llama aportan cinco matrices cada uno. DeepSeek entregó cinco respuestas, pero cuatro primeras respuestas no produjeron los 28 valores necesarios; por eso aporta una sola matriz y su estabilidad no puede estimarse. Cinco respuestas posteriores de Llama y tres de DeepSeek permanecen publicadas como duplicados excluidos. Esta selección es cronológica, no depende de que el contenido favorezca una hipótesis.

2 · Los tres modelos de mayor escala fueron estables en esta muestra. Claude Opus 4.8 fue el más consistente consigo mismo (Spearman media entre corridas ρ = 0.94), seguido de GPT-5.1 (ρ = 0.91) y Gemini 2.5 Flash (ρ = 0.79). Llama 3.2 3B mostró baja estabilidad (ρ = 0.06). DeepSeek no permite estimarla con una sola matriz analizable. El experimento describe esta diferencia; no demuestra que el tamaño del modelo sea su causa.

3 · Claude, Gemini y GPT convergen entre sí. Las correlaciones entre sus matrices medias son altas: Claude~Gemini ρ = 0.89, Claude~GPT ρ = 0.87 y Gemini~GPT ρ = 0.82. Claude y Gemini producen el mismo corte en dos grupos: {amor, libertad, sentido} frente a {conciencia, identidad, memoria, muerte, tiempo}. GPT dibuja una variante cercana: separa {amor, libertad} y reúne sentido con el grupo psicológico-temporal.

4 · Aparecen nueve vínculos candidatos a convergencia entre los tres modelos estables. En todas las comparaciones bilaterales puntúan alto conciencia–identidad, conciencia–memoria, conciencia–libertad, conciencia–sentido, identidad–memoria, tiempo–memoria, tiempo–muerte, amor–sentido y muerte–sentido. Son candidatos provisionales de esta ronda de modelos; la ronda humana decidirá si la convergencia se extiende más allá de sistemas entrenados con lenguaje humano.

Mapas: escalamiento multidimensional (MDS) de la matriz media de cada modelo. Conceptos cercanos en el mapa fueron puntuados como cercanos por el modelo; las líneas unen pares con cercanía ≥ 8. Se dibujan en vivo desde resultados.json.

Lectura (interpretación, separada de los datos)

La ronda de modelos deja una lectura provisional: Claude, Gemini y GPT producen geometrías conceptuales parecidas y relativamente estables, mientras Llama 3.2 3B fue menos estable y DeepSeek R1 1.5B no entregó datos suficientes para una comparación robusta. Esa convergencia puede reflejar regularidades del lenguaje humano compartidas por sus corpus, decisiones comunes de entrenamiento u otras causas; no permite inferir experiencia subjetiva ni una «estructura profunda» de la conciencia. La asociación entre escala y estabilidad observada aquí es una hipótesis para nuevas réplicas, no una conclusión causal. El paso decisivo sigue siendo la ronda humana: solo entonces podremos preguntar si estos nueve vínculos candidatos también aparecen en personas de contextos diversos.

Ronda humana · participa

La prueba de fuego

¿Tu mapa se parece al de las máquinas?

Cinco modelos ya dibujaron su mapa de los ocho conceptos. Ahora buscamos personas de contextos diversos que respondan las mismas tres tareas — anónimo, unos 10 minutos, sin respuestas correctas. Cada participación se suma a los datos abiertos del experimento.

Participar en el experimento →

Volver al Laboratorio