El problema de los estudios clásicos
Solo las grandes marcas hacen estudios con regularidad. Las demás lanzan a ojo, porque la investigación tradicional es:
- Cara: de 5.000 € a 50.000 € por estudio (reclutamiento, incentivos, análisis).
- Lenta: de 3 a 8 semanas entre el brief y los resultados.
- Rígida: cada variante de concepto es un nuevo estudio de pago.
- Sesgada: muestras pequeñas, sesgo de reclutamiento, deseabilidad social.
El método, explicado de forma sencilla
La idea central del paper: separar la producción de la opinión de su medición. No pedimos una cifra; medimos el matiz de una respuesta libre.
¿Por qué no pedir una nota directamente?
Pedirle «puntúa del 1 al 5» a un LLM da distribuciones degeneradas (todo el mundo responde 4), una fuerte sensibilidad al prompt y una mala correlación con el humano. La solución: dejar que el persona se exprese libremente y luego puntuar ese texto desde fuera.
- 1
1. Personas diversos
Generamos una población heterogénea de encuestados sintéticos (edad, categoría socioprofesional, región, actitudes) para restaurar la varianza.
- 2
2. Respuesta en lenguaje natural
Cada persona reacciona al concepto con un verbatim, en el idioma y la cultura del mercado simulado.
- 3
3. Nota Likert por similitud
Comparamos el embedding del verbatim con frases de anclaje (una por nivel); la similitud coseno da una nota continua y luego una puntuación calibrada.
Las frases de anclaje (ejemplo ES, intención de compra)
El scoring compara cada verbatim con un conjunto de anclajes versionado y validado por idioma. Ejemplo sobre una escala Likert de 5:
| Nivel | Frase de anclaje |
|---|---|
| 1 | “No lo compraría en absoluto, no me interesa nada.” |
| 2 | “Es poco probable que lo compre, no me convence demasiado.” |
| 3 | “No estoy seguro, quizás, dependería.” |
| 4 | “Probablemente lo compraría, me interesa.” |
| 5 | “Lo compraría sin dudarlo, es justo lo que necesito.” |
La publicación
«LLMs Reproduce Human Purchase Intent via Semantic Similarity Elicitation of Likert Ratings» (arXiv 2510.08338, octubre de 2025).
Autores: B. F. Maier, U. Aslak, L. Fiaschi, N. Rismal, K. Fletcher, C. C. Luhmann, R. Dow, K. Pappas, T. V. Wiecki.
Resultado: correctamente promptados y calibrados, los LLM reproducen las distribuciones de intención de compra humana a un nivel estadísticamente aprovechable, evaluado en particular mediante un clasificador LightGBM.
Nuestra calibración
No pedimos que se nos crea sin más: medimos de forma continua la desviación entre nuestras salidas sintéticas y datos humanos de referencia (conjuntos públicos, validaciones de partners, hold-out interno), y la mostramos.
- Correlación sintético ↔ humano
- 0,92
- Error en el Top-2-Box
- 4 %
- Cobertura de los IC
- 94 %
- Conceptos comparados
- 26
Cuanto más crece la base de validaciones, mejor y más defendible se vuelve el método: un efecto de red de datos.
Datos indicativos, versión showcase-v1
| Humano | Sintético |
|---|---|
| 1.4 | 1.5 |
| 1.7 | 1.6 |
| 1.9 | 2.1 |
| 2.1 | 2 |
| 2.3 | 2.5 |
| 2.5 | 2.4 |
| 2.6 | 2.8 |
| 2.8 | 2.7 |
| 2.9 | 3.1 |
| 3 | 2.9 |
| 3.1 | 3.3 |
| 3.2 | 3.1 |
| 3.3 | 3.5 |
| 3.4 | 3.3 |
| 3.5 | 3.6 |
| 3.6 | 3.4 |
| 3.7 | 3.9 |
| 3.8 | 3.7 |
| 3.9 | 4.1 |
| 4 | 3.9 |
| 4.1 | 4.3 |
| 4.2 | 4.1 |
| 4.3 | 4.2 |
| 4.5 | 4.6 |
| 4.6 | 4.4 |
| 4.8 | 4.7 |
Intervalos de confianza y puntuación de fiabilidad
Cada estudio muestra un índice de fiabilidad derivado de la densidad de calibración de la categoría, del tamaño del panel (N → anchura de los IC) y de la coherencia interna de las respuestas.
Muestra grande: intervalos de confianza estrechos, alta fiabilidad.
Muestra intermedia: buena fiabilidad, ten en cuenta los márgenes.
Muestra reducida: resultado indicativo, a confirmar con un panel mayor.
Un comité de modelos, no un juez único
Cada encuestado sintético procede de una familia de modelo diferente. Cruzar varias IA diluye el sesgo propio de un solo modelo, como un panel humano diverso en lugar de una única opinión.
- Claude
- GPT
- Gemini
- Grok
- Mistral
Menos sesgo de modelo único
Un solo LLM impone su estilo y su cultura de entrenamiento a todo el panel. Al repartir a los encuestados en cinco familias (Claude, GPT, Gemini, Grok, Mistral) se atenúa el sesgo idiosincrásico de cada una.
Menos dependencia
Si un proveedor no está disponible o está limitado, el estudio continúa con los demás modelos. Ningún estudio depende de un único actor.
Diversidad y soberanía
El pool incluye un modelo europeo (Mistral) junto a los modelos estadounidenses, para una diversidad cultural y tecnológica real.
Demostrado, no prometido
Cada respuesta registra el modelo que la produjo: el reparto por proveedor es trazable y verificable.
Con total transparencia: esto atenúa el sesgo, no lo elimina por completo. Lo mostramos como tal.
FAQ de credibilidad
¿Sustituye a un estudio de verdad?
Es una herramienta de ayuda a la decisión y de priorización, no un sustituto total del trabajo de campo en decisiones de muy alto riesgo. Va perfecta para filtrar conceptos, pretestear un mensaje o un packaging e iterar rápido, y luego reservar el campo para los arbitrajes críticos.
¿Por qué es fiable si es tan barato?
El precio bajo viene del compute marginal (modelo Haiku, Batch API, caching), no de un recorte en el método. El rigor (elicitación semántica, calibración, intervalos de confianza) es idéntico; lo que se desploma es el coste de producción.
¿Y los sesgos de las IA?
Existen (homogeneidad, estereotipos, sesgo cultural o de deseabilidad). Los mitigamos con la diversidad forzada de los personas, salvaguardas de prompt, anclajes localizados y una calibración por mercado que corrige el desfase sistemático. Y mostramos los casos en que la fiabilidad es baja en lugar de ocultarlos.