Il problema delle ricerche tradizionali
Solo i grandi brand fanno ricerca con regolarità. Gli altri lanciano a intuito, perché la ricerca tradizionale è:
- Cara: da 5.000 € a 50.000 € per studio (reclutamento, incentivi, analisi).
- Lenta: da 3 a 8 settimane tra brief e risultati.
- Rigida: ogni variante di concept è un nuovo studio a pagamento.
- Distorta: campioni piccoli, bias di reclutamento, desiderabilità sociale.
Il metodo, spiegato in modo semplice
L'idea centrale del paper: disaccoppiare la produzione dell'opinione dalla sua misurazione. Non chiediamo un numero, misuriamo la sfumatura di una risposta libera.
Perché non chiedere direttamente un voto?
Chiedere «un voto da 1 a 5» a un LLM produce distribuzioni degenerate (rispondono tutti 4), forte sensibilità al prompt e scarsa correlazione con l'umano. La soluzione: lasciar esprimere liberamente la persona, poi valutare quel testo dall'esterno.
- 1
1. Persona eterogenee
Generiamo una popolazione eterogenea di rispondenti sintetici (età, professione, regione, atteggiamenti) per restituire varianza.
- 2
2. Risposta in linguaggio naturale
Ogni persona reagisce al concept con un verbatim, nella lingua e nella cultura del mercato simulato.
- 3
3. Voto Likert per similarità
Confrontiamo l'embedding del verbatim con frasi di ancoraggio (una per livello); la similarità del coseno dà un voto continuo e poi un punteggio calibrato.
Le frasi di ancoraggio (esempio IT, intenzione d'acquisto)
Lo scoring confronta ogni verbatim con un set di ancore versionato e validato per lingua. Esempio su una scala Likert a 5:
| Livello | Frase di ancoraggio |
|---|---|
| 1 | “Non lo comprerei di sicuro, non mi interessa per niente.” |
| 2 | “È poco probabile che lo compri, non mi convince davvero.” |
| 3 | “Non sono sicuro, forse, dipenderebbe.” |
| 4 | “Probabilmente lo comprerei, mi interessa.” |
| 5 | “Lo comprerei senza esitazioni, è esattamente ciò che mi serve.” |
La pubblicazione
«LLMs Reproduce Human Purchase Intent via Semantic Similarity Elicitation of Likert Ratings» (arXiv 2510.08338, ottobre 2025).
Autori: B. F. Maier, U. Aslak, L. Fiaschi, N. Rismal, K. Fletcher, C. C. Luhmann, R. Dow, K. Pappas, T. V. Wiecki.
Risultato: se correttamente promptati e calibrati, gli LLM riproducono le distribuzioni dell'intenzione d'acquisto umana a un livello statisticamente sfruttabile, valutato in particolare tramite un classificatore LightGBM.
La nostra calibrazione
Non chiediamo di crederci sulla parola: misuriamo di continuo lo scarto tra i nostri output sintetici e dati umani di riferimento (dataset pubblici, validazioni con partner, hold-out interno), e lo mostriamo.
- Correlazione sintetico ↔ umano
- 0,92
- Errore sul Top-2-Box
- 4%
- Copertura degli IC
- 94%
- Concept confrontati
- 26
Più cresce la base di validazioni, migliore (e più difendibile) diventa il metodo: un effetto rete sui dati.
Dati indicativi, versione showcase-v1
| Umano | Sintetico |
|---|---|
| 1.4 | 1.5 |
| 1.7 | 1.6 |
| 1.9 | 2.1 |
| 2.1 | 2 |
| 2.3 | 2.5 |
| 2.5 | 2.4 |
| 2.6 | 2.8 |
| 2.8 | 2.7 |
| 2.9 | 3.1 |
| 3 | 2.9 |
| 3.1 | 3.3 |
| 3.2 | 3.1 |
| 3.3 | 3.5 |
| 3.4 | 3.3 |
| 3.5 | 3.6 |
| 3.6 | 3.4 |
| 3.7 | 3.9 |
| 3.8 | 3.7 |
| 3.9 | 4.1 |
| 4 | 3.9 |
| 4.1 | 4.3 |
| 4.2 | 4.1 |
| 4.3 | 4.2 |
| 4.5 | 4.6 |
| 4.6 | 4.4 |
| 4.8 | 4.7 |
Intervalli di confidenza e punteggio di affidabilità
Ogni studio mostra un indice di affidabilità derivato dalla densità di calibrazione della categoria, dalla dimensione del panel (N → ampiezza degli IC) e dalla coerenza interna delle risposte.
Campione ampio: intervalli di confidenza stretti, alta affidabilità.
Campione intermedio: buona affidabilità, tieni a mente i margini.
Campione ridotto: risultato indicativo, da confermare con un panel più ampio.
Un comitato di modelli, non un giudice unico
Ogni rispondente sintetico proviene da una famiglia di modello diversa. Incrociare più IA diluisce il bias proprio di un singolo modello — come un panel umano diversificato anziché un'unica opinione.
- Claude
- GPT
- Gemini
- Grok
- Mistral
Meno bias da modello unico
Un solo LLM impone il suo stile e la sua cultura di addestramento a tutto il panel. Distribuendo i rispondenti su cinque famiglie (Claude, GPT, Gemini, Grok, Mistral) si attenua il bias idiosincratico di ciascuna.
Meno dipendenza
Se un fornitore non è disponibile o è limitato, lo studio prosegue sugli altri modelli. Nessuno studio dipende da un unico attore.
Diversità e sovranità
Il pool include un modello europeo (Mistral) accanto ai modelli statunitensi, per una diversità culturale e tecnologica reale.
Dimostrato, non promesso
Ogni risposta registra il modello che l'ha prodotta: la ripartizione per fornitore è tracciabile e verificabile.
In piena trasparenza: questo attenua il bias, non lo elimina del tutto. Lo dichiariamo come tale.
FAQ sulla credibilità
Sostituisce una vera ricerca?
È uno strumento di supporto alle decisioni e di prioritizzazione, non un sostituto totale del field per le decisioni ad altissima posta in gioco. Ideale per selezionare concept, pre-testare un messaggio o un packaging e iterare in fretta; il field lo tieni per gli arbitraggi critici.
Perché è affidabile se costa così poco?
Il prezzo basso deriva dal calcolo marginale (modello Haiku, Batch API, caching), non da un compromesso sul metodo. Il rigore resta identico (elicitazione semantica, calibrazione, intervalli di confidenza); è il costo di produzione che crolla.
E i bias dell'IA?
Esistono (omogeneità, stereotipi, bias culturale o di desiderabilità). Li mitighiamo con la diversità forzata delle persona, paletti nei prompt, ancore localizzate e una calibrazione per mercato che corregge lo scostamento sistematico. E mostriamo i casi in cui l'affidabilità è bassa, invece di nasconderli.