Vai al contenuto
La Scienza

Il rigore, non la magia

Panelia non è «un chatbot che dà i voti». È un metodo di elicitazione pubblicato, calibrato su dati umani, che dichiara la propria incertezza. Ecco come, nel dettaglio.

Il problema delle ricerche tradizionali

Solo i grandi brand fanno ricerca con regolarità. Gli altri lanciano a intuito, perché la ricerca tradizionale è:

  • Cara: da 5.000 € a 50.000 € per studio (reclutamento, incentivi, analisi).
  • Lenta: da 3 a 8 settimane tra brief e risultati.
  • Rigida: ogni variante di concept è un nuovo studio a pagamento.
  • Distorta: campioni piccoli, bias di reclutamento, desiderabilità sociale.

Il metodo, spiegato in modo semplice

L'idea centrale del paper: disaccoppiare la produzione dell'opinione dalla sua misurazione. Non chiediamo un numero, misuriamo la sfumatura di una risposta libera.

Perché non chiedere direttamente un voto?

Chiedere «un voto da 1 a 5» a un LLM produce distribuzioni degenerate (rispondono tutti 4), forte sensibilità al prompt e scarsa correlazione con l'umano. La soluzione: lasciar esprimere liberamente la persona, poi valutare quel testo dall'esterno.

  1. 1

    1. Persona eterogenee

    Generiamo una popolazione eterogenea di rispondenti sintetici (età, professione, regione, atteggiamenti) per restituire varianza.

  2. 2

    2. Risposta in linguaggio naturale

    Ogni persona reagisce al concept con un verbatim, nella lingua e nella cultura del mercato simulato.

  3. 3

    3. Voto Likert per similarità

    Confrontiamo l'embedding del verbatim con frasi di ancoraggio (una per livello); la similarità del coseno dà un voto continuo e poi un punteggio calibrato.

Le frasi di ancoraggio (esempio IT, intenzione d'acquisto)

Lo scoring confronta ogni verbatim con un set di ancore versionato e validato per lingua. Esempio su una scala Likert a 5:

LivelloFrase di ancoraggio
1Non lo comprerei di sicuro, non mi interessa per niente.
2È poco probabile che lo compri, non mi convince davvero.
3Non sono sicuro, forse, dipenderebbe.
4Probabilmente lo comprerei, mi interessa.
5Lo comprerei senza esitazioni, è esattamente ciò che mi serve.

La pubblicazione

«LLMs Reproduce Human Purchase Intent via Semantic Similarity Elicitation of Likert Ratings» (arXiv 2510.08338, ottobre 2025).

Autori: B. F. Maier, U. Aslak, L. Fiaschi, N. Rismal, K. Fletcher, C. C. Luhmann, R. Dow, K. Pappas, T. V. Wiecki.

Risultato: se correttamente promptati e calibrati, gli LLM riproducono le distribuzioni dell'intenzione d'acquisto umana a un livello statisticamente sfruttabile, valutato in particolare tramite un classificatore LightGBM.

Benchmark vivo

La nostra calibrazione

Non chiediamo di crederci sulla parola: misuriamo di continuo lo scarto tra i nostri output sintetici e dati umani di riferimento (dataset pubblici, validazioni con partner, hold-out interno), e lo mostriamo.

Correlazione sintetico ↔ umano
0,92
Errore sul Top-2-Box
4%
Copertura degli IC
94%
Concept confrontati
26

Più cresce la base di validazioni, migliore (e più difendibile) diventa il metodo: un effetto rete sui dati.

Dati indicativi, versione showcase-v1

Calibrazione: intenzione sintetica vs umana
1122334455Intenzione umana (riferimento)Intenzione Panelia
Intenzione umana vs sintetica, per concept
UmanoSintetico
1.41.5
1.71.6
1.92.1
2.12
2.32.5
2.52.4
2.62.8
2.82.7
2.93.1
32.9
3.13.3
3.23.1
3.33.5
3.43.3
3.53.6
3.63.4
3.73.9
3.83.7
3.94.1
43.9
4.14.3
4.24.1
4.34.2
4.54.6
4.64.4
4.84.7

Intervalli di confidenza e punteggio di affidabilità

Ogni studio mostra un indice di affidabilità derivato dalla densità di calibrazione della categoria, dalla dimensione del panel (N → ampiezza degli IC) e dalla coerenza interna delle risposte.

Affidabilità A

Campione ampio: intervalli di confidenza stretti, alta affidabilità.

Affidabilità B

Campione intermedio: buona affidabilità, tieni a mente i margini.

Affidabilità C

Campione ridotto: risultato indicativo, da confermare con un panel più ampio.

Panel multi-modello

Un comitato di modelli, non un giudice unico

Ogni rispondente sintetico proviene da una famiglia di modello diversa. Incrociare più IA diluisce il bias proprio di un singolo modello — come un panel umano diversificato anziché un'unica opinione.

  • Claude
  • GPT
  • Gemini
  • Grok
  • Mistral

Meno bias da modello unico

Un solo LLM impone il suo stile e la sua cultura di addestramento a tutto il panel. Distribuendo i rispondenti su cinque famiglie (Claude, GPT, Gemini, Grok, Mistral) si attenua il bias idiosincratico di ciascuna.

Meno dipendenza

Se un fornitore non è disponibile o è limitato, lo studio prosegue sugli altri modelli. Nessuno studio dipende da un unico attore.

Diversità e sovranità

Il pool include un modello europeo (Mistral) accanto ai modelli statunitensi, per una diversità culturale e tecnologica reale.

Dimostrato, non promesso

Ogni risposta registra il modello che l'ha prodotta: la ripartizione per fornitore è tracciabile e verificabile.

In piena trasparenza: questo attenua il bias, non lo elimina del tutto. Lo dichiariamo come tale.

FAQ sulla credibilità

Sostituisce una vera ricerca?

È uno strumento di supporto alle decisioni e di prioritizzazione, non un sostituto totale del field per le decisioni ad altissima posta in gioco. Ideale per selezionare concept, pre-testare un messaggio o un packaging e iterare in fretta; il field lo tieni per gli arbitraggi critici.

Perché è affidabile se costa così poco?

Il prezzo basso deriva dal calcolo marginale (modello Haiku, Batch API, caching), non da un compromesso sul metodo. Il rigore resta identico (elicitazione semantica, calibrazione, intervalli di confidenza); è il costo di produzione che crolla.

E i bias dell'IA?

Esistono (omogeneità, stereotipi, bias culturale o di desiderabilità). Li mitighiamo con la diversità forzata delle persona, paletti nei prompt, ancore localizzate e una calibrazione per mercato che corregge lo scostamento sistematico. E mostriamo i casi in cui l'affidabilità è bassa, invece di nasconderli.

Pronto a vedere il metodo all'opera?

Avvia uno studio gratuito, oppure leggi l'articolo di ricerca che sta alla base di Panelia.