Aller au contenu
La Science

La rigueur, pas la magie

Panelia n'est pas « un chatbot qui note ». C'est une méthode d'élicitation publiée, calibrée sur des données humaines, qui affiche son incertitude. Voici comment, en détail.

Le problème des études classiques

Seules les grandes marques font des études régulièrement. Les autres lancent au feeling, parce que la recherche traditionnelle est :

  • Chère : 5 000 € à 50 000 € par étude (recrutement, incentives, analyse).
  • Lente : 3 à 8 semaines entre le brief et les résultats.
  • Rigide : chaque variante de concept est une nouvelle étude payante.
  • Biaisée : petits échantillons, biais de recrutement, désirabilité sociale.

La méthode, vulgarisée

L'idée centrale du papier : découpler la production de l'opinion de sa mesure. On ne demande pas un chiffre, on mesure la nuance d'une réponse libre.

Pourquoi pas demander une note directement ?

Demander « note de 1 à 5 » à un LLM donne des distributions dégénérées (tout le monde répond 4), une forte sensibilité au prompt et une mauvaise corrélation avec l'humain. La solution : laisser le persona s'exprimer librement, puis scorer ce texte de l'extérieur.

  1. 1

    1. Personas divers

    On génère une population hétérogène de répondants synthétiques (âge, CSP, région, attitudes) pour restaurer la variance.

  2. 2

    2. Réponse en langage naturel

    Chaque persona réagit au concept par un verbatim, dans la langue et la culture du marché simulé.

  3. 3

    3. Score Likert par similarité

    On compare l'embedding du verbatim à des phrases d'ancrage (une par niveau) ; la similarité cosinus donne une note continue puis un score calibré.

Les phrases d'ancrage (exemple FR, intention d'achat)

Le scoring compare chaque verbatim à un jeu d'ancres versionné et validé par langue. Exemple sur une échelle Likert 5 :

NiveauPhrase d'ancrage
1Je ne l'achèterais certainement pas, ça ne m'intéresse pas du tout.
2C'est peu probable que je l'achète, ça ne me convainc pas vraiment.
3Je ne suis pas sûr, peut-être, ça dépendrait.
4Je l'achèterais probablement, ça m'intéresse.
5Je l'achèterais sans hésiter, c'est exactement ce qu'il me faut.

La publication

« LLMs Reproduce Human Purchase Intent via Semantic Similarity Elicitation of Likert Ratings » (arXiv 2510.08338, octobre 2025).

Auteurs : B. F. Maier, U. Aslak, L. Fiaschi, N. Rismal, K. Fletcher, C. C. Luhmann, R. Dow, K. Pappas, T. V. Wiecki.

Résultat : correctement promptés et calibrés, les LLM reproduisent les distributions d'intention d'achat humaine à un niveau statistiquement exploitable, évalué via un classifieur LightGBM.

Benchmark vivant

Notre calibration

On ne demande pas de croire sur parole : on mesure en continu l'écart entre nos sorties synthétiques et des données humaines de référence (jeux publics, validations partenaires, hold-out interne), et on l'affiche.

Corrélation synthétique ↔ humain
0,92
Erreur sur le Top-2-Box
4 %
Couverture des IC
94 %
Concepts comparés
26

Plus la base de validations grandit, meilleure (et plus défendable) devient la méthode : un vrai effet de réseau de données.

Données indicatives, version showcase-v1

Calibration : intention synthétique vs humaine
1122334455Intention humaine (référence)Intention Panelia
Intention humaine vs synthétique, par concept
HumainSynthétique
1.41.5
1.71.6
1.92.1
2.12
2.32.5
2.52.4
2.62.8
2.82.7
2.93.1
32.9
3.13.3
3.23.1
3.33.5
3.43.3
3.53.6
3.63.4
3.73.9
3.83.7
3.94.1
43.9
4.14.3
4.24.1
4.34.2
4.54.6
4.64.4
4.84.7

Intervalles de confiance & score de fiabilité

Chaque étude affiche un indice de fiabilité dérivé de la densité de calibration de la catégorie, de la taille du panel (le N pilote la largeur des IC) et de la cohérence interne des réponses.

Fiabilité A

Grand échantillon : intervalles de confiance étroits, haute fiabilité.

Fiabilité B

Échantillon intermédiaire : bonne fiabilité, marges à garder en tête.

Fiabilité C

Échantillon réduit : résultat indicatif, à confirmer sur un panel plus large.

Panel multi-modèles

Un comité de modèles, pas un juge unique

Chaque répondant synthétique est tiré d'une famille de modèle différente. Croiser plusieurs IA dilue le biais propre à un modèle unique — comme un panel humain divers plutôt qu'un seul avis.

  • Claude
  • GPT
  • Gemini
  • Grok
  • Mistral

Moins de biais mono-modèle

Un seul LLM impose son style et sa culture d'entraînement à tout le panel. En répartissant les répondants sur cinq familles (Claude, GPT, Gemini, Grok, Mistral), on atténue le biais idiosyncratique de chacune.

Moins de dépendance

Si un fournisseur est indisponible ou limité, l'étude se poursuit sur les autres modèles. Aucune étude ne dépend d'un seul acteur.

Diversité et souveraineté

Le pool inclut un modèle européen (Mistral) aux côtés des modèles américains, pour une diversité culturelle et technologique réelle.

Prouvé, pas promis

Chaque réponse enregistre le modèle qui l'a produite : la répartition par fournisseur est traçable et vérifiable.

En toute transparence : c'est une atténuation du biais, pas une suppression totale. Nous l'affichons comme telle.

FAQ crédibilité

Est-ce que ça remplace une vraie étude ?

C'est un outil d'aide à la décision et de priorisation, pas un substitut total au terrain pour les décisions à très fort enjeu. Idéal pour trier des concepts, pré-tester un message ou un packaging et itérer vite, puis garder le terrain pour les arbitrages critiques.

Pourquoi est-ce fiable alors que c'est si peu cher ?

Le prix bas vient du compute marginal (modèle Haiku, Batch API, caching), pas d'un compromis sur la méthode. La rigueur reste identique : même élicitation sémantique, même calibration, mêmes intervalles de confiance. C'est le coût de production qui s'effondre.

Et les biais des IA ?

Ils existent (homogénéité, stéréotypes, biais culturel ou de désirabilité). On les mitige par la diversité forcée des personas, des garde-fous de prompt, des ancres localisées et une calibration par marché qui corrige le décalage systématique. Et on affiche les cas où la fiabilité est faible plutôt que de les masquer.

Prêt à voir la méthode à l'œuvre ?

Lancez une étude gratuite, ou lisez l'article de recherche qui fonde Panelia.