CISP1

Aptar do Brasil Embalagens

Design Document · PoC

Synthetic Consumer Panel & Consumer Behavior Model

Validação técnica da construção de consumidores sintéticos fundamentados em pesquisas históricas proprietárias, com métricas mensuráveis de fidelidade contra resultados humanos observados.

Cliente
Aptar do Brasil Embalagens Ltda.
Documento
Design Doc — Proposição de PoC
Projeto
Synthetic Consumer Panel & Consumer Behavior Model
Documento Elaborado por
CISP1 Soluções de Tecnologia Ltda.
Classificação
Técnico / Confidencial
Público-alvo
Liderança de Inovação

Sumário

Resumo Executivo

A proposta desta PoC é avaliar se o histórico de pesquisas reais com consumidores realizadas pela Aptar pode ser convertido em um Synthetic Consumer Panel capaz de apoiar a avaliação preliminar de novos conceitos de embalagem e, no futuro, constituir um ativo proprietário e cumulativo de Consumer Intelligence aplicado ao desenvolvimento de produtos.

O ponto central é utilizar dados reais da própria Aptar — perfis de consumidores, respostas quantitativas, comentários qualitativos, características das embalagens, contexto dos testes e decisões anteriores — para construir consumidores sintéticos fundamentados em evidências históricas.

Lógica técnica da PoC

  1. 01

    Pesquisas históricas Aptar

    Base de evidências proprietária

  2. 02

    Consumer Behavior Dataset

    Estruturação de perfis, respostas e contexto

  3. 03

    Synthetic Consumer Agents

    Consumidores sintéticos fundamentados em dados

  4. 04

    Reprodução de testes já realizados

    Experimentos retrospectivos

  5. 05

    Comparação IA × consumidores reais

    Métricas de fidelidade

  6. 06

    Consumer Calibration Engine

    Ajuste sistemático dos desvios

  7. 07

    Modelo Comportamental

    Ativo cumulativo de Consumer Intelligence

Encadeamento das etapas da PoC

A validação será retrospectiva e quantitativa. Parte dos estudos históricos será utilizada para construir e calibrar os agentes, enquanto outra parte será mantida como holdout, sem exposição prévia ao modelo. Nesses casos, a IA receberá os mesmos conceitos, perfis e questionários utilizados originalmente e deverá prever os resultados antes que as respostas reais sejam utilizadas para comparação.

A avaliação deverá considerar correlação entre notas, erro médio, distribuição das respostas, ranking entre conceitos, preferência A/B, comportamento por segmento e similaridade dos principais temas qualitativos. Uma das principais métricas será a Decision Fidelity: em quantos estudos o painel sintético teria levado à mesma decisão de desenvolvimento obtida a partir do painel humano.

Impacto sobre o ciclo e a economia da inovação

O potencial econômico do projeto está diretamente relacionado às características do processo de inovação da Aptar. O desenvolvimento de novos produtos pode exigir investimentos relevantes antes que exista evidência suficiente de aceitação pelo consumidor. Entre a concepção inicial e essa validação existem etapas de engenharia, design, desenvolvimento técnico e prototipagem que consomem tempo, recursos especializados e CAPEX.

O processo atual pode ser representado, de forma simplificada, como:

Conceito → Design → Conceito técnico → Engenharia →
Protótipo físico → Teste com consumidores → Feedback → Decisão
Processo atual

Uma limitação estrutural desse processo é que parte relevante do investimento ocorre antes da obtenção do feedback real do consumidor. Quando os resultados são negativos ou indicam necessidade de mudanças significativas, uma parcela do custo, CAPEX e tempo de engenharia já foi comprometida.

O Synthetic Consumer Panel introduz uma nova etapa de validação antecipada:

Conceito → Simulação com consumidores sintéticos → Seleção/ajuste →
Design e Engenharia → Protótipo → Teste real
Processo com validação antecipada

Isso não elimina a necessidade de protótipos ou testes físicos. A mudança econômica está em permitir que menos conceitos inadequados avancem para as etapas mais caras e demoradas do processo.

Roadblock atualPotencial contribuição do projeto
CAPEX elevado associado à inovaçãoFiltrar conceitos antes de investimentos físicos relevantes
Incerteza associada ao CAPEXIncorporar evidência comportamental mais cedo no processo decisório
Ciclos longos de desenvolvimentoRealizar mais ciclos de avaliação ainda na fase digital
Protótipos necessários antes do feedbackAntecipar parte do feedback antes da construção física
Feedback negativo em estágio avançadoIdentificar potenciais problemas quando modificações ainda possuem menor custo
Número limitado de conceitos testáveisAvaliar digitalmente um universo significativamente maior de alternativas

O impacto potencial, portanto, não deve ser medido apenas pelo custo evitado em pesquisas tradicionais. A variável econômica mais relevante é a possibilidade de reduzir o custo da incerteza ao longo do processo de inovação.

Um conceito inadequado identificado digitalmente no início possui custo de correção relativamente baixo. O mesmo problema identificado depois de engenharia, desenvolvimento de ferramental, prototipagem e testes físicos pode representar meses adicionais e investimentos significativamente maiores.

De pesquisas históricas para um ativo estratégico

O potencial de longo prazo é maior do que a própria PoC. A Aptar pode transformar anos de pesquisas realizadas globalmente em um Modelo Comportamental Calibrado, combinando dados históricos, modelos estatísticos/machine learning e IA multimodal.

Esse modelo poderá aprender relações como:

Consumidor × Características da embalagem × Categoria ×
Mercado × Contexto → Comportamento esperado

A plataforma poderá então evoluir da reprodução de questionários para estimar quais conceitos apresentam maior probabilidade de aceitação, quais atributos reduzem intenção de compra, quais características aumentam percepção de valor, quais segmentos apresentam maior risco de rejeição e quais alternativas justificam investimento em desenvolvimento físico.

Há uma aderência direta entre essa capacidade e um diferencial estratégico relevante para a Aptar: aumentar a velocidade de inovação sem aumentar proporcionalmente a exposição financeira associada à experimentação. A tecnologia permite deslocar parte do processo de tentativa, comparação e aprendizado para uma etapa digital, na qual testar alternativas possui custo marginal e tempo significativamente inferiores aos de ciclos físicos.

O ativo principal do projeto não será, portanto, um modelo genérico de IA. Será a combinação de dados proprietários da Aptar + histórico global de comportamento real de consumidores + metodologia de calibração + aprendizado contínuo.

Cada novo teste físico poderá retroalimentar o modelo, aumentando progressivamente sua base de evidências e sua capacidade de previsão. Se a PoC demonstrar níveis adequados de fidelidade, o projeto cria as bases para converter conhecimento histórico disperso em uma capacidade proprietária de Consumer Intelligence e, simultaneamente, atuar sobre três dos principais fatores econômicos que limitam a inovação: CAPEX, incerteza e tempo.

Seção 1

Objetivo da PoC

A Prova de Conceito tem como objetivo validar a viabilidade técnica da criação de um Synthetic Consumer Panel baseado em dados reais de pesquisas históricas, capaz de simular avaliações preliminares de consumidores sobre novos conceitos de embalagem.

A PoC não tem como objetivo criar personas genéricas exclusivamente a partir de atributos demográficos ou do conhecimento prévio de modelos de linguagem. Desde a primeira etapa, os consumidores sintéticos são construídos a partir de evidências comportamentais reais: dados históricos de pesquisas de consumidor, perfis dos respondentes, avaliações quantitativas, comentários qualitativos e características dos conceitos anteriormente avaliados.

Hipótese central

Dados históricos acumulados pela empresa podem ser utilizados para construir consumidores sintéticos capazes de reproduzir, com nível estatisticamente mensurável de fidelidade, padrões de avaliação observados em consumidores reais.

O objetivo não é substituir pesquisas reais com consumidores, mas criar uma nova camada de experimentação anterior a elas. O Synthetic Consumer Panel deve permitir que um número significativamente maior de alternativas seja analisado durante as fases iniciais de desenvolvimento, selecionando os conceitos mais promissores para posterior validação com consumidores reais.

Seção 2

Papel estratégico da PoC

A PoC é a primeira etapa de preparação, organização dos dados e validação técnica necessária para uma futura solução de Produção baseada em um Modelo Comportamental Calibrado. A oportunidade central está no histórico de pesquisas acumulado por uma organização global dedicada ao desenvolvimento de embalagens.

Atualmente, cada pesquisa gera conhecimento principalmente para uma decisão pontual:

Novo conceito

Briefing / hipótese

Pesquisa

Consumidores reais

Resultados

Dados do estudo

Decisão

Go / no-go pontual

Estudo arquivado

Conhecimento inerte

Fluxo atual — conhecimento não cumulativo

O projeto propõe transformar esse fluxo em um processo cumulativo:

Milhares de consumidores reais

Amostras acumuladas

Anos de pesquisas históricas

Estudos arquivados

Centenas/milhares de conceitos

Variações testadas

Entradas — base de evidências proprietária
  1. 01

    Consumer Behavior Dataset

    Estruturação e normalização das evidências

  2. 02

    Consumer Behavior Model

    Modelo comportamental treinado e calibrado

  3. 03

    Synthetic Consumer Panel

    Simulação de resposta a novos conceitos

  4. 04

    Novos testes físicos

    Validação com consumidores reais

  5. 05

    Novos dados

    Incorporados ao dataset

  6. 06

    Recalibração

    Ciclo contínuo — o ativo melhora a cada iteração

Fluxo proposto — ativo cumulativo de Consumer Intelligence

Cada pesquisa realizada no futuro passa também a gerar novos dados para aperfeiçoamento do modelo. A principal oportunidade tecnológica não está apenas na utilização de IA Generativa, mas em transformar um grande conjunto de informações históricas proprietárias em um ativo reutilizável de inteligência comportamental sobre consumidores e embalagens.

Seção 3

Consumer Behavior Dataset

A primeira atividade estrutural é transformar os estudos históricos disponíveis em um dataset consistente. Idealmente, cada observação relaciona quatro dimensões.

3.1 Consumidor

  • Consumer ID anonimizado
  • Idade
  • Gênero
  • Geografia
  • Renda / faixa socioeconômica
  • Composição familiar
  • Categoria de consumidor
  • Frequência de utilização
  • Marcas utilizadas
  • Hábitos relevantes
  • Heavy / light user
  • Outras segmentações utilizadas nos estudos

3.2 Conceito avaliado

  • Concept ID
  • Categoria
  • Tipo de embalagem
  • Dimensões
  • Materiais
  • Sistema de dispensação
  • Características funcionais
  • Características visuais
  • Design
  • Claims
  • Preço
  • Marca
  • Imagens e renders
  • CAD / 3D, quando disponível

3.3 Contexto da pesquisa

  • País
  • Mercado
  • Data
  • Metodologia
  • Questionário
  • Contexto apresentado ao participante
  • Ordem de apresentação
  • Conceitos concorrentes
  • Condições do teste

3.4 Resposta observada

  • Overall appeal
  • Design
  • Usability
  • Ergonomics
  • Premium perception
  • Perceived value
  • Purchase intent
  • Preference
  • Scores específicos
  • Comentários abertos
  • Pontos positivos e negativos
  • Escolha entre conceitos

Essa estrutura permite transformar milhares ou milhões de respostas independentes em relações do tipo:

CONSUMER

Perfil e histórico

PRODUCT

Conceito / embalagem

CONTEXT

Mercado, canal, uso

OBSERVED BEHAVIOR

Resposta registrada

Unidade fundamental de observação

Essa é a estrutura fundamental para o futuro treinamento do modelo comportamental.

Seção 4

Experimento 1 — Grounded Synthetic Consumers

A PoC inicia diretamente com consumidores sintéticos fundamentados em dados históricos. Cada agente possui um Consumer State, construído a partir das informações disponíveis.

Consumer Agent #00872

Consumer State

Demographics

  • Age
  • Gender
  • Geography
  • Socioeconomic profile

Consumption

  • Category usage
  • Purchase frequency
  • Brands
  • Price sensitivity

Behavior

  • Innovation propensity
  • Brand loyalty
  • Premium preference
  • Convenience orientation
  • Sustainability sensitivity

Historical Evidence

  • Previous scores
  • Previous preferences
  • Previous comments
  • Previous concept evaluations
Exemplo conceitual de Consumer State

Seção 5

Experimento 2 — Consumer Digital Twins

Na segunda etapa da PoC é selecionado um subconjunto de consumidores ou perfis para os quais existam informações históricas suficientemente detalhadas. A partir dessas informações são construídos Consumer Digital Twins: representações comportamentais de consumidores reais ou de consumidores estatisticamente equivalentes.

Quanto maior a quantidade de evidências históricas disponíveis sobre determinado perfil, menor a necessidade de o modelo inferir comportamento apenas com base em atributos demográficos. O objetivo é determinar se esses Digital Twins conseguem reproduzir respostas anteriormente observadas.

Seção 6

Treinamento por reprodução de testes históricos

Esta é uma das etapas mais importantes da PoC. O princípio é utilizar pesquisas cujo resultado já é conhecido como experimentos retrospectivos. Supondo a existência de 100 pesquisas históricas:

PartiçãoFinalidadeEstudosProporção
Grounding / TrainConstrução dos consumidores sintéticos6262%
CalibrationAjuste do Consumer Calibration Engine1818%
Holdout TestValidação cega dos resultados2020%
TotalBase histórica considerada100100%

Os estudos de Holdout Test permanecem fora do processo de desenvolvimento e calibração. Para cada um deles é reproduzido digitalmente o experimento originalmente realizado. O sistema recebe perfil dos consumidores, conceito apresentado, imagens/renders, atributos conhecidos, contexto e questionário original — mas não recebe as respostas reais.

Teste histórico — Concept X submetido em paralelo

Human Panel

Painel original de consumidores

Resultado Real

Synthetic Panel

Agentes sintéticos fundamentados

Resultado IA

Comparação

Aderência de scores, ranking e razões declaradas frente ao gabarito histórico

Protocolo de comparação retrospectiva

Isso permite avaliar o sistema contra um gabarito construído antes da própria PoC.

Seção 7

Comparação das notas

Um primeiro teste é verificar a capacidade de reproduzir scores.

Exemplo ilustrativo de comparação de scores
IndicadorPainel humanoPainel sintético
Overall Appeal8,17,8
Ease of Use6,46,7
Premium Perception7,67,2
Purchase Intent5,96,1

Podem ser calculadas métricas como:

  • Pearson Correlation
  • Spearman Correlation
  • Mean Absolute Error — MAE
  • Root Mean Squared Error — RMSE
  • Diferenças entre distribuições

Não interessa somente que a média seja semelhante: é necessário verificar se a distribuição das opiniões está sendo reproduzida. Um painel humano pode ter:

20%
Avaliação baixa
45%
Avaliação média
35%
Avaliação alta
Distribuição observada — painel humano
Uma simulação que concentre todos os consumidores na avaliação média pode produzir a mesma média geral, mas não reproduz corretamente o comportamento observado.

Seção 8

Segment Fidelity

O sistema deve também reproduzir diferenças reais entre segmentos.

Concept A — comparação por faixa de idade (escala 0–10)
Faixa de idadeHumanSyntheticΔ
18–258.28.0−0.2
26–357.77.8+0.1
36–506.46.6+0.2
50+5.96.1+0.2

A análise pode ser estendida para:

  • Países
  • Categorias
  • Heavy / light users
  • Compradores premium
  • Comportamento de consumo
  • Outras segmentações existentes
Modelos generativos podem superestimar o impacto de características demográficas, criando diferenças artificiais entre grupos. Diferenças entre segmentos só devem ser consideradas confiáveis depois de validadas contra dados humanos históricos.

Seção 9

Qualitative Fidelity

Os comentários também devem ser comparados. Consumidores humanos podem ter identificado:

32%
Dificuldade de acionamento
24%
Tamanho
18%
Aparência pouco premium
11%
Dificuldade de identificar abertura
Principais problemas apontados pelo painel humano

O painel sintético deve identificar temas semelhantes. Podem ser utilizados:

  • Embeddings
  • Clustering
  • Topic modeling
  • Classificação semântica
  • Análise de frequência
  • Análise de similaridade

Não se espera que o modelo reproduza literalmente as frases dos consumidores. O objetivo é reproduzir os drivers de percepção.

Seção 10

Decision Fidelity

Esta é uma das métricas executivas mais relevantes. Após cada pesquisa histórica existia uma decisão:

GoReviseNo-Go

Ou registrada de forma qualitativa, por exemplo: “Concept B deve avançar.”

Espaço de decisão

A decisão pode ser reconstruída utilizando exclusivamente o painel sintético. A métrica passa a ser: em que percentual dos estudos o sistema teria recomendado a mesma decisão que foi tomada com base no painel humano?

Decision Fidelity conecta a qualidade estatística do modelo à finalidade empresarial da solução.

Seção 11

Consumer Calibration Engine

As primeiras versões dos consumidores são construídas utilizando as evidências históricas disponíveis. Diferenças entre comportamento sintético e comportamento real são então utilizadas para calibrar o sistema. Cada consumidor ou segmento pode possuir parâmetros latentes:

price_sensitivity0.71
novelty_preference0.43
brand_loyalty0.82
design_weight0.74
ergonomics_weight0.89
premium_preference0.61
sustainability_weight0.37
risk_aversion0.58
Parâmetros latentes por consumidor ou segmento (escala 0–1)

Esses valores não são definidos arbitrariamente: são inicialmente inferidos dos dados históricos e posteriormente ajustados pelo Consumer Calibration Engine.

Historical test

Human Panel

Resultado histórico real

Human Results

Synthetic Panel

Simulação com parâmetros atuais

Synthetic Results

Error

Diferença mensurada entre resultado real e resultado sintético.

Loop de correção

ErrorCalibration EngineConsumer Behavior ParametersSynthetic Panel

Os parâmetros são reajustados até que o erro caia abaixo dos limites definidos; cada novo teste físico realimenta o ciclo.

Loop de calibração

O objetivo matemático é minimizar diferenças entre:

Synthetic Consumer Behavior

Saída do painel sintético

Observed Human Behavior

Evidência histórica real

Erro residual → mínimo

Alvo de otimização

Função-objetivo da calibração — minimizar o resíduo

O processo é executado repetidamente sobre diferentes estudos históricos.

Seção 12

Evolução para Modelo Comportamental Calibrado

O Consumer Calibration Engine é a ponte entre a PoC e o sistema de Produção. Na PoC, o LLM ainda tem participação relevante na geração das respostas. Na arquitetura de Produção, recomenda-se separar dois motores.

Motor quantitativo

Responsável por estimar probabilidades e scores:

01

P(Purchase Intent | Consumer, Product, Context)

Probabilidade de intenção de compra condicionada ao consumidor, produto e contexto de uso.

Probabilidade
02

P(Preference A > B | Consumer, Product, Context)

Probabilidade de preferência entre dois conceitos comparados em pares.

Probabilidade
03

Expected Appeal Score

Valor esperado de atratividade do conceito na escala do estudo.

Score
04

Expected Premium Perception

Valor esperado de percepção de valor premium.

Score
05

Expected Usability Score

Valor esperado de usabilidade percebida em uso simulado.

Score
Saídas do motor quantitativo

Podem ser utilizados modelos estatísticos e de machine learning adequados ao volume e à estrutura dos dados.

Motor qualitativo

O LLM utiliza os resultados quantitativos, atributos do produto e Consumer State para gerar explicações, comentários, drivers, oportunidades de melhoria, análises comparativas e resumos executivos.

Behavioral Model

Purchase Intent6.2
Usability8.1
Premium4.7

LLM

Considero a embalagem prática e fácil de utilizar, mas seu acabamento reduz minha percepção de produto premium.
Encadeamento quantitativo → qualitativo

Abordagem adotada

Score calculado pelo motor quantitativo, texto gerado pelo LLM

A nota é estimada por modelo calibrado sobre evidência histórica; o LLM apenas verbaliza a justificativa.

Alternativa frágil

LLM gera nota e justificativa simultaneamente

A nota passa a depender da geração textual, sem calibração contra resultados humanos observados.

Tecnicamente mais defensável do que pedir ao LLM que invente simultaneamente a nota e sua justificativa.

Comparação de arquiteturas de geração de resposta

Seção 13

Arquitetura recomendada

Historical Research

Consumer Behavior Dataset

Camadas derivadas do dataset

Consumer Knowledge

Calibration Engine

Modelo + entrada de produto

Behavioral Model

Product Digital Twin

  • CAD / Images
  • Technical Attributes
  • Functional Attributes
  • Claims / Price

Simulation Engine

Painel sintético instanciado

Consumer Agent 1

Consumer Agent 2

Consumer Agent N

Survey Engine

Statistical Analysis

Qualitative AI Analysis

Decision & Insight Engine

Dashboard

Arquitetura conceitual da solução

Na PoC, alguns desses componentes podem ser simplificados. A arquitetura, entretanto, deve ser construída de forma a permitir sua evolução para o Modelo Comportamental Calibrado de Produção.

Seção 14

Volumetria inicial de dados

Não existe um número universal de estudos ou respondentes necessário. A suficiência estatística depende principalmente da heterogeneidade dos produtos, países, categorias e segmentos que se pretende modelar. Como referência inicial:

Referências de planejamento — não requisitos estatísticos rígidos
DimensãoIdeal PoCProdução inicial
Estudos históricos30–50100+
Conceitos50–100250+
Respondentes10.000+20.000–50.000+
Respostas individuais100k+500k+
Comentários qualitativos10.000+50.000+
Categorias1expansão progressiva
Mercados / países1expansão progressiva

A recomendação é começar por uma categoria ou conjunto relativamente homogêneo de produtos onde exista elevada densidade histórica.

Seção 15

Mais importante que volume: densidade e comparabilidade

Quantidade isoladamente não garante qualidade. Por exemplo:

Alta densidade por consumidor

100
estudos
500
consumidores
20
respostas
1.000.000

observações

Baixa densidade por consumidor

1.000
estudos
50
consumidores
3
respostas
150.000

observações

São particularmente valiosos estudos nos quais:

  • Consumidores avaliaram múltiplos conceitos
  • Os mesmos questionários foram utilizados repetidamente
  • Conceitos possuem atributos estruturados
  • Existem comentários qualitativos
  • Há identificação consistente de segmentos
  • A metodologia permaneceu relativamente estável

A existência de comparações A/B ou A/B/C possui especial valor para treinamento de modelos de preferência.

Seção 16

Benchmarking — mercado e evidências externas

A utilização de consumidores sintéticos deixou de ser apenas uma hipótese acadêmica. Existem iniciativas comerciais e pesquisas científicas relevantes que demonstram tanto seu potencial quanto suas limitações.

17.1 Colgate-Palmolive — Digital Twins de consumidores

A Colgate-Palmolive informou publicamente estar utilizando digital twins de potenciais consumidores para testar ideias de novos produtos. Segundo informações divulgadas durante o Reuters NEXT, os consumidores digitais foram desenvolvidos internamente para reagir a novos atributos e claims de possíveis produtos.

Aspecto especialmente relevante: a Colgate não posiciona os Digital Twins como substitutos definitivos dos consumidores humanos — a empresa declarou que continua realizando testes posteriores com consumidores reais. A empresa também utiliza IA generativa sobre seu acervo proprietário de consumer research, permitindo que funcionários consultem conhecimento acumulado em pesquisas anteriores.

Proprietary Consumer Research

Acervo histórico de pesquisas com consumidores reais

AI

Estruturação, modelagem e calibração

Reusable Consumer Intelligence

Conhecimento consultável e reaproveitável

Synthetic Consumer Simulation

Testes de conceito antes de campo

Similaridade conceitual com a oportunidade proposta

Fonte pública: Reuters, dezembro de 2024.

Seção 17

Benchmark — NIQ BASES

A NIQ, uma das maiores organizações globais de consumer intelligence, vem desenvolvendo modelos de Synthetic Respondents. A abordagem divulgada enfatiza que uma solução confiável exige muito mais do que conectar personas a um LLM: a empresa afirma utilizar seus extensos conjuntos de dados de consumidores e experiência histórica em modelos analíticos como base de desenvolvimento.

Test

Calibrate

Validate

Princípio metodológico declarado
  1. 01

    Human Consumer Data

    Base de evidência real

  2. 02

    Synthetic Model

    Modelo derivado dos dados históricos

  3. 03

    Testing

    Confronto contra estudos conhecidos

  4. 04

    Calibration

    Ajuste de parâmetros por erro residual

  5. 05

    Validation

    Verificação em holdout não utilizado

  6. 06

    Deployment

    Uso operacional em novos conceitos

Requisitos alinhados à arquitetura proposta

A NIQ posiciona atualmente Synthetic Respondents principalmente como mecanismo para avaliação e otimização rápida de conceitos em estágios iniciais, preservando pesquisas humanas para questões que demandam evidência direta do consumidor — posicionamento próximo da utilização pretendida neste projeto.

Seção 18

Benchmark — Qualtrics Synthetic Panels

A Qualtrics já disponibiliza comercialmente Synthetic Panels. Segundo sua documentação, seu modelo proprietário é treinado utilizando milhares de respostas provenientes de diferentes perfis demográficos para estimar como determinadas populações responderiam a pesquisas.

Synthetic Consumers tornam-se mais defensáveis quando construídos sobre grandes conjuntos de respostas humanas, em vez de simplesmente utilizar conhecimento genérico do Foundation Model.

A Qualtrics também destaca validação estatística dos dados sintéticos, comparando distribuições, correlações e padrões entre dados reais e sintéticos. Entre as técnicas mencionadas:

  • Análise de matrizes de correlação
  • Testes de distribuição
  • Medidas de divergência
  • Validação contra dados reais

A empresa mantém pesquisas sintéticas e humanas como instrumentos complementares: synthetic research para velocidade e amplitude na exploração inicial, human research para validação de decisões relevantes.

Seção 19

Benchmark acadêmico — Stanford

Um dos estudos acadêmicos mais relevantes sobre o tema foi conduzido por pesquisadores de Stanford e outras instituições. Foram construídos agentes representando 1.052 indivíduos reais. Em vez de fornecer apenas informações demográficas, os pesquisadores utilizaram entrevistas qualitativas extensas realizadas com cada participante.

Os agentes reproduziram respostas no General Social Survey com desempenho equivalente a aproximadamente 85% da consistência com que os próprios participantes humanos reproduziram suas respostas duas semanas depois. Agentes baseados em entrevistas detalhadas apresentaram menos vieses do que agentes construídos somente com descrições demográficas.

Persona demográfica

Demographic Persona

produz

Informação limitada

Baixa densidade de evidência: idade, renda e região não determinam comportamento.

Agente comportamental

Rich Historical Evidence

produz

Behavioral Agent

Alta densidade de evidência: respostas e comportamentos observados do próprio indivíduo.

Densidade de evidência individual × capacidade de representação

Quanto maior a quantidade de evidência comportamental individual relevante, maior tende a ser a possibilidade de representar adequadamente aquele consumidor.

Seção 20

Benchmark acadêmico — limitações dos Synthetic Consumers

Também existem resultados recentes que recomendam cautela. Um benchmark publicado em 2026 avaliou diferentes modelos de linguagem em dados humanos provenientes do General Social Survey e do World Values Survey. O estudo encontrou que modelos condicionados principalmente por dados demográficos tendiam a atribuir importância excessiva à demografia, exagerando diferenças entre segmentos. Em determinadas tarefas de segmentação, as diferenças entre grupos foram ampliadas artificialmente pelos modelos.

Decisão arquitetural fundamental: não construir Synthetic Consumers simplesmente através de prompts demográficos. O comportamento deve ser grounded em dados históricos e posteriormente calibrado contra resultados humanos.

Outro estudo de 2026, comparando cinco LLMs com uma pesquisa real de 420 profissionais, encontrou respostas sintéticas plausíveis, mas dificuldade em reproduzir descobertas contraintuitivas presentes nos dados humanos. Portanto: plausibilidade não significa capacidade preditiva — premissa central da PoC.

Seção 21

Implicações do benchmarking para o projeto

Abordagem não recomendada

  1. 01

    Demographics

  2. 02

    Prompt

  3. 03

    LLM

  4. 04

    Synthetic Consumer

Simples, mas insuficiente para uma aplicação que pretende apoiar decisões reais de desenvolvimento.

Abordagem recomendada

Historical Human Research

Consumer Characteristics

Product Characteristics

Observed Behavior

Consumer Behavior Dataset

  1. 01

    Behavioral Modeling

  2. 02

    Calibration

  3. 03

    Validation

  4. 04

    Synthetic Consumer Panel

Próxima das iniciativas tecnicamente maduras do mercado e das evidências acadêmicas disponíveis.

Seção 22

Critérios de sucesso da PoC

A PoC não deve ser considerada bem-sucedida porque seus agentes parecem humanos ou produzem comentários convincentes. Os resultados devem ser avaliados quantitativamente.

Painel de métricas de validação
MétricaObjetivo
Score Correlationreproduzir notas humanas
MAE / RMSEmedir magnitude dos erros
Distribution Fidelityreproduzir distribuição
Preference Accuracyreproduzir A × B
Segment Fidelityreproduzir diferenças reais
Qualitative Topic Overlapreproduzir drivers
Test-Retest Reliabilitymedir estabilidade
Decision Fidelityreproduzir decisão final

Métrica de maior relevância executiva

Este desenvolvimento comprova a viabilidade de se utilizar IA, Automação e tecnologia para desenvolver uma aplicação sob medida IA empresarial para a Aptar, “Global Packaging Consumer Behavior Model”, que comprovadamente produza valor a partir de dados históricos.

Seção 23

Evolução planejada

PoCGrounded Consumer Agents
  1. Historical Reproduction
  2. Calibration Engine
  3. Statistical Validation
Produção V1Calibrated Behavioral Model
  1. Synthetic Consumer Panel
  2. Novos testes reais
  3. Novos dados
  4. Recalibração
Produção V2+Continuous Learning
  1. Modelo recalibrado de forma recorrente
  2. Ganho cumulativo de aderência
Roadmap técnico da PoC à Produção V2+

Seção 24

Visão de produção

Com volume suficiente de dados históricos, o objetivo de longo prazo pode evoluir de Synthetic Consumer Panel para algo mais amplo: um Global Packaging Consumer Behavior Model. Um modelo proprietário capaz de aprender relações entre:

Consumer
Packaging Characteristics
Product Category
Country / Market
Brand
Price
Usage Context
Expected Consumer Behavior
Espaço de relações aprendidas

Isso permitiria futuramente não apenas responder questionários, mas executar análises preditivas:

  • Qual conceito possui maior probabilidade de aceitação?
  • Quais atributos estão reduzindo purchase intent?
  • Qual modificação provavelmente produzirá maior ganho?
  • Como determinado conceito deverá performar em diferentes mercados?
  • Que características aumentam percepção premium?
  • Quais segmentos apresentam maior risco de rejeição?
  • Quais conceitos devem avançar para pesquisa física?
  • Quais características de embalagem apresentam historicamente maior relação com aceitação?

Neste cenário, o principal ativo deixa de ser o próprio LLM. O ativo passa a ser a combinação de dados históricos proprietários, modelo comportamental calibrado, metodologia de validação e aprendizado contínuo — aspecto particularmente relevante em uma organização global que acumulou durante anos um grande volume de pesquisas, conceitos e respostas de consumidores.

Posicionamento da PoC

A PoC deve ser projetada não como uma demonstração isolada de IA Generativa, mas como a primeira etapa para transformar esse histórico em um ativo proprietário e cumulativo de Consumer Intelligence aplicado ao desenvolvimento dos produtos inovadores da Aptar.

25 · Encerramento

Investimento e Cronograma

Valor e prazo estimados para o desenvolvimento completo da Prova-de-Conceito descrita neste documento.

Investimento
USD 20.000,00
Desenvolvimento da Prova-de-Conceito
Prazo estimado
4 meses
1 mês de estruturação + 3 meses de desenvolvimento
  1. Fase 1 · 1 mês

    Estruturação detalhada do escopo e preparação do dataset

  2. Fase 2 · 3 meses

    Desenvolvimento, calibração e validação estatística da PoC