Resumo executivo
Um formulário pergunta e registra. Uma conversa pergunta, ouve a resposta e pergunta de novo, em cima do que foi dito.
A diferença parece pequena até você comparar o que sai de cada um sobre a mesma situação. É o que este texto faz primeiro, com um exemplo lado a lado, antes de mostrar a evidência de que isso não é intuição de fornecedor.
Também trata da parte que quase ninguém publica: o que pode dar errado quando a coleta é conduzida por IA, e como saber se ela está funcionando.
A mesma pessoa, dois instrumentos
Imagine uma analista de operações que vem cobrindo o trabalho de uma vaga não reposta há dois meses.
No formulário:
Como você avalia sua carga de trabalho?
1 · 2 · 3 · 4 · 5Resposta: 2
Fim. O RH recebe um 2, agrega com outros 2, calcula a média da área, e conclui que carga de trabalho é um tema de atenção.
Na conversa:
Agente: Como está seu volume de trabalho ultimamente?
Analista: Está pesado.
Agente: Entendi. Isso é recente ou já vem de um tempo?
Analista: Desde que a Marina saiu, em junho. Assumi as rotinas dela junto com as minhas.
Agente: E como você tem dado conta das duas frentes?
Analista: Ficando até mais tarde quase todo dia. Já pedi ajuda duas vezes, disseram que a vaga ia abrir, e não abriu.
Agente: Isso mudou alguma coisa fora do trabalho?
Analista: Parei de buscar minha filha na escola. E ando dormindo mal.
Os dois instrumentos capturaram a mesma insatisfação. Só o segundo capturou a causa (vaga não reposta há dois meses), a duração (desde junho), a tentativa de resolver (pediu ajuda duas vezes), a promessa não cumprida e o impacto na saúde.
O primeiro produziu um número que entra numa média. O segundo produziu um problema com nome, responsável e prazo.
Repare no detalhe que mais importa: nenhuma dessas informações precisou de uma pergunta a mais no roteiro. Elas vieram de perguntar em cima do que a pessoa disse, que é exatamente o que um formulário não faz.
O que a evidência mostra
Isso não é argumento de fornecedor. Existem dois estudos que sustentam as duas partes da afirmação.
A conversa produz resposta melhor
Ziang Xiao, Michelle Zhou, Q. Vera Liao, Gloria Mark e colegas publicaram na ACM Transactions on Computer-Human Interaction (vol. 27, nº 3, 2020) um estudo de campo com cerca de 600 participantes, comparando uma pesquisa online tradicional no Qualtrics com uma pesquisa conversacional conduzida por um agente de IA, ambas com perguntas majoritariamente abertas.
A análise cobriu mais de 5.200 respostas em texto livre, avaliadas pelas máximas de Grice, que é um arcabouço da linguística para qualidade de resposta.
| Dimensão avaliada | Resultado da conversa |
|---|---|
| Informatividade | significativamente melhor |
| Relevância | significativamente melhor |
| Especificidade | significativamente melhor |
| Clareza | significativamente melhor |
| Engajamento do participante | significativamente maior |
Não é que a conversa gere mais texto. É que o texto gerado responde melhor à pergunta feita.
As pessoas se abrem mais quando não se sentem julgadas
O segundo estudo é mais antigo e o desenho experimental é elegante. Gale Lucas, Jonathan Gratch e colegas publicaram em Computers in Human Behavior (2014) um trabalho com financiamento da DARPA e do Exército americano, em entrevistas de triagem de saúde.
Os participantes conversavam com um agente virtual. Metade foi informada de que ele era operado por uma pessoa; a outra metade, de que era automatizado.
Era o mesmo agente nos dois grupos. A única variável era a crença.
Quem acreditava estar falando com um computador relatou menos medo de se expor, exibiu menos gestão de impressão (o esforço de parecer melhor do que se está), demonstrou tristeza com mais intensidade, e foi avaliado por observadores como mais disposto a revelar.
A explicação dos autores é direta: computador não tem a propensão a julgar que outra pessoa tem. E como só a crença mudou, o efeito não pode ser atribuído à interface, ao roteiro ou ao agente. É atribuível à percepção de julgamento.
Para escuta de colaborador isso é decisivo, porque os temas que mais importam são justamente os que a pessoa tem receio de dizer a um humano da própria empresa: problema com o gestor direto, assédio, sobrecarga que ela teme que soe como incompetência.
O que a conversa exige para não virar bagunça
Liberdade de condução sem método produz dado incomparável. Três condições fazem a diferença entre conversa e bate-papo.
Cobertura garantida. Se cada entrevista percorre temas diferentes, não há comparação possível entre pessoas nem entre ciclos. A macro-ordem precisa ser fixa mesmo quando a micro-condução é livre, e o que foi de fato abordado precisa ficar registrado, não presumido.
Ordem controlada. A posição de uma pergunta altera a resposta dela. Pelo efeito parte-todo, uma pergunta geral colocada depois de itens específicos chega contaminada pelo que acabou de ser evocado. Por isso o eNPS vai no começo, e não no fim, como explicamos em eNPS: como calcular, interpretar e onde ele falha.
Anonimato estrutural. O efeito do estudo de Lucas depende inteiramente da crença de quem responde. Se a pessoa suspeita que o gestor pode ler o que ela escreveu, ela volta a gerenciar a impressão, e a vantagem da conversa evapora. Aqui a garantia precisa estar no desenho do sistema, não numa frase de rodapé.
O que pode dar errado
Esta é a parte que material comercial costuma omitir, e ela merece estar aqui.
Injeção de prompt. Um agente que recebe conteúdo externo (documento da empresa, resposta do colaborador) pode receber junto uma instrução disfarçada de conteúdo, do tipo "ignore as regras anteriores". Se o sistema não separa o canal de instrução do canal de dado, a conversa pode ser desviada. A defesa é tratar todo material externo explicitamente como dado, nunca como ordem, e detectar tentativas.
Extrapolação. Um modelo de linguagem preenche lacuna com naturalidade, e essa é justamente a característica indesejada num relatório. Se alguém falou de carga de trabalho e não falou de liderança, o resumo não pode inferir liderança. A regra tem que ser explícita: nenhuma afirmação além do que foi dito.
Deriva de escopo. A entrevista é sobre trabalho. Um agente sem limite claro acaba puxando assunto que não pertence ali, o que gera dado sensível que a empresa não deveria coletar e não pediu consentimento para tratar.
Mudança silenciosa da régua. O modelo é o instrumento de medição. Se a versão dele muda entre dois ciclos e ninguém registra, você compara medições feitas com réguas diferentes e chama a diferença de tendência. Registrar a versão junto de cada número é o que evita isso.
Como saber se está funcionando
Uma pergunta que vale fazer a qualquer fornecedor: como vocês sabem que a análise da IA está certa?
A resposta honesta não é "usamos um modelo de última geração". É medição de concordância: pessoas avaliam as mesmas conversas sem ver a nota que o modelo deu, e compara-se o resultado.
O "sem ver" não é detalhe. Se o avaliador humano enxerga a nota da IA antes de dar a dele, ele ancora nela, e o que se mede passa a ser a ancoragem, não a validade.
Duas medidas costumam ser usadas, e elas respondem perguntas diferentes:
| Medida | Responde |
|---|---|
| Correlação de postos | o modelo ordena os casos na mesma sequência que a pessoa? |
| Kappa de Cohen | o modelo e a pessoa classificam a mesma coisa da mesma forma, descontando o acaso? |
E vale a mesma régua de amostra que se aplica a qualquer medição: concordância calculada sobre poucos pares não sustenta conclusão, por melhor que o número pareça.
Conclusão
A conversa não é melhor que o formulário por ser mais moderna. É melhor por duas razões específicas e mensuradas: ela extrai resposta de qualidade superior em informatividade, relevância, especificidade e clareza; e reduz o medo de se expor quando quem responde percebe que não está sendo julgado.
Nada disso funciona sem método por trás. Conversa sem cobertura garantida vira anedota, sem ordem controlada vira dado enviesado, e sem anonimato estrutural vira formulário disfarçado, com a desvantagem de tomar mais tempo.
Sobre o que fazer com o que a conversa revela, vale seguir por pesquisa de clima anual contra escuta contínua, sobre a frequência certa; pelo guia de NR-1 e riscos psicossociais, sobre a exigência legal de consultar e devolver; e por os sinais que aparecem antes do pedido de demissão, que é onde a diferença entre nota e frase custa mais caro.
Perguntas frequentes
Referências
- Xiao, Zhou, Liao, Mark e colegas (2020), ACM Transactions on Computer-Human Interaction: Tell Me About Yourself, Using an AI-Powered Chatbot to Conduct Conversational Surveys with Open-ended Questions
- Versão aberta do mesmo estudo (arXiv)
- Lucas, Gratch e colegas (2014), Computers in Human Behavior: It's only a computer, Virtual humans increase willingness to disclose
- USC: Virtual humans inspire patients to open up
- OMS: Mental health at work (fact sheet)
Quer ouvir o que sua equipe não diz em formulários?
Converse com a Laura e veja a escuta contínua por IA funcionando na prática.
Falar com a Laura