Pergunte à Alexa qual é o melhor café da zona e recebe um nome. Não uma lista de dez opções, não uma "página seguinte", não uma escolha. Quem não aparece nessa única resposta deixa, pura e simplesmente, de existir para o utilizador.
É este o cerne da otimização para voice search em 2026. Já não se trata de ficar bem posicionado numa lista, mas de ser citado numa resposta que um assistente lê em voz alta. E essa resposta vem cada vez mais, não do índice de pesquisa clássico, mas de um modelo de linguagem que leu — ou não — o seu conteúdo.
Testo isto com regularidade: pergunto à Siri, à Alexa e ao ChatGPT por horários, preços e localizações de PME ao acaso. Em cerca de metade dos casos, recebo uma resposta vaga, um número de telefone desatualizado ou um "não sei". Isto não é um problema técnico. É um problema de conteúdo.
A pesquisa por voz funciona de outra forma: uma resposta em vez de dez links
Quando a pesquisa é escrita, as pessoas percorrem uma página de resultados, comparam duas ou três opções e clicam. Com voz, isso é impossível. Faz uma pergunta, recebe uma resposta e segue com o seu dia. Não há lugar para o segundo classificado.
Em 2026, esses assistentes funcionam quase todos com base num modelo de linguagem. A Siri usa o Apple Intelligence e, para perguntas mais complexas, passa para o ChatGPT. A Alexa+ foi reconstruída em torno de um LLM. O Google Assistant e o Gemini vão buscar respostas aos AI Overviews e ao Knowledge Graph. Para você, como proprietário de um site, pouco importa que modelo está por baixo: fazem todos o mesmo. Procuram um único facto e dão apenas um.
Isso muda a pergunta que tem de fazer. Não: "estou na primeira página?" Mas sim: "tenho a resposta que um assistente consegue ler em voz alta, e confia o suficiente na minha fonte para me mencionar?"
A otimização para voice search começa na pergunta, não na palavra-chave
Quem escreve, usa palavras-chave. Quem fala, usa frases completas. "Dentista Lisboa" passa a "que dentista em Lisboa ainda está aberto amanhã?" É exatamente por isso que a densidade de palavras-chave não serve de nada aqui. Um assistente não faz corresponder palavras soltas: faz corresponder significado.
Na prática, isto significa três coisas:
- Escreva os títulos como perguntas. "Quanto custa uma limpeza dentária?" funciona melhor do que "Preços de limpeza dentária". Um assistente lê esse título, vê a pergunta e vai buscar a resposta logo abaixo.
- Responda de imediato, em 40 a 60 palavras. Não comece com um parágrafo sobre a sua paixão pela saúde oral: vá direto ao valor ou ao horário. A explicação pode vir depois.
- Nomeie as entidades de forma explícita. O nome da sua empresa, a localidade, o serviço, o produto. Não "nós", mas "Clínica Dentária Silva, no Porto". Os modelos trabalham com entidades, não com termos soltos.
É a mesma lógica que está explicada com mais detalhe em AEO para empresas: o guia prático, com um requisito adicional: a resposta também tem de soar bem quando alguém a lê em voz alta.
Dados estruturados que os assistentes realmente utilizam
Alguns tipos de schema têm impacto direto nas respostas por voz:
- LocalBusiness com endereço completo, horários, número de telefone e coordenadas geográficas.
- FAQPage para perguntas frequentes — mas apenas se essas perguntas estiverem mesmo na página.
- Speakable para indicar qual bloco de texto é adequado para leitura em voz alta.
- Product com preço e disponibilidade, se vender algo.
Sem esta marcação, os assistentes têm de adivinhar. Com ela, sabem onde está a resposta. Isso evita-lhe incerteza desnecessária junto do utilizador.
O lado técnico: um assistente consegue sequer ler o seu site?
Uma resposta perfeita não vale nada se o bot não chegar à sua página. E é aí que, na prática, as coisas correm muitas vezes mal.
Em primeiro lugar: robots.txt. Muitos sites bloqueiam, sem querer, o GPTBot, o PerplexityBot, o OAI-SearchBot ou o Google-Extended. Parece uma escolha segura — "não queremos que a IA use o nosso conteúdo" — mas o resultado é ficar invisível precisamente nas respostas que os seus clientes ouvem em voz alta.
Em segundo lugar: renderização. Se o seu conteúdo só aparece via JavaScript, é uma lotaria que um assistente o consiga ver. Muitos crawlers de IA não esperam pelo JavaScript. O server-side rendering não é um luxo, é a base.
Em terceiro lugar: velocidade. Este é um dos poucos pontos em que as Core Web Vitals têm impacto direto na visibilidade nas IA. Uma página que demora quatro segundos a carregar fica de fora junto de assistentes que querem dar uma resposta em menos de um segundo. Em Core Web Vitals e crawlers de IA percebe quais são exatamente os limites.
Voice search local: onde as PME fazem a diferença
A maioria das perguntas por voz é local e ligada ao momento. "Há uma farmácia aberta aqui perto?" "Onde posso levar o carro para a inspeção?" São perguntas com dinheiro por trás — alguém precisa de resolver algo hoje.
Os assistentes vão buscar essa resposta a duas fontes: ao seu site e ao seu Perfil de Empresa no Google. Garanta que os dois não se contradizem. Nome da empresa, endereço, telefone e horários idênticos nos dois locais. Uma diferença de meia hora nos horários chega para fazer um assistente hesitar — e, nesse caso, não o menciona.
As avaliações desempenham aqui um papel maior do que muita gente pensa. Um assistente de voz escolhe mais facilmente um negócio com quarenta avaliações recentes do que um com três. Não porque o modelo analise sentimentos, mas porque a consistência e o volume sinalizam credibilidade.
O que deve sobretudo evitar
Alguns erros que vejo repetidamente na otimização para voice search:
Encher as perguntas por voz de palavras-chave. "Melhor canalizador barato Lisboa urgente 24 horas" num H2 soa a algo escrito por um robô — e um assistente percebe. Escreva como as pessoas falam.
Superlativos sem fundamento. "Somos o melhor web designer de Portugal" nunca é citado. Nenhum modelo repete isso sem uma fonte. O que funciona: "Construímos 47 websites para PME, em média online em seis semanas."
Esconder informação em PDFs ou imagens. Os assistentes não leem texto dentro de um PDF de brochura nem numa fotografia. Coloque preços, horários e condições em texto simples na página.
Informação importante atrás de um formulário. Se o utilizador tiver de iniciar sessão antes de obter a resposta, o assistente desiste. Sempre.
Como medir se está a funcionar
Voice search não é um canal no Google Analytics. Não há um filtro de "voz" que possa ativar. Por isso, tem de medir de forma indireta:
- Referências vindas de serviços de IA. Filtre nos seus analytics por referrers como chatgpt.com, perplexity.ai e gemini.google.com. Não é voz, mas é a mesma máquina por baixo.
- Volume de pesquisa pela marca. Se as pessoas pesquisam mais vezes o nome da sua empresa — por voz ou não — é sinal de que está a ser mencionado.
- Tráfego direto. Um aumento no tráfego "direto" sem campanha pode indicar pessoas que o encontraram através de um assistente e depois escrevem o nome diretamente.
- Testar você mesmo. Faça as mesmas dez perguntas à Siri, à Alexa e ao ChatGPT todos os meses. Registe quais respostas o mencionam, que fonte citam e o que muda.
Quer saber quanto custam e quanto rendem este tipo de projetos? Em Custos e ROI de GEO: quanto custa e o que dá? encontra intervalos realistas.
Perguntas frequentes
Como otimizo o meu site para voice search?
Escreva os títulos como perguntas naturais e responda de imediato em 40 a 60 palavras, no primeiro parágrafo sob o título. Acrescente schema LocalBusiness ou FAQPage, garanta que o site é renderizado do lado do servidor e permita os crawlers de IA no robots.txt. Além disso, garanta que o seu Perfil de Empresa no Google corresponde exatamente ao seu site. São estes os cinco passos base.
A otimização para voice search também funciona para negócios locais?
Mais do que isso: para negócios locais, é o maior ganho rápido. A maioria das perguntas por voz é local e ligada ao momento — horários, disponibilidade, "perto de mim". Garanta dados NAP consistentes (nome, endereço e telefone), horários atualizados e avaliações recentes suficientes. Para os assistentes, isso pesa mais do que qualquer truque técnico.
Tenho de reescrever o meu conteúdo para assistentes de IA?
Muitas vezes, parcialmente. Se o seu conteúdo começa com três parágrafos de contexto antes de chegar à resposta, é inútil para voz. A boa notícia: a mesma alteração também ajuda nos Google AI Overviews e nos featured snippets clássicos. Ou seja, não escreve para um único canal, mas para todas as máquinas de resposta ao mesmo tempo.
Como sei se a minha otimização para voice search está a resultar?
Não existe um relatório direto de voice search. Meça de forma indireta: referências vindas de chatgpt.com e perplexity.ai, volume de pesquisa pela marca e um teste mensal com as mesmas perguntas à Siri, à Alexa e ao ChatGPT. Mencionam-no com mais frequência e com os factos corretos? Então está a funcionar. Se não, é porque falta, habitualmente, uma resposta direta ou dados estruturados.