Screaming Frog para embeddings e vetores
TL;DR
- O Screaming Frog gera embeddings de duas formas: Custom JavaScript (v20, 2024) a chamar uma API, ou a Semantic Similarity nativa (v22, 2025).
- Um embedding transforma cada página num vetor; a proximidade (cosine similarity) revela páginas semanticamente próximas.
- Serve para clusters de conteúdo, deteção de canibalização, conteúdo pouco relevante e internal linking à escala.
- É barato: mapear ~50 000 URLs com a OpenAI custa menos de 5 USD.
Um embedding é a representação de um texto como um vetor de números que captura o seu significado. Páginas com significado próximo ficam próximas nesse espaço vetorial - e é isso que permite, à escala, agrupar conteúdo, detetar canibalização e sugerir links internos por semântica, não por palavra-chave exata. O Screaming Frog trouxe isto para dentro do crawl.
Duas formas de gerar embeddings no Screaming Frog
Convém não confundir, porque foram introduzidas em versões diferentes:
1. Custom JavaScript (v20.0, maio de 2024). Em Config > Custom > Custom JavaScript > Add from Library há snippets prontos que, durante o crawl, chamam a API da OpenAI (basta colar a tua API key). Exige ter o JavaScript Rendering ligado. Exportas um CSV com URL + Embeddings e processas depois (ex.: Python/Colab) para calcular a similaridade.
2. Semantic Similarity nativa (v22.0, junho de 2025). Faz tudo dentro da ferramenta, em Config > Content > Embeddings, usando os providers em Config > API Access > AI: OpenAI, Gemini ou Ollama (local). A Screaming Frog recomenda o Gemini. É a via sem código.
Modelos, dimensões e custo
| Modelo | Dimensões | Preço |
|---|---|---|
| OpenAI text-embedding-3-small | 1536 (encurtável) | $0,02 / 1M tokens |
| OpenAI text-embedding-3-large | até 3072 | $0,13 / 1M tokens |
| Gemini / Ollama (local) | variável | grátis (Ollama) |
Para dar escala ao número: mapear cerca de 50 000 URLs com a OpenAI custou, na experiência documentada no blog oficial da Screaming Frog, menos de 5 USD. É barato para o que resolve.
Como se mede a similaridade
A proximidade calcula-se por cosine similarity, uma pontuação de 0 a 1. Na feature nativa, por defeito, páginas com score acima de 0.95 são consideradas semanticamente similares (ajustável). Para "conteúdo de baixa relevância", a ferramenta calcula o centroide (a média de todos os vetores do crawl) e mede a distância de cada página a esse centro - útil para encontrar páginas que fogem ao tema do site.
Casos de uso reais
| Caso de uso | O que resolve |
|---|---|
| Clusters de conteúdo | Agrupar páginas por tema e desenhar a arquitetura de tópicos |
| Canibalização | Encontrar páginas quase-duplicadas a competir pela mesma intenção |
| Conteúdo de baixa relevância | Detetar páginas off-topic que diluem a autoridade temática |
| Internal linking | Sugerir links entre páginas semanticamente próximas, à escala |
| Redirect mapping | Emparelhar URLs antigos e novos por semântica numa migração |
É trabalho que ligo diretamente ao Screaming Frog para GEO e à consultoria de SEO técnico: autoridade temática limpa é meio caminho para ser citado pela IA.
Dados-chave
| text-embedding-3-small — dimensões | 1536 |
|---|---|
| text-embedding-3-small — preço | $0,02 / 1M tokens |
| text-embedding-3-large — dimensões | 3072 |
| text-embedding-3-large — preço | $0,13 / 1M tokens |
| Custom JavaScript (Screaming Frog) | v20 · 2024 |
| Semantic Similarity nativa (Screaming Frog) | v22 · 2025 |
O custo de ~50 000 URLs (<$5) é experiência do autor do guest post oficial (Gus Pelogia), não um benchmark da Screaming Frog.
Fontes: Screaming Frog — v22 · OpenAI — embeddings
Erros comuns e como fazer bem
Embeddings são poderosos e fáceis de usar mal. O que separa um mapa útil de um monte de números:
| Evita (erro comum) | Faz (boa prática) |
|---|---|
| ✗ Gerar embeddings sem limpar o conteúdo (menus, rodapés) | ✓ Extrair só o texto principal - o ruído distorce os vetores |
| ✗ Comparar vetores de modelos diferentes | ✓ Usar sempre o mesmo modelo em todo o crawl |
| ✗ Fixar-se no threshold 0.95 como lei | ✓ Ajustar o limiar ao teu site e validar os pares à mão |
| ✗ Tratar similaridade alta como canibalização automática | ✓ Confirmar a intenção: páginas próximas podem ser legítimas |
Ferramentas que uso e recomendo
- Screaming Frog SEO SpiderCrawl técnico e auditoria on-page em profundidade.
- ChatGPTAssistente de IA para pesquisa, análise e auditorias rápidas.
- GeminiAssistente de IA do Google, com grounding no Search.
- Google Search ConsolePerformance orgânica, cobertura e Core Web Vitals de campo.
Fontes
- Screaming Frog - SEO Spider 20.0 (Custom JavaScript)
- Screaming Frog - SEO Spider 22.0 (Semantic Similarity)
- Screaming Frog - Identify Semantically Similar Pages
- Map Related Pages at Scale (Gus Pelogia)
- OpenAI - New embedding models
Perguntas frequentes
Preciso de saber programar?
Não. Os snippets «Add from Library» fazem o trabalho e a feature nativa (v22) é sem código - só colas a API key. Checklist de SEO técnico →
OpenAI ou Gemini?
Na feature nativa a Screaming Frog recomenda o Gemini; nos snippets de Custom JavaScript, o mais usado é a OpenAI. Para local e grátis, Ollama. Screaming Frog para GEO →