La clusterización de consultas de búsqueda es agrupar una lista de palabras clave por significado de modo que cada grupo (clúster) pueda cubrirse con una sola página del sitio. Es el paso más importante entre «reuní un montón de claves en Wordstat» y «entendí qué páginas hacen falta y sobre qué escribir los textos».
Sin clusterización sale un revoltijo: miles de consultas y no se sabe qué hacer con ellas. Con ella, un plan claro: 200 clústeres → 200 páginas con una tarea de contenido concreta.
| Método | Precisión | Velocidad | Precio |
|---|---|---|---|
| Por el top de resultados (Hard/Middle/Soft) | media | baja | ~$5 / 1k |
| IA (Claude/GPT semantic) | alta | alta | ~$1 / 1k |
| Embeddings + aglomeración | la más alta | alta | ~$3 / 1k |
Para qué clusterizar
Un ejemplo simple. En tu núcleo semántico tienes 10 consultas:
- comprar bicicleta de montaña
- bicicleta de montaña precio
- bicicleta de montaña de hombre
- bicicleta de montaña barata
- cómo elegir una bicicleta de montaña
- qué bicicleta de montaña elegir
- bicicleta de montaña reseña
- reparación de bicicleta de montaña
- reparación de bicicleta precio
- dónde arreglar una bicicleta
Pregunta: ¿cuántas páginas hacen falta en el sitio? No 10, claro. Las consultas 1-4 son un tema (comprar bicicleta de montaña de hombre), las consultas 5-7 otro (cómo elegir), las 8-10 un tercero (reparación). Total: 3 páginas para 10 consultas.
Eso es la clusterización. Cuando hay 1 000+ consultas, hacerlo a mano es imposible: hace falta un algoritmo.
Por qué exactamente una página por clúster
Los motores de búsqueda posicionan mal una página por varias intenciones a la vez. Si en una misma página intentas optimizar tanto para «comprar bicicleta» como para «cómo elegir bicicleta», normalmente pierdes en ambas consultas. Google y Yandex no entienden a quién mostrar tu página: al comprador o al lector.
Cuando cada clúster tiene su propia página:
- La página tiene una intención clara (producto / guía / FAQ / categoría).
- El Title y el H1 coinciden exactamente con la consulta principal del clúster.
- El texto cubre de forma natural todas las variantes dentro del clúster.
- El enlazado interno entre clústeres se construye con lógica.
Es el patrón base del SEO de 2026.
Tres métodos de clusterización
1. Por el top de resultados de búsqueda (Hard / Middle / Soft)
El método más clásico, inventado ya en los 2010. La idea: si por dos consultas en el TOP-10 del buscador aparecen las mismas páginas, significa que el buscador percibe esas consultas como un mismo tema, así que se clusterizan en un mismo clúster.
Algoritmo:
- Por cada consulta reunir el TOP-10 (por ejemplo, de Yandex).
- Comparar las intersecciones de URL entre consultas.
- Si hay suficientes intersecciones, unir en un clúster.
Aquí aparecen los modos Soft / Middle / Hard, que indican el umbral de coincidencia:
| Modo | Mínimo de URL comunes en el TOP-10 | Resultado |
|---|---|---|
| Soft | 3 URL | Clústeres grandes y sueltos. Puede mezclar temas. |
| Middle | 4-5 URL | Variante equilibrada (la que más se usa). |
| Hard | 7-8 URL | Clústeres pequeños, muy cercanos. Muchas consultas sueltas. |
Ventajas del método:
- Se apoya en la «opinión» del propio motor de búsqueda, es decir, se posiciona con garantía tal como lo ve Yandex/Google.
- Simple y predecible.
Desventajas:
- Requiere muchas capturas del TOP, lo cual es caro (hacen falta límites de Yandex.XML o Serper.dev / DataForSEO para Google). Con 1 000 consultas son 1 000 peticiones al API.
- No tiene en cuenta la intención si el TOP aún no se ha «asentado» (para nichos nuevos).
- Al cambiar los resultados (y Yandex lo hace a menudo) los clústeres pueden descuadrarse.
- No funciona para combinaciones que nunca se consultan: si por una consulta no hay un TOP real, no hay dónde clusterizarla.
2. Clusterización semántica (por embeddings)
El enfoque moderno. Cada consulta se convierte en una representación vectorial (embedding) mediante un modelo de lenguaje (por ejemplo, OpenAI text-embedding-3-small). Luego, los vectores cercanos en significado se agrupan con un algoritmo de clusterización (HDBSCAN, k-means, UMAP+DBSCAN).
Algoritmo:
- Cada consulta → vector de tamaño 384-1536.
- Ejecutar el algoritmo de clusterización en ese espacio vectorial.
- Obtener clústeres por «cercanía semántica».
Ventajas:
- No hacen falta capturas del TOP: funciona en cualquier nicho.
- Entiende el significado, no solo la intersección de URL.
comprar bicicletaybicycle buy(en alfabeto latino) caen en un mismo clúster, aunque en los resultados sean distintos. - Se puede hacer clusterización jerárquica: clúster principal «bicicletas» → subclústeres «de montaña», «plegables», «infantiles».
- Rápido y barato.
Desventajas:
- Puede unir consultas que deberían estar en páginas distintas (por ejemplo, informacional y comercial con palabras parecidas).
- La calidad depende del modelo de embeddings y de los parámetros de clusterización: requiere ajuste.
3. Clusterización con IA (por LLM)
El enfoque más nuevo (2024+). La lista de consultas se le da a un gran modelo de lenguaje (Claude, GPT-4) con la instrucción: «agrupa y nombra cada clúster». El modelo usa su conocimiento general de SEO y semántica para construir grupos con sentido.
Ventajas:
- Tiene en cuenta la semántica, la intención y el contexto.
- Da de una vez un nombre a cada clúster (cómodo: los algoritmos normales no dan nombres, hay que ponerlos luego a mano).
- Puede explicar por qué agrupó así.
- No requiere ni TOP ni embeddings.
Desventajas:
- Cuesta más que el cálculo masivo (una petición a un LLM no es gratis).
- En núcleos muy grandes (10 000+) hay que hacerlo por «lotes» y luego reunirlos.
- La calidad depende del modelo y del prompt.
Nuestro clusterizador gratuito usa justamente el enfoque de IA a través de Claude Sonnet: da clústeres buenos y con sentido desde el primer momento.
Enfoque híbrido
En los servicios de producción reales a menudo se combinan dos o tres métodos:
- La clusterización por embeddings da la división primaria.
- El LLM comprueba y renombra los clústeres.
- Opcionalmente, verificación por TOP para las consultas de mayor frecuencia.
Cómo clusterizar consultas en 5 pasos
Paso 1. Preparar la lista
Hace falta una lista limpia de consultas: sin duplicados, sin basura, en una sola codificación, una por línea. Si aún no la limpiaste, límpiala primero, o el clusterizador trabajará con ruido.
La cantidad deseable es de 50 a 10 000 por vez. Menos de 20 da un resultado plano. Más de 10 000 hay que partirlo en lotes.
Paso 2. Elegir el método
- Lista pequeña (hasta 100), un solo proyecto — clusterización con IA (nuestra free tool).
- Lista media (100-1 000), nicho típico — semántica + verificación con LLM.
- Lista grande (1 000-10 000) con presupuesto — híbrido: embeddings + validación por TOP para las consultas comerciales.
Paso 3. Ejecutar y obtener el resultado
Según el método, va de 30 segundos (LLM con 100 consultas) a una hora (método por TOP con 10 000). A la salida, una tabla:
| Consulta | Clúster | Intención |
|---|---|---|
| comprar bicicleta de montaña | Bicicletas de montaña (comprar) | commercial |
| bicicleta de montaña precio | Bicicletas de montaña (comprar) | commercial |
| cómo elegir una bicicleta de montaña | Guía: elección de bicicleta de montaña | informational |
Paso 4. Revisar a mano
Ningún algoritmo da un 100 % de calidad. Revisión obligatoria:
- Recorre los clústeres de arriba abajo.
- Demasiado grande (>50 consultas): mira si conviene dividirlo.
- Demasiado pequeño (1-2 consultas): mira si conviene fusionarlo con uno parecido.
- Que el nombre del clúster sea claro: será el H1 de la página.
En un núcleo grande, las correcciones serán del 5-15 %, es lo normal.
Paso 5. Vincular a páginas
Cada clúster va o a una página existente o a una nueva. De ahí salen:
- El plan de creación de páginas nuevas (priorizado por la frecuencia del clúster).
- El briefing para el redactor (consulta principal → title, el resto → subtítulos y cuerpo).
- La lista de redirecciones (si dos páginas existentes compiten por un mismo clúster, se elimina una y se redirige).
Errores típicos
- Clusterizar sin limpiar. El algoritmo trabaja con lo que le das. Basura de entrada → clústeres basura de salida.
- Poner el modo Hard «para más calidad». En realidad da cientos de clústeres sueltos y no se sabe qué hacer con ellos. Middle suele ser más adecuado.
- No mirar la intención. Un clúster con «comprar bicicleta» + «cómo elegir bicicleta» juntos es un error típico que rompe el CTR de ambas páginas.
- Hacer la clusterización una vez y para siempre. Al añadir consultas nuevas o cambiar los resultados, la estructura puede «descuadrarse»: reevaluar cada 3-6 meses.
- Ignorar los clústeres de baja frecuencia. Una consulta con frecuencia 10/mes parece inútil, pero decenas de clústeres así juntos dan miles de visitas: long tail.
En qué podemos ayudar
Semantic Core es un servicio en la nube donde la clusterización está integrada en el proceso general: cargas o recolectas el núcleo, lo limpiamos automáticamente, lo clusterizamos (IA + verificación por TOP para las consultas comerciales) y, por cada clúster, con un botón puedes generar el briefing para el redactor.
Para probar la clusterización sin registrarte — clusterizador gratuito con IA para 5-100 consultas por vez.