Ya reuniste tu núcleo: mil consultas en una columna. Ahora hay que repartirlas por páginas: qué frases viven en una misma página y cuáles piden una propia. Eso es el clustering. Hay tres formas de agrupar, y cada una responde a la pregunta «¿se parecen estas dos consultas?» de una manera distinta.
Veamos las tres con un mismo ejemplo: las consultas «comprar bicicleta», «comprar bicicleta barata», «cómo elegir una bicicleta para adulto».
- Mira qué sitios ya están en el top 10
- «comprar» y «cómo elegir» → sitios distintos → clústeres distintos
- Preciso con la intención, más caro y más lento
Método 1. Por los resultados (SERP-based): Hard, Middle, Soft
La forma más fiable. La lógica es simple: si dos consultas de verdad tratan de lo mismo, el buscador ya muestra para ellas las mismas páginas. Entonces tomamos el top 10 de cada consulta y miramos cuántas URL coinciden. Muchos enlaces comunes: un clúster. Pocos: distintos.
El umbral de intersección (cuántas URL comunes hacen falta, normalmente 3–5) marca la exigencia. Y la forma en que se enlazan las consultas dentro de un grupo es lo que diferencia a los tres modos.
Hard — estricto
Todas las consultas del clúster deben intersecarse entre todas. Si una se cae por el umbral, no entra al clúster. Resultado: grupos pequeños y limpios, donde equivocarse es casi imposible. La contra: muchas «solitarias» que no se pegan a ningún lado.
Middle — intermedio
Un punto medio: la conexión se cuenta a través de «puentes». Una consulta entra al clúster si se interseca con el núcleo del grupo, aunque no coincida con cada uno de sus miembros. Los clústeres son más grandes, la limpieza baja un poco. El modo de trabajo por defecto para la mayoría de proyectos.
Soft — blando
Basta con la conexión con al menos una consulta del grupo (en cadena). Los clústeres salen grandes, atrapan toda la cola, pero por dentro pueden colarse frases con otra intención. Sirve para un boceto rápido de la estructura, no para la versión final.
Regla de memoria: Hard cuando importa la limpieza (comercio, dinero en juego), Soft cuando importa la cobertura (gran proyecto de contenido, borrador), Middle cuando no quieres pensar.
El precio del método: para comparar los resultados, primero hay que reunirlos, sacar el top 10 de cada consulta. Eso es parsear el buscador, es lento y cuesta dinero. A cambio, el resultado coincide al máximo con la realidad.
Método 2. Semántico — por el significado de las palabras
Aquí no tocamos los resultados de búsqueda. El método mira las palabras mismas: las lleva a su forma base (lema), reconoce sinónimos y frases de significado cercano, y agrupa las parecidas.
«comprar bicicleta» y «comprar bicicleta barata» los junta con seguridad: son las mismas palabras. Pero «cómo elegir una bicicleta» también puede arrastrarlo al mismo grupo, porque la palabra común «bicicleta» pesa más. Y eso es un error: la intención es distinta (comprar frente a informarse).
La ventaja: instantáneo y gratis, no necesita parsear los resultados. La contra: no percibe la intención, porque no ve que el buscador muestra páginas distintas para esas frases.
Método 3. Con embeddings — por significado, pero más listo
La versión avanzada del semántico. Cada consulta se convierte en un vector, un conjunto de números que codifica el significado de la frase (embedding). Luego las consultas se agrupan por la cercanía de esos vectores (con algoritmos como DBSCAN).
La diferencia con la semántica normal es que el vector capta el significado entero, no las palabras sueltas. El modelo entiende que «transporte de dos ruedas para la ciudad» y «bicicleta urbana» tratan de lo mismo, aun sin palabras comunes. Y que «comprar» y «cómo elegir» tratan de cosas distintas, aunque la palabra «bicicleta» sea común.
La ventaja: capta el significado con más finura que ningún otro, funciona en cualquier idioma y no necesita parsear los resultados. La contra: calcular embeddings cuesta dinero (una llamada a un modelo de IA), y en consultas puramente comerciales sigue quedando por debajo del método por resultados: la intención de «comprar» se ve mejor precisamente en el top.
Qué elegir para tu tarea
- Núcleo informativo grande, blog, wiki
- Necesitas una agrupación rápida en borrador
- Consultas en varios idiomas
La combinación que funciona en la práctica: primero pasa el núcleo por significado o con embeddings, obtienes grupos de borrador en segundos y gratis. Luego revisa por resultados los clústeres dudosos y los que dan dinero. Así pagas por el método caro solo donde el coste de equivocarse es alto.
Pruébalo con tus consultas
Nuestro clusterizador gratuito agrupa una lista de frases por significado con IA: es el método de la tercera
categoría, sin parsear los resultados y sin esperas. Pega tus consultas en /free/cluster,
mira cómo se reparten por grupos y calcula cuántas páginas vas a necesitar.
Preguntas frecuentes
¿Cuál es el método más preciso?
¿Por qué no hacer todo el clustering solo por resultados, si es el preciso?
¿Qué es el umbral 3, 4, 5?
Lo siguiente: cómo, a partir de los clústeres listos, armar un encargo para el copywriter, para que cada página cubra su clúster por completo.