Semantic Core
Модуль 3Кластеризация и контент2/6

Métodos de clustering de consultas: por el top, por significado y con embeddings

5 min lectura

Ya reuniste tu núcleo: mil consultas en una columna. Ahora hay que repartirlas por páginas: qué frases viven en una misma página y cuáles piden una propia. Eso es el clustering. Hay tres formas de agrupar, y cada una responde a la pregunta «¿se parecen estas dos consultas?» de una manera distinta.

Veamos las tres con un mismo ejemplo: las consultas «comprar bicicleta», «comprar bicicleta barata», «cómo elegir una bicicleta para adulto».

Tres miradas sobre el «parecido» de las consultas
Por significado (palabras)
  • Mira las palabras mismas y sus formas
  • «bicicleta» aparece en todas → todo a un mismo montón
  • Rápido y barato, se equivoca con la intención
vs
Por los resultados (top)
  • Mira qué sitios ya están en el top 10
  • «comprar» y «cómo elegir» → sitios distintos → clústeres distintos
  • Preciso con la intención, más caro y más lento
La misma lista de frases la reparten los tres métodos de forma distinta. Elegir el método decide cuántas páginas vas a tener.

Método 1. Por los resultados (SERP-based): Hard, Middle, Soft

La forma más fiable. La lógica es simple: si dos consultas de verdad tratan de lo mismo, el buscador ya muestra para ellas las mismas páginas. Entonces tomamos el top 10 de cada consulta y miramos cuántas URL coinciden. Muchos enlaces comunes: un clúster. Pocos: distintos.

El umbral de intersección (cuántas URL comunes hacen falta, normalmente 3–5) marca la exigencia. Y la forma en que se enlazan las consultas dentro de un grupo es lo que diferencia a los tres modos.

Hard — estricto

Todas las consultas del clúster deben intersecarse entre todas. Si una se cae por el umbral, no entra al clúster. Resultado: grupos pequeños y limpios, donde equivocarse es casi imposible. La contra: muchas «solitarias» que no se pegan a ningún lado.

Middle — intermedio

Un punto medio: la conexión se cuenta a través de «puentes». Una consulta entra al clúster si se interseca con el núcleo del grupo, aunque no coincida con cada uno de sus miembros. Los clústeres son más grandes, la limpieza baja un poco. El modo de trabajo por defecto para la mayoría de proyectos.

Soft — blando

Basta con la conexión con al menos una consulta del grupo (en cadena). Los clústeres salen grandes, atrapan toda la cola, pero por dentro pueden colarse frases con otra intención. Sirve para un boceto rápido de la estructura, no para la versión final.

Regla de memoria: Hard cuando importa la limpieza (comercio, dinero en juego), Soft cuando importa la cobertura (gran proyecto de contenido, borrador), Middle cuando no quieres pensar.

El precio del método: para comparar los resultados, primero hay que reunirlos, sacar el top 10 de cada consulta. Eso es parsear el buscador, es lento y cuesta dinero. A cambio, el resultado coincide al máximo con la realidad.

Método 2. Semántico — por el significado de las palabras

Aquí no tocamos los resultados de búsqueda. El método mira las palabras mismas: las lleva a su forma base (lema), reconoce sinónimos y frases de significado cercano, y agrupa las parecidas.

«comprar bicicleta» y «comprar bicicleta barata» los junta con seguridad: son las mismas palabras. Pero «cómo elegir una bicicleta» también puede arrastrarlo al mismo grupo, porque la palabra común «bicicleta» pesa más. Y eso es un error: la intención es distinta (comprar frente a informarse).

La ventaja: instantáneo y gratis, no necesita parsear los resultados. La contra: no percibe la intención, porque no ve que el buscador muestra páginas distintas para esas frases.

Método 3. Con embeddings — por significado, pero más listo

La versión avanzada del semántico. Cada consulta se convierte en un vector, un conjunto de números que codifica el significado de la frase (embedding). Luego las consultas se agrupan por la cercanía de esos vectores (con algoritmos como DBSCAN).

La diferencia con la semántica normal es que el vector capta el significado entero, no las palabras sueltas. El modelo entiende que «transporte de dos ruedas para la ciudad» y «bicicleta urbana» tratan de lo mismo, aun sin palabras comunes. Y que «comprar» y «cómo elegir» tratan de cosas distintas, aunque la palabra «bicicleta» sea común.

La ventaja: capta el significado con más finura que ningún otro, funciona en cualquier idioma y no necesita parsear los resultados. La contra: calcular embeddings cuesta dinero (una llamada a un modelo de IA), y en consultas puramente comerciales sigue quedando por debajo del método por resultados: la intención de «comprar» se ve mejor precisamente en el top.

Qué elegir para tu tarea

Elección rápida del método
Elige por resultados (Hard/Middle)
  • Consultas comerciales, tienda, servicios
  • Importa no equivocarse con la estructura
  • Puedes esperar y pagar por el parsing
vs
Elige por significado / embeddings
  • Núcleo informativo grande, blog, wiki
  • Necesitas una agrupación rápida en borrador
  • Consultas en varios idiomas
No hay uno correcto. Hay uno adecuado según el tipo de consultas y el presupuesto.

La combinación que funciona en la práctica: primero pasa el núcleo por significado o con embeddings, obtienes grupos de borrador en segundos y gratis. Luego revisa por resultados los clústeres dudosos y los que dan dinero. Así pagas por el método caro solo donde el coste de equivocarse es alto.

Pruébalo con tus consultas

Nuestro clusterizador gratuito agrupa una lista de frases por significado con IA: es el método de la tercera categoría, sin parsear los resultados y sin esperas. Pega tus consultas en /free/cluster, mira cómo se reparten por grupos y calcula cuántas páginas vas a necesitar.

Preguntas frecuentes

¿Cuál es el método más preciso?

Por resultados en modo Hard: se apoya en lo que el buscador ya decidió. Los embeddings van cerca y muchas veces son más cómodos, porque no requieren parsing. El semántico puro por palabras es el más débil con la intención.

¿Por qué no hacer todo el clustering solo por resultados, si es el preciso?

Porque es caro y lento: por cada consulta hay que sacar el top 10 del buscador. En un núcleo de 10 000 frases son un dinero y unas horas notables. Los métodos baratos descargan al caro.

¿Qué es el umbral 3, 4, 5?

Es cuántas URL comunes debe haber en el top 10 de dos consultas para considerarlas un mismo clúster. El umbral 3 es más blando y da clústeres más grandes, el umbral 5 es más estricto y más limpio. El estándar es 3–4.

Lo siguiente: cómo, a partir de los clústeres listos, armar un encargo para el copywriter, para que cada página cubra su clúster por completo.

Continúa leyendo