Tu web puede estar compitiendo contra sí misma sin que nadie haya copiado una sola palabra. Basta con que el CMS genere varias versiones de una URL, que los filtros de un ecommerce se multipliquen sin control o que los mismos artículos estén publicados en el dominio principal y en un subdominio que alguien olvidó revisar.
El problema no es únicamente que dos páginas se parezcan. Cuando Google encuentra varias versiones del mismo contenido, debe decidir cuál rastrea, cuál considera principal y cuál muestra en sus resultados. Si la web no envía señales claras, podemos perder el control sobre la URL que queremos posicionar y complicar el posicionamiento orgánico, la medición y el rastreo del sitio.
Existe contenido duplicado cuando una parte sustancial del contenido principal aparece de forma idéntica o muy similar en más de una URL. Puede ocurrir dentro de la misma web, entre un dominio y un subdominio o en dominios diferentes, aunque pertenezcan a la misma empresa.
Por ejemplo, podemos encontrar el mismo artículo en:
Aunque ambas webs pertenezcan a la misma organización, Google sigue encontrando dos URLs con un contenido prácticamente idéntico y tendrá que decidir cuál representa mejor la información.
Para entender los duplicados sin mezclar conceptos, conviene analizarlos desde dos perspectivas distintas.
Según dónde aparece
| 📂 Tipo | 📖 Qué significa | 💡 Ejemplo |
|---|---|---|
| Duplicado interno | Aparece en varias URLs de la misma web | Dos URLs muestran la misma ficha de producto |
| Duplicado entre dominios o subdominios | Aparece en webs o hosts diferentes | El mismo artículo está en el dominio y en un subdominio |
Según cuánto se parece
| 📂 Tipo | 📖 Qué significa | 💡 Ejemplo |
|---|---|---|
| Duplicado exacto | El contenido principal es idéntico | Misma ficha accesible desde dos URLs |
| Casi duplicado | Solo cambian elementos menores | Varias landings iguales donde cambia la ciudad |
Una misma página puede pertenecer a las dos clasificaciones. Por ejemplo, dos fichas idénticas dentro de un ecommerce son un duplicado interno y exacto.
No exactamente. Contenido duplicado describe una situación técnica: hay información igual o muy similar en varias URLs. Plagio implica que alguien ha reproducido un contenido sin autorización.
Una descripción proporcionada por un fabricante puede aparecer legalmente en varias tiendas. En cambio, si otra web copia un artículo sin permiso, existe duplicación entre dominios y también puede haber un problema de derechos de autor. Google gestiona estas reclamaciones mediante un procedimiento legal independiente.
Tampoco todo lo que se repite dentro de una web constituye un problema. Es normal reutilizar el menú, el footer, ciertos avisos legales o una llamada a la acción. Lo importante es mantener coherencia y utilidad: añadir más bloques repetidos no mejora una página por el simple hecho de hacerla más extensa. Cuanto más sencillo sea encontrar la información, comprenderla y completar una acción, mejor será la experiencia.
Google no penaliza automáticamente una web simplemente por tener contenido duplicado.
La propia compañía lo resume así:
“El contenido duplicado de un sitio no implica que deban tomarse medidas”.
Cuando Google encuentra varias páginas iguales o muy parecidas, suele agruparlas y seleccionar una como URL canónica, es decir, como la versión principal que utilizará para representar ese contenido en los resultados. La duplicación puede convertirse en un problema de spam cuando se crea deliberadamente para engañar o manipular el buscador, pero no es lo habitual en los casos técnicos de una web.
Una URL canónica es la versión que Google considera principal entre varias páginas duplicadas o muy similares.
Podemos indicar nuestra preferencia mediante una etiqueta incluida en el código:
<link rel="canonical" href="https://www.ejemplo.es/zapatillas/" />
Con esta etiqueta le estamos diciendo a Google:
Esta página se parece a otra, pero la URL que debería tomar como referencia es
La canonical es una señal fuerte, pero no una orden absoluta. Google puede elegir otra versión si encuentra mensajes contradictorios, por ejemplo, si la canonical apunta a una URL, el sitemap contiene otra y los enlaces internos dirigen a una tercera.
Cuando la canonical, el sitemap y los enlaces internos apuntan a versiones diferentes, Google recibe señales contradictorias y puede elegir una URL distinta de la que queremos posicionar.
| 📌Caso | 🔎Qué está pasando | 🛠️Problema y solución |
|---|---|---|
| Canonical hacia una URL con parámetros | https://tienda.es/zapatillas/ declara como canonical https://tienda.es/zapatillas/?orden=precio. | La URL parametrizada solo cambia el orden de los productos, por lo que no debería ser la principal. La categoría limpia debe incluir una canonical autorreferente y las URLs de ordenación deben apuntar hacia ella. |
| El menú y la canonical utilizan formatos diferentes | El menú enlaza a https://tienda.es/zapatillas/, pero la canonical señala https://tienda.es/zapatillas, sin barra final. | Google recibe dos versiones como referencia. Hay que elegir un único formato, redirigir la alternativa mediante 301 y utilizar la misma URL en la canonical, el menú y el sitemap. |
No importa tanto elegir una URL con barra final o sin ella. Lo importante es que todas las señales apunten siempre a la misma versión.
Esto puede provocar:
El problema no es únicamente “tener duplicados”. Es dejar que Google decida sin haber definido correctamente qué URL queremos priorizar.
La duplicación puede originarse en la configuración del dominio, el CMS, las plantillas, los parámetros o la arquitectura de la web.
| ⚠️Problema | 🔎Ejemplo | 🛠️Solución habitual |
|---|---|---|
| HTTP y HTTPS | http://web.es/seo/ https://web.es/seo/ |
Redirigir HTTP hacia HTTPS |
| Con www y sin www | www.web.es web.es |
Elegir una versión y redirigir |
| Barra final | /seo /seo/ |
Normalizar y redirigir |
| Mayúsculas | /SEO/ /seo/ |
Unificar el formato |
| Tracking | ?utm_source=email | Canonical hacia la URL limpia |
| Sesiones | ?sessionid=123 | Evitar enlazar el parámetro |
| Versión imprimible | ?print=1 | Canonical hacia la versión HTML |
| Categorías y etiquetas | /categoria/seo/ /tag/seo/ |
Fusionar, diferenciar o aplicar noindex |
| Landings locales repetidas | Misma página cambiando la ciudad | Replantear intención y contenido |
| Texto de fabricante | Misma descripción en varias tiendas | Añadir información propia |
Google considera las URLs con mayúsculas y minúsculas como direcciones diferentes. Los parámetros de tracking, sesión, ordenación y filtrado también pueden generar múltiples versiones del mismo contenido.
Una secuencia paginada no es necesariamente contenido duplicado:
Cada página puede mostrar productos diferentes. Por eso, cada URL debe incluir una canonical que apunte hacia sí misma, lo que denominamos canonical autorreferente.
Una canonical autorreferente significa que la página se declara a sí misma como versión principal. No deberíamos canonicalizar toda la paginación hacia la primera página, porque las páginas posteriores contienen productos o artículos distintos.
Los ecommerce son especialmente propensos a generar duplicados. Un catálogo con colores, tallas, marcas, precios y ordenaciones puede producir miles de combinaciones sin que nadie haya creado esas páginas manualmente.
El objetivo no es bloquear todos los filtros, sino decidir qué URLs responden a búsquedas reales y cuáles sirven únicamente para navegar por la tienda.
Pensemos en esta categoría:
| 🔗URL de ejemplo | 🔄Qué cambia | 🎯Decisión orientativa |
|---|---|---|
| Categoría limpia https://tienda.es/zapatillas/ |
Muestra la categoría completa | Utilizar como URL principal, con canonical autorreferente |
| Parámetro UTM https://tienda.es/zapatillas/?utm_source=newsletter |
Solo identifica la campaña de origen | Mantener para medición, pero declarar como canonical la URL limpia |
| Ordenación https://tienda.es/zapatillas/?orden=precio |
Muestra los mismos productos en otro orden | No trabajar como página SEO independiente |
| Filtro de color https://tienda.es/zapatillas/?color=negro |
Selecciona únicamente productos negros | Analizar la demanda y valorar una landing como /zapatillas/negras/ |
| Combinación de filtros https://tienda.es/zapatillas/?color=negro&talla=42&marca=nike |
Genera una selección muy específica | Evitar su indexación independiente y limitar el rastreo innecesario |
La navegación por filtros resulta útil para el usuario, pero puede crear una cantidad casi infinita de URLs. Estas combinaciones pueden consumir recursos de rastreo y retrasar el descubrimiento de páginas más valiosas.
Estas dos URLs muestran la misma categoría:
La segunda sirve para medir que la visita procede de una newsletter. No queremos que Google la trate como una página orgánica independiente.
Para consolidarla:
1. La URL con UTM sigue funcionando para medir la campaña.<link rel="canonical" href="https://tienda.es/zapatillas/" />
De esta forma, le indicamos a Google que la URL que debería indexar y mostrar es la versión sin parámetros. La URL con UTM puede seguir rastreándose y Google podría llegar a indexarla si interpreta otras señales, porque la canonical no es una directiva absoluta. Sin embargo, una implementación coherente reduce mucho esa posibilidad.
Una URL como esta:
puede responder a una búsqueda con potencial: "zapatillas negras" . Imaginemos que esa keyword tiene 10.000 búsquedas mensuales. Existe una oportunidad, pero el volumen por sí solo no basta.
Antes de crear una landing debemos comprobar:
Como criterio práctico, no como regla de Google, evitaría crear la subcategoría si solo dispone de uno o dos productos. Un punto de partida razonable puede ser contar con al menos cinco u ocho productos relevantes y prever que la selección seguirá teniendo stock.
Si se cumplen estas condiciones, podemos crear esta url/landing https://tienda.es/zapatillas/negras/ . Y esta URL tendría una canonical autorreferente, es decir, se señalaría a sí misma como la versión principal. También aparecería en el sitemap y recibiría enlaces desde la arquitectura de categorías.
Una buena investigación de palabras clave ayuda a separar los filtros con demanda de las combinaciones que solo facilitan la navegación.
Muchos ecommerce crean una URL diferente para cada talla. El usuario normalmente no busca una ficha orgánica distinta para cada talla. Estas URLs pueden ser necesarias para seleccionar la variante, controlar el stock o mostrar el SKU correcto, pero no necesitan posicionarse como páginas independientes.
La URL base sería:
Y las variantes técnicas:
En una implementación habitual:
Los datos estructurados de variantes ayudan a Google a comprender que las tallas y colores pertenecen a un mismo producto principal. El marcado puede identificar el grupo, cada variante, su color, talla, precio, SKU y disponibilidad.
Conviene reducir las situaciones a tres decisiones principales:
| 📌Situación | ✅Qué recomendamos |
|---|---|
| El producto volverá | Mantener la URL y mostrar el estado |
| No volverá, pero tiene sustituto equivalente | Redirección 301 al sustituto |
| No volverá y no existe sustituto relevante | Devolver 404 o 410 |
Cuando el producto está agotado temporalmente, podemos mantener la página con estado 200, indicar que no está disponible y ofrecer:
Si el producto no volverá y existe un sustituto realmente equivalente, puede utilizarse una redirección 301. No deberíamos redirigir automáticamente cualquier producto hacia la home, una categoría genérica o un producto vagamente parecido.
Lo mismo ocurre con una categoría eliminada. Si existe una categoría nueva que responde a la misma necesidad, podemos redirigirla. Si no existe un destino relevante, es preferible devolver un 404 o 410.
Una herramienta puede avisarnos de que existen páginas similares, pero la alerta no decide si se trata de un problema real. Primero debemos comprobar qué URLs están afectadas, si responden a la misma intención y qué versión queremos priorizar.
Podemos buscar una frase representativa entre comillas: site:https://esmartia.com "auditoria seo"
También podemos limitar la búsqueda a un dominio: Por ejemplo: site:https://esmartia.com. Eso sí…¡Prueba con tu web, no con la nuestra!
Esto ayuda a descubrir páginas repetidas, pero el operador site: no ofrece un listado completo de todas las URLs indexadas.
En el informe de indexación y en Inspección de URLs podemos comparar:
Algunos estados habituales son:
El último caso no siempre es un error. Puede significar que Google ha encontrado una versión alternativa y ha respetado correctamente la canonical.
Semrush Site Audit puede detectar páginas similares, titles duplicados, metadescripciones repetidas y problemas de canonicalización. Semrush utiliza un umbral de similitud del 85 %. Es una regla de la herramienta, no un porcentaje definido por Google.
Screaming Frog SEO Spider permite detectar duplicados exactos y páginas casi idénticas. También identifica:
Su análisis de páginas casi duplicadas utiliza por defecto un umbral del 90 %, que puede modificarse.
Una IA con acceso web o a archivos puede ayudarnos a revisar un blog pequeño. Podemos proporcionarle un sitemap o una lista de URLs para que compare los titles, H1, metadescripciones y contenido principal.
También puede:
No sustituye a un crawler en un ecommerce grande. Para webs grandes, es más fiable seguir este flujo:
| 📌Situación | ✅Qué recomendamos |
|---|---|
| El producto volverá | Mantener la URL y mostrar el estado |
| No volverá, pero tiene sustituto equivalente | Redirección 301 al sustituto |
| No volverá y no existe sustituto relevante | Devolver 404 o 410 |
Actúa como especialista en SEO técnico.
Utiliza este sitemap o listado de URLs:
Analiza un máximo de 50 páginas por lote.
Para cada página extrae:
Después:
No afirmes que has analizado una URL si no has podido acceder a ella.
No inventes porcentajes de similitud.
Antes de recomendar una solución, comprueba si las páginas responden a la misma intención de búsqueda.
¿Tu auditoría muestra cientos de duplicados y no sabes cuáles importan?
Una alerta no siempre representa un error. En Esmartia analizamos las URLs, su intención y su configuración para separar problemas reales, duplicados controlados y falsos positivos.
La solución depende de qué función cumple cada URL y de si debe desaparecer, seguir accesible o posicionarse.
| 📌Situación | 🛠️Solución habitual |
|---|---|
| La URL ya no tiene utilidad | Redirección 301 o 404 |
| La URL muestra lo mismo, pero debe seguir funcionando | Canonical hacia la principal |
| La página debe existir, pero no aparecer en Google | noindex |
| Dos páginas resuelven la misma necesidad | Fusionar y redirigir |
| Las páginas responden a intenciones diferentes | Diferenciar el contenido |
| Un parámetro no aporta valor SEO | Evitar su indexación separada |
| Google selecciona otra canonical | Alinear todas las señales |
| Otra web copia el contenido | Solicitar retirada o reclamar derechos |
La redirección envía al usuario y al buscador desde una URL hasta otra. Debe utilizarse cuando la página anterior ya no necesita seguir accesible.
Una canonical tiene sentido cuando una URL debe seguir funcionando, pero muestra el mismo contenido que otra.
Por ejemplo, una URL con UTM puede seguir utilizándose para medir una campaña:
Pero declarar como canonical:
indica que la segunda es la versión que queremos consolidar e indexar.
La etiqueta noindex solicita a Google que no incluya una página en sus resultados. Puede utilizarse en búsquedas internas, páginas de procesos o filtros útiles para el usuario que no necesitan posicionarse.
<meta name="robots" content="noindex">
Para que Google pueda leer esta etiqueta, debe tener acceso a la página.
robots.txt controla el rastreo. noindex controla la indexación.
Si bloqueamos una URL mediante robots.txt, Google no podrá rastrearla y, por tanto, no podrá leer la etiqueta `noindex` incluida en su código. Una URL bloqueada podría continuar indexada solo por las referencias externas que Google conoce.
Por eso, para retirar una página del índice:
No debemos aplicar robots.txt y noindex a la vez esperando que Google lea ambas instrucciones.
Imaginemos que queremos priorizar: https://web.es/zapatillas/ , Pero la web envía señales contradictorias:
Alinear las señales significa que:
Cuantas más señales coincidan, más fácil será que Google respete nuestra elección.
Prevenir el problema empieza por saber qué URL debe trabajar cada necesidad de búsqueda antes de publicar nuevos contenidos, categorías o landings.
| 📂Área | 🛡️Regla preventiva | 👤Responsable |
|---|---|---|
| Keyword mapping | Una URL asignada a cada intención | SEO y contenido |
| Blog | Controlar categorías y etiquetas | SEO |
| Ecommerce | Definir filtros y variantes indexables | SEO y desarrollo |
| URLs | Utilizar un único formato | Desarrollo |
| Canonicals | Autorreferentes en páginas indexables | SEO y desarrollo |
| Sitemap | Incluir solo URLs canónicas e indexables | SEO |
| Enlazado | Utilizar URLs limpias | SEO y contenido |
| CMS | Evitar taxonomías automáticas innecesarias | Desarrollo |
| Control | Rastrear la web tras los cambios | SEO |
Un keyword mapping es un mapa o inventario de las URLs de la web y de las keywords e intenciones asignadas a cada una. Permite saber qué página debe posicionar por cada grupo de búsquedas y detectar contenidos que se solapan antes de que empiecen a competir.
En blogs grandes, una arquitectura basada en topic clusters también ayuda a separar el contenido pilar de los artículos de apoyo. A nivel técnico, conviene definir desde el principio qué parámetros y filtros puede generar el CMS y revisar cómo afectan al crawl budget.
Si la web ya ha crecido sin estas reglas, una auditoría SEO permite detectar los patrones y priorizar las correcciones sin revisar las URLs una por una.
El contenido duplicado rara vez empieza en un texto copiado. Muchas veces nace en los filtros, las plantillas, el CMS o una arquitectura que genera URLs sin que nadie las haya planificado.
En Esmartia analizamos el origen del problema, priorizamos las correcciones y coordinamos SEO, contenido y desarrollo. Porque una buena estrategia de inbound marketing necesita una web que Google pueda rastrear, entender y mostrar correctamente.