El Blog

Contenido duplicado: cómo detectarlo, evitarlo y corregirlo

Culpable... Sandra Arce

Tu web puede estar compitiendo contra sí misma sin que nadie haya copiado una sola palabra. Basta con que el CMS genere varias versiones de una URL, que los filtros de un ecommerce se multipliquen sin control o que los mismos artículos estén publicados en el dominio principal y en un subdominio que alguien olvidó revisar.

El problema no es únicamente que dos páginas se parezcan. Cuando Google encuentra varias versiones del mismo contenido, debe decidir cuál rastrea, cuál considera principal y cuál muestra en sus resultados. Si la web no envía señales claras, podemos perder el control sobre la URL que queremos posicionar y complicar el posicionamiento orgánico, la medición y el rastreo del sitio.

¿Qué es el contenido duplicado?

Existe contenido duplicado cuando una parte sustancial del contenido principal aparece de forma idéntica o muy similar en más de una URL. Puede ocurrir dentro de la misma web, entre un dominio y un subdominio o en dominios diferentes, aunque pertenezcan a la misma empresa.

Por ejemplo, podemos encontrar el mismo artículo en:

https://www.empresa.es/blog/contenido-duplicado/
https://recursos.empresa.es/contenido-duplicado/

Aunque ambas webs pertenezcan a la misma organización, Google sigue encontrando dos URLs con un contenido prácticamente idéntico y tendrá que decidir cuál representa mejor la información.

Para entender los duplicados sin mezclar conceptos, conviene analizarlos desde dos perspectivas distintas.

Según dónde aparece

📂 Tipo 📖 Qué significa 💡 Ejemplo
Duplicado interno Aparece en varias URLs de la misma web Dos URLs muestran la misma ficha de producto
Duplicado entre dominios o subdominios Aparece en webs o hosts diferentes El mismo artículo está en el dominio y en un subdominio

Según cuánto se parece

📂 Tipo 📖 Qué significa 💡 Ejemplo
Duplicado exacto El contenido principal es idéntico Misma ficha accesible desde dos URLs
Casi duplicado Solo cambian elementos menores Varias landings iguales donde cambia la ciudad

 

Una misma página puede pertenecer a las dos clasificaciones. Por ejemplo, dos fichas idénticas dentro de un ecommerce son un duplicado interno y exacto.

¿Contenido duplicado y plagio son lo mismo?

No exactamente. Contenido duplicado describe una situación técnica: hay información igual o muy similar en varias URLs. Plagio implica que alguien ha reproducido un contenido sin autorización.

Una descripción proporcionada por un fabricante puede aparecer legalmente en varias tiendas. En cambio, si otra web copia un artículo sin permiso, existe duplicación entre dominios y también puede haber un problema de derechos de autor. Google gestiona estas reclamaciones mediante un procedimiento legal independiente.

Tampoco todo lo que se repite dentro de una web constituye un problema. Es normal reutilizar el menú, el footer, ciertos avisos legales o una llamada a la acción. Lo importante es mantener coherencia y utilidad: añadir más bloques repetidos no mejora una página por el simple hecho de hacerla más extensa. Cuanto más sencillo sea encontrar la información, comprenderla y completar una acción, mejor será la experiencia.

¿Google penaliza el contenido duplicado?

Google no penaliza automáticamente una web simplemente por tener contenido duplicado.

La propia compañía lo resume así:

Google

“El contenido duplicado de un sitio no implica que deban tomarse medidas”.

Cuando Google encuentra varias páginas iguales o muy parecidas, suele agruparlas y seleccionar una como URL canónica, es decir, como la versión principal que utilizará para representar ese contenido en los resultados. La duplicación puede convertirse en un problema de spam cuando se crea deliberadamente para engañar o manipular el buscador, pero no es lo habitual en los casos técnicos de una web.

¿Qué es una URL canónica?

Una URL canónica es la versión que Google considera principal entre varias páginas duplicadas o muy similares.

Podemos indicar nuestra preferencia mediante una etiqueta incluida en el código:

<link rel="canonical" href="https://www.ejemplo.es/zapatillas/" />

Con esta etiqueta le estamos diciendo a Google:

Esta página se parece a otra, pero la URL que debería tomar como referencia es

https://www.ejemplo.es/zapatillas/.

La canonical es una señal fuerte, pero no una orden absoluta. Google puede elegir otra versión si encuentra mensajes contradictorios, por ejemplo, si la canonical apunta a una URL, el sitemap contiene otra y los enlaces internos dirigen a una tercera.

canonical_referenciada_web

El problema real del contenido duplicado es perder el control de la URL

Cuando la canonical, el sitemap y los enlaces internos apuntan a versiones diferentes, Google recibe señales contradictorias y puede elegir una URL distinta de la que queremos posicionar. 

📌Caso 🔎Qué está pasando 🛠️Problema y solución
Canonical hacia una URL con parámetros https://tienda.es/zapatillas/ declara como canonical https://tienda.es/zapatillas/?orden=precio. La URL parametrizada solo cambia el orden de los productos, por lo que no debería ser la principal. La categoría limpia debe incluir una canonical autorreferente y las URLs de ordenación deben apuntar hacia ella.
El menú y la canonical utilizan formatos diferentes El menú enlaza a https://tienda.es/zapatillas/, pero la canonical señala https://tienda.es/zapatillas, sin barra final. Google recibe dos versiones como referencia. Hay que elegir un único formato, redirigir la alternativa mediante 301 y utilizar la misma URL en la canonical, el menú y el sitemap.

No importa tanto elegir una URL con barra final o sin ella. Lo importante es que todas las señales apunten siempre a la misma versión. 

Esto puede provocar:

  • Que se muestre una URL parametrizada, antigua o difícil de interpretar.
  • Que los enlaces y otras señales se repartan entre varias versiones.
  • Que Google rastree combinaciones que no aportan valor.
  • Que los datos de rendimiento aparezcan fragmentados.
  • Que el usuario llegue a una página menos útil.

El problema no es únicamente “tener duplicados”. Es dejar que Google decida sin haber definido correctamente qué URL queremos priorizar.

 

Problemas de contenido duplicado más frecuentes

La duplicación puede originarse en la configuración del dominio, el CMS, las plantillas, los parámetros o la arquitectura de la web.

⚠️Problema 🔎Ejemplo 🛠️Solución habitual
HTTP y HTTPS http://web.es/seo/
https://web.es/seo/
Redirigir HTTP hacia HTTPS
Con www y sin www www.web.es
web.es
Elegir una versión y redirigir
Barra final /seo
/seo/
Normalizar y redirigir
Mayúsculas /SEO/
/seo/
Unificar el formato
Tracking ?utm_source=email Canonical hacia la URL limpia
Sesiones ?sessionid=123 Evitar enlazar el parámetro
Versión imprimible ?print=1 Canonical hacia la versión HTML
Categorías y etiquetas /categoria/seo/
/tag/seo/
Fusionar, diferenciar o aplicar noindex
Landings locales repetidas Misma página cambiando la ciudad Replantear intención y contenido
Texto de fabricante Misma descripción en varias tiendas Añadir información propia

Google considera las URLs con mayúsculas y minúsculas como direcciones diferentes. Los parámetros de tracking, sesión, ordenación y filtrado también pueden generar múltiples versiones del mismo contenido.

¿Qué ocurre con la paginación?

Una secuencia paginada no es necesariamente contenido duplicado:

https://tienda.es/zapatillas/
https://tienda.es/zapatillas/?page=2
https://tienda.es/zapatillas/?page=3

Cada página puede mostrar productos diferentes. Por eso, cada URL debe incluir una canonical que apunte hacia sí misma, lo que denominamos canonical autorreferente.

/zapatillas/
canonical → /zapatillas/

/zapatillas/?page=2
canonical → /zapatillas/?page=2

/zapatillas/?page=3
canonical → /zapatillas/?page=3

Una canonical autorreferente significa que la página se declara a sí misma como versión principal. No deberíamos canonicalizar toda la paginación hacia la primera página, porque las páginas posteriores contienen productos o artículos distintos.

Contenido duplicado en ecommerce: qué URLs deben indexarse

Los ecommerce son especialmente propensos a generar duplicados. Un catálogo con colores, tallas, marcas, precios y ordenaciones puede producir miles de combinaciones sin que nadie haya creado esas páginas manualmente.

El objetivo no es bloquear todos los filtros, sino decidir qué URLs responden a búsquedas reales y cuáles sirven únicamente para navegar por la tienda.

Filtros y parámetros

Pensemos en esta categoría:

🔗URL de ejemplo 🔄Qué cambia 🎯Decisión orientativa
Categoría limpia
https://tienda.es/zapatillas/
Muestra la categoría completa Utilizar como URL principal, con canonical autorreferente
Parámetro UTM
https://tienda.es/zapatillas/?utm_source=newsletter
Solo identifica la campaña de origen Mantener para medición, pero declarar como canonical la URL limpia
Ordenación
https://tienda.es/zapatillas/?orden=precio
Muestra los mismos productos en otro orden No trabajar como página SEO independiente
Filtro de color
https://tienda.es/zapatillas/?color=negro
Selecciona únicamente productos negros Analizar la demanda y valorar una landing como /zapatillas/negras/
Combinación de filtros
https://tienda.es/zapatillas/?color=negro&talla=42&marca=nike
Genera una selección muy específica Evitar su indexación independiente y limitar el rastreo innecesario

La navegación por filtros resulta útil para el usuario, pero puede crear una cantidad casi infinita de URLs. Estas combinaciones pueden consumir recursos de rastreo y retrasar el descubrimiento de páginas más valiosas.

¿Qué significa consolidar una URL con UTM?

Estas dos URLs muestran la misma categoría:

https://tienda.es/zapatillas/
https://tienda.es/zapatillas/?utm_source=newsletter

La segunda sirve para medir que la visita procede de una newsletter. No queremos que Google la trate como una página orgánica independiente.

Para consolidarla:

1. La URL con UTM sigue funcionando para medir la campaña.
2. Declara como canonical la URL limpia:
<link rel="canonical" href="https://tienda.es/zapatillas/" />
3. Los enlaces internos apuntan a la URL sin UTM.
4. El sitemap incluye únicamente la URL limpia

De esta forma, le indicamos a Google que la URL que debería indexar y mostrar es la versión sin parámetros. La URL con UTM puede seguir rastreándose y Google podría llegar a indexarla si interpreta otras señales, porque la canonical no es una directiva absoluta. Sin embargo, una implementación coherente reduce mucho esa posibilidad.

¿Cuándo un filtro merece una landing propia?

Una URL como esta:

https://tienda.es/zapatillas/?color=negro

puede responder a una búsqueda con potencial:  "zapatillas negras" . Imaginemos que esa keyword tiene 10.000 búsquedas mensuales. Existe una oportunidad, pero el volumen por sí solo no basta.

Antes de crear una landing debemos comprobar:

  • Que existe una demanda relevante.
  • Que el ecommerce dispone de suficientes productos.
  • Que el inventario será relativamente estable.
  • Que la selección responde a una necesidad diferenciada.
  • Que podemos trabajar un title, H1 y contenido propios.
  • Que la página puede recibir enlaces internos.

Como criterio práctico, no como regla de Google, evitaría crear la subcategoría si solo dispone de uno o dos productos. Un punto de partida razonable puede ser contar con al menos cinco u ocho productos relevantes y prever que la selección seguirá teniendo stock.

Si se cumplen estas condiciones, podemos crear esta url/landing https://tienda.es/zapatillas/negras/ . Y esta  URL tendría una canonical autorreferente, es decir, se señalaría a sí misma como la versión principal. También aparecería en el sitemap y recibiría enlaces desde la arquitectura de categorías.

Una buena investigación de palabras clave ayuda a separar los filtros con demanda de las combinaciones que solo facilitan la navegación.

Variantes de producto: tallas y colores

Muchos ecommerce crean una URL diferente para cada talla. El usuario normalmente no busca una ficha orgánica distinta para cada talla. Estas URLs pueden ser necesarias para seleccionar la variante, controlar el stock o mostrar el SKU correcto, pero no necesitan posicionarse como páginas independientes.

La URL base sería:

https://tienda.es/camiseta/

Y las variantes técnicas:

https://tienda.es/camiseta/?talla=s
https://tienda.es/camiseta/?talla=m
https://tienda.es/camiseta/?talla=l 

En una implementación habitual:

  • Las variantes equivalentes declaran como canonical la URL base.
  • El sitemap contiene únicamente /camiseta/.
  • Los enlaces internos apuntan a /camiseta/.
  • Las URLs de talla no se trabajan como landings SEO.

Los datos estructurados de variantes ayudan a Google a comprender que las tallas y colores pertenecen a un mismo producto principal. El marcado puede identificar el grupo, cada variante, su color, talla, precio, SKU y disponibilidad.

 

Productos agotados o descatalogados

Conviene reducir las situaciones a tres decisiones principales:

📌Situación Qué recomendamos
El producto volverá Mantener la URL y mostrar el estado
No volverá, pero tiene sustituto equivalente Redirección 301 al sustituto
No volverá y no existe sustituto relevante Devolver 404 o 410

Cuando el producto está agotado temporalmente, podemos mantener la página con estado 200, indicar que no está disponible y ofrecer:

  • Productos similares.
  • Una fecha estimada de reposición.
  • Un campo para dejar el email y recibir una notificación.
  • Datos estructurados con disponibilidad OutOfStock.

Si el producto no volverá y existe un sustituto realmente equivalente, puede utilizarse una redirección 301. No deberíamos redirigir automáticamente cualquier producto hacia la home, una categoría genérica o un producto vagamente parecido.

Lo mismo ocurre con una categoría eliminada. Si existe una categoría nueva que responde a la misma necesidad, podemos redirigirla. Si no existe un destino relevante, es preferible devolver un 404 o 410.

Cómo detectar contenido duplicado en una web

Una herramienta puede avisarnos de que existen páginas similares, pero la alerta no decide si se trata de un problema real. Primero debemos comprobar qué URLs están afectadas, si responden a la misma intención y qué versión queremos priorizar.

1. Buscar manualmente en Google

Podemos buscar una frase representativa entre comillas: site:https://esmartia.com "auditoria seo"

 También podemos limitar la búsqueda a un dominio: Por ejemplo: site:https://esmartia.com. Eso sí…¡Prueba con tu web, no con la nuestra! 

 

Formas de detectar contenido duplicado

 

Esto ayuda a descubrir páginas repetidas, pero el operador site: no ofrece un listado completo de todas las URLs indexadas.

 

2. Revisar Google Search Console

En el informe de indexación y en Inspección de URLs podemos comparar:

  • La canonical declarada por la web.
  • La canonical seleccionada por Google.
  • Las páginas excluidas por duplicación.

Algunos estados habituales son:

  • Duplicada: Google ha elegido una versión canónica diferente a la del usuario.
  • Duplicada: el usuario no ha indicado ninguna versión canónica.
  • Página alternativa con etiqueta canónica adecuada.

El último caso no siempre es un error. Puede significar que Google ha encontrado una versión alternativa y ha respetado correctamente la canonical.

3. Utilizar Semrush Site Audit

Semrush Site Audit puede detectar páginas similares, titles duplicados, metadescripciones repetidas y problemas de canonicalización. Semrush utiliza un umbral de similitud del 85 %. Es una regla de la herramienta, no un porcentaje definido por Google.

 

4. Rastrear la web con Screaming Frog

Screaming Frog SEO Spider permite detectar duplicados exactos y páginas casi idénticas. También identifica:

  • Titles repetidos.
  • Metadescripciones duplicadas.
  • H1 iguales.
  • Canonicals.
  • URLs indexables y no indexables.

Su análisis de páginas casi duplicadas utiliza por defecto un umbral del 90 %, que puede modificarse.

5. Utilizar IA para comparar URLs

Una IA con acceso web o a archivos puede ayudarnos a revisar un blog pequeño. Podemos proporcionarle un sitemap o una lista de URLs para que compare los titles, H1, metadescripciones y contenido principal.

También puede:

  • Agrupar artículos similares.
  • Detectar fragmentos repetidos.
  • Separar contenido principal de bloques comunes.
  • Identificar posibles falsos positivos.
  • Proponer qué páginas necesitan una revisión manual.

No sustituye a un crawler en un ecommerce grande. Para webs grandes, es más fiable seguir este flujo:

📌Situación Qué recomendamos
El producto volverá Mantener la URL y mostrar el estado
No volverá, pero tiene sustituto equivalente Redirección 301 al sustituto
No volverá y no existe sustituto relevante Devolver 404 o 410

Mini prompt para detectar contenido duplicado

Actúa como especialista en SEO técnico.

Utiliza este sitemap o listado de URLs:

[PEGAR SITEMAP O URLS]

Analiza un máximo de 50 páginas por lote.

Para cada página extrae:

  • URL.
  • Title tag.
  • Meta description.
  • H1.
  • Tema principal.
  • Contenido principal, ignorando menú, footer, avisos legales, cookies y CTA comunes.

Después:

  1. Agrupa páginas con contenido exacto o muy similar.
  2. Separa duplicados de contenido de metadatos repetidos.
  3. Indica las URLs afectadas.
  4. Explica qué partes o temas se repiten.
  5. Asigna una confianza alta, media o baja.
  6. Distingue duplicados reales de bloques compartidos.
  7. Propón si conviene mantener, fusionar, redirigir, canonicalizar o diferenciar.

No afirmes que has analizado una URL si no has podido acceder a ella.
No inventes porcentajes de similitud.
Antes de recomendar una solución, comprueba si las páginas responden a la misma intención de búsqueda.

 

¿Tu auditoría muestra cientos de duplicados y no sabes cuáles importan?
Una alerta no siempre representa un error. En Esmartia analizamos las URLs, su intención y su configuración para separar problemas reales, duplicados controlados y falsos positivos.

Cómo corregir el contenido duplicado

La solución depende de qué función cumple cada URL y de si debe desaparecer, seguir accesible o posicionarse.

📌Situación 🛠️Solución habitual
La URL ya no tiene utilidad Redirección 301 o 404
La URL muestra lo mismo, pero debe seguir funcionando Canonical hacia la principal
La página debe existir, pero no aparecer en Google noindex
Dos páginas resuelven la misma necesidad Fusionar y redirigir
Las páginas responden a intenciones diferentes Diferenciar el contenido
Un parámetro no aporta valor SEO Evitar su indexación separada
Google selecciona otra canonical Alinear todas las señales
Otra web copia el contenido Solicitar retirada o reclamar derechos

 

Redirección 301

La redirección envía al usuario y al buscador desde una URL hasta otra. Debe utilizarse cuando la página anterior ya no necesita seguir accesible.

/guia-contenido-duplicado-antigua/
        ↓ 301
/contenido-duplicado/

 

Canonical

Una canonical tiene sentido cuando una URL debe seguir funcionando, pero muestra el mismo contenido que otra.

Por ejemplo, una URL con UTM puede seguir utilizándose para medir una campaña:

/zapatillas/?utm_source=newsletter

Pero declarar como canonical:

/zapatillas/

indica que la segunda es la versión que queremos consolidar e indexar.

 

`noindex`

La etiqueta noindex solicita a Google que no incluya una página en sus resultados. Puede utilizarse en búsquedas internas, páginas de procesos o filtros útiles para el usuario que no necesitan posicionarse.

<meta name="robots" content="noindex">

Para que Google pueda leer esta etiqueta, debe tener acceso a la página.

`robots.txt` y `noindex` no deben confundirse

robots.txt controla el rastreo. noindex controla la indexación.

Si bloqueamos una URL mediante robots.txt, Google no podrá rastrearla y, por tanto, no podrá leer la etiqueta `noindex` incluida en su código. Una URL bloqueada podría continuar indexada solo por las referencias externas que Google conoce.

Por eso, para retirar una página del índice:

  1. Permitimos temporalmente que Google la rastree.
  2. Incluimos la etiqueta noindex.
  3. Esperamos a que Google la procese.
  4. Revisamos después si también necesitamos limitar el rastreo.

No debemos aplicar robots.txt y noindex a la vez esperando que Google lea ambas instrucciones.

¿Qué significa alinear las señales de canonicalización?

Imaginemos que queremos priorizar: https://web.es/zapatillas/ , Pero la web envía señales contradictorias: 

  • La canonical apunta a /zapatillas
  • El sitemap contiene /zapatillas/?orden=precio.
  • El menú enlaza a /zapatillas?categoria=1.
  • HTTP no redirige correctamente a HTTPS.

Alinear las señales significa que:

  • La canonical apunta a la URL limpia.
  • El sitemap incluye esa misma URL.
  • Los enlaces internos utilizan esa versión.
  • Las demás variantes redirigen o canonicalizan correctamente.

Cuantas más señales coincidan, más fácil será que Google respete nuestra elección.

Cómo evitar que se genere contenido duplicado

Prevenir el problema empieza por saber qué URL debe trabajar cada necesidad de búsqueda antes de publicar nuevos contenidos, categorías o landings.

📂Área 🛡️Regla preventiva 👤Responsable
Keyword mapping Una URL asignada a cada intención SEO y contenido
Blog Controlar categorías y etiquetas SEO
Ecommerce Definir filtros y variantes indexables SEO y desarrollo
URLs Utilizar un único formato Desarrollo
Canonicals Autorreferentes en páginas indexables SEO y desarrollo
Sitemap Incluir solo URLs canónicas e indexables SEO
Enlazado Utilizar URLs limpias SEO y contenido
CMS Evitar taxonomías automáticas innecesarias Desarrollo
Control Rastrear la web tras los cambios SEO

Un keyword mapping es un mapa o inventario de las URLs de la web y de las keywords e intenciones asignadas a cada una. Permite saber qué página debe posicionar por cada grupo de búsquedas y detectar contenidos que se solapan antes de que empiecen a competir.

En blogs grandes, una arquitectura basada en topic clusters también ayuda a separar el contenido pilar de los artículos de apoyo. A nivel técnico, conviene definir desde el principio qué parámetros y filtros puede generar el CMS y revisar cómo afectan al crawl budget.

Si la web ya ha crecido sin estas reglas, una auditoría SEO permite detectar los patrones y priorizar las correcciones sin revisar las URLs una por una.



Preguntas frecuentes sobre contenido duplicado

¿A partir de qué porcentaje se considera contenido duplicado?

Google no ha establecido un porcentaje universal. Algunas herramientas utilizan sus propios límites de similitud, como el 85 % de Semrush o el 90 % configurado por defecto en Screaming Frog. Son criterios de diagnóstico, no reglas de Google.

¿A partir de qué porcentaje se considera contenido duplicado?

No, siempre que el contenido principal esté realmente traducido. Dos páginas en idiomas diferentes pueden tratar el mismo tema sin ser duplicadas. Deben utilizar URLs diferenciadas y una configuración internacional coherente.

¿El contenido generado con IA puede considerarse duplicado?

Sí, cuando reproduce textos existentes o genera muchas páginas prácticamente iguales. Google no evalúa el contenido únicamente por la herramienta utilizada, sino por su utilidad, calidad y originalidad.

¿Puedo utilizar la misma descripción en mi web y en un marketplace?

Puedes, pero estarás publicando el mismo contenido en dos dominios. En los productos estratégicos conviene adaptar la descripción de la web, añadir casos de uso, resolver dudas y aportar información que no aparezca en el marketplace.

 

 El contenido duplicado rara vez empieza en un texto copiado. Muchas veces nace en los filtros, las plantillas, el CMS o una arquitectura que genera URLs sin que nadie las haya planificado.

En Esmartia analizamos el origen del problema, priorizamos las correcciones y coordinamos SEO, contenido y desarrollo. Porque una buena estrategia de inbound marketing necesita una web que Google pueda rastrear, entender y mostrar correctamente.

 

Tags: Marketing online, inbound marketing, marketing de contenidos, seo