Tu web puede estar compitiendo contra sí misma sin que nadie haya copiado una sola palabra. Basta con que el CMS genere varias versiones de una URL, que los filtros de un ecommerce se multipliquen sin control o que los mismos artículos estén publicados en el dominio principal y en un subdominio que alguien olvidó revisar.
El problema no es únicamente que dos páginas se parezcan. Cuando Google encuentra varias versiones del mismo contenido, debe decidir cuál rastrea, cuál considera principal y cuál muestra en sus resultados. Si la web no envía señales claras, podemos perder el control sobre la URL que queremos posicionar y complicar el posicionamiento orgánico, la medición y el rastreo del sitio.
¿Qué es el contenido duplicado?
Existe contenido duplicado cuando una parte sustancial del contenido principal aparece de forma idéntica o muy similar en más de una URL. Puede ocurrir dentro de la misma web, entre un dominio y un subdominio o en dominios diferentes, aunque pertenezcan a la misma empresa.
Por ejemplo, podemos encontrar el mismo artículo en:
https://www.empresa.es/blog/contenido-duplicado/
https://recursos.empresa.es/contenido-duplicado/
Aunque ambas webs pertenezcan a la misma organización, Google sigue encontrando dos URLs con un contenido prácticamente idéntico y tendrá que decidir cuál representa mejor la información.
Para entender los duplicados sin mezclar conceptos, conviene analizarlos desde dos perspectivas distintas.
Según dónde aparece
| 📂 Tipo |
📖 Qué significa |
💡 Ejemplo |
| Duplicado interno |
Aparece en varias URLs de la misma web |
Dos URLs muestran la misma ficha de producto |
| Duplicado entre dominios o subdominios |
Aparece en webs o hosts diferentes |
El mismo artículo está en el dominio y en un subdominio |
Según cuánto se parece
| 📂 Tipo |
📖 Qué significa |
💡 Ejemplo |
| Duplicado exacto |
El contenido principal es idéntico |
Misma ficha accesible desde dos URLs |
| Casi duplicado |
Solo cambian elementos menores |
Varias landings iguales donde cambia la ciudad |
Una misma página puede pertenecer a las dos clasificaciones. Por ejemplo, dos fichas idénticas dentro de un ecommerce son un duplicado interno y exacto.
¿Contenido duplicado y plagio son lo mismo?
No exactamente. Contenido duplicado describe una situación técnica: hay información igual o muy similar en varias URLs. Plagio implica que alguien ha reproducido un contenido sin autorización.
Una descripción proporcionada por un fabricante puede aparecer legalmente en varias tiendas. En cambio, si otra web copia un artículo sin permiso, existe duplicación entre dominios y también puede haber un problema de derechos de autor. Google gestiona estas reclamaciones mediante un procedimiento legal independiente.
Tampoco todo lo que se repite dentro de una web constituye un problema. Es normal reutilizar el menú, el footer, ciertos avisos legales o una llamada a la acción. Lo importante es mantener coherencia y utilidad: añadir más bloques repetidos no mejora una página por el simple hecho de hacerla más extensa. Cuanto más sencillo sea encontrar la información, comprenderla y completar una acción, mejor será la experiencia.
¿Google penaliza el contenido duplicado?
Google no penaliza automáticamente una web simplemente por tener contenido duplicado.
La propia compañía lo resume así:
Google
“El contenido duplicado de un sitio no implica que deban tomarse medidas”.
Cuando Google encuentra varias páginas iguales o muy parecidas, suele agruparlas y seleccionar una como URL canónica, es decir, como la versión principal que utilizará para representar ese contenido en los resultados. La duplicación puede convertirse en un problema de spam cuando se crea deliberadamente para engañar o manipular el buscador, pero no es lo habitual en los casos técnicos de una web.
¿Qué es una URL canónica?
Una URL canónica es la versión que Google considera principal entre varias páginas duplicadas o muy similares.
Podemos indicar nuestra preferencia mediante una etiqueta incluida en el código:
<link rel="canonical" href="https://www.ejemplo.es/zapatillas/" />
Con esta etiqueta le estamos diciendo a Google:
Esta página se parece a otra, pero la URL que debería tomar como referencia es
https://www.ejemplo.es/zapatillas/.
La canonical es una señal fuerte, pero no una orden absoluta. Google puede elegir otra versión si encuentra mensajes contradictorios, por ejemplo, si la canonical apunta a una URL, el sitemap contiene otra y los enlaces internos dirigen a una tercera.
El problema real del contenido duplicado es perder el control de la URL
Cuando la canonical, el sitemap y los enlaces internos apuntan a versiones diferentes, Google recibe señales contradictorias y puede elegir una URL distinta de la que queremos posicionar.
| 📌Caso |
🔎Qué está pasando |
🛠️Problema y solución |
| Canonical hacia una URL con parámetros |
https://tienda.es/zapatillas/ declara como canonical https://tienda.es/zapatillas/?orden=precio. |
La URL parametrizada solo cambia el orden de los productos, por lo que no debería ser la principal. La categoría limpia debe incluir una canonical autorreferente y las URLs de ordenación deben apuntar hacia ella. |
| El menú y la canonical utilizan formatos diferentes |
El menú enlaza a https://tienda.es/zapatillas/, pero la canonical señala https://tienda.es/zapatillas, sin barra final. |
Google recibe dos versiones como referencia. Hay que elegir un único formato, redirigir la alternativa mediante 301 y utilizar la misma URL en la canonical, el menú y el sitemap. |
No importa tanto elegir una URL con barra final o sin ella. Lo importante es que todas las señales apunten siempre a la misma versión.
Esto puede provocar:
- Que se muestre una URL parametrizada, antigua o difícil de interpretar.
- Que los enlaces y otras señales se repartan entre varias versiones.
- Que Google rastree combinaciones que no aportan valor.
- Que los datos de rendimiento aparezcan fragmentados.
- Que el usuario llegue a una página menos útil.
El problema no es únicamente “tener duplicados”. Es dejar que Google decida sin haber definido correctamente qué URL queremos priorizar.
Problemas de contenido duplicado más frecuentes
La duplicación puede originarse en la configuración del dominio, el CMS, las plantillas, los parámetros o la arquitectura de la web.
| ⚠️Problema |
🔎Ejemplo |
🛠️Solución habitual |
| HTTP y HTTPS |
http://web.es/seo/ https://web.es/seo/ |
Redirigir HTTP hacia HTTPS |
| Con www y sin www |
www.web.es web.es |
Elegir una versión y redirigir |
| Barra final |
/seo /seo/ |
Normalizar y redirigir |
| Mayúsculas |
/SEO/ /seo/ |
Unificar el formato |
| Tracking |
?utm_source=email |
Canonical hacia la URL limpia |
| Sesiones |
?sessionid=123 |
Evitar enlazar el parámetro |
| Versión imprimible |
?print=1 |
Canonical hacia la versión HTML |
| Categorías y etiquetas |
/categoria/seo/ /tag/seo/ |
Fusionar, diferenciar o aplicar noindex |
| Landings locales repetidas |
Misma página cambiando la ciudad |
Replantear intención y contenido |
| Texto de fabricante |
Misma descripción en varias tiendas |
Añadir información propia |
Google considera las URLs con mayúsculas y minúsculas como direcciones diferentes. Los parámetros de tracking, sesión, ordenación y filtrado también pueden generar múltiples versiones del mismo contenido.
¿Qué ocurre con la paginación?
Una secuencia paginada no es necesariamente contenido duplicado:
https://tienda.es/zapatillas/
https://tienda.es/zapatillas/?page=2
https://tienda.es/zapatillas/?page=3
Cada página puede mostrar productos diferentes. Por eso, cada URL debe incluir una canonical que apunte hacia sí misma, lo que denominamos canonical autorreferente.
/zapatillas/
canonical → /zapatillas/
/zapatillas/?page=2
canonical → /zapatillas/?page=2
/zapatillas/?page=3
canonical → /zapatillas/?page=3
Una canonical autorreferente significa que la página se declara a sí misma como versión principal. No deberíamos canonicalizar toda la paginación hacia la primera página, porque las páginas posteriores contienen productos o artículos distintos.
Contenido duplicado en ecommerce: qué URLs deben indexarse
Los ecommerce son especialmente propensos a generar duplicados. Un catálogo con colores, tallas, marcas, precios y ordenaciones puede producir miles de combinaciones sin que nadie haya creado esas páginas manualmente.
El objetivo no es bloquear todos los filtros, sino decidir qué URLs responden a búsquedas reales y cuáles sirven únicamente para navegar por la tienda.
Filtros y parámetros
Pensemos en esta categoría:
| 🔗URL de ejemplo |
🔄Qué cambia |
🎯Decisión orientativa |
Categoría limpia https://tienda.es/zapatillas/ |
Muestra la categoría completa |
Utilizar como URL principal, con canonical autorreferente |
Parámetro UTM https://tienda.es/zapatillas/?utm_source=newsletter |
Solo identifica la campaña de origen |
Mantener para medición, pero declarar como canonical la URL limpia |
Ordenación https://tienda.es/zapatillas/?orden=precio |
Muestra los mismos productos en otro orden |
No trabajar como página SEO independiente |
Filtro de color https://tienda.es/zapatillas/?color=negro |
Selecciona únicamente productos negros |
Analizar la demanda y valorar una landing como /zapatillas/negras/ |
Combinación de filtros https://tienda.es/zapatillas/?color=negro&talla=42&marca=nike |
Genera una selección muy específica |
Evitar su indexación independiente y limitar el rastreo innecesario |
La navegación por filtros resulta útil para el usuario, pero puede crear una cantidad casi infinita de URLs. Estas combinaciones pueden consumir recursos de rastreo y retrasar el descubrimiento de páginas más valiosas.
¿Qué significa consolidar una URL con UTM?
Estas dos URLs muestran la misma categoría:
https://tienda.es/zapatillas/
https://tienda.es/zapatillas/?utm_source=newsletter
La segunda sirve para medir que la visita procede de una newsletter. No queremos que Google la trate como una página orgánica independiente.
Para consolidarla:
1. La URL con UTM sigue funcionando para medir la campaña.
2. Declara como canonical la URL limpia:
<link rel="canonical" href="https://tienda.es/zapatillas/" />
3. Los enlaces internos apuntan a la URL sin UTM.
4. El sitemap incluye únicamente la URL limpia
De esta forma, le indicamos a Google que la URL que debería indexar y mostrar es la versión sin parámetros. La URL con UTM puede seguir rastreándose y Google podría llegar a indexarla si interpreta otras señales, porque la canonical no es una directiva absoluta. Sin embargo, una implementación coherente reduce mucho esa posibilidad.
¿Cuándo un filtro merece una landing propia?
Una URL como esta:
https://tienda.es/zapatillas/?color=negro
puede responder a una búsqueda con potencial: "zapatillas negras" . Imaginemos que esa keyword tiene 10.000 búsquedas mensuales. Existe una oportunidad, pero el volumen por sí solo no basta.
Antes de crear una landing debemos comprobar:
- Que existe una demanda relevante.
- Que el ecommerce dispone de suficientes productos.
- Que el inventario será relativamente estable.
- Que la selección responde a una necesidad diferenciada.
- Que podemos trabajar un title, H1 y contenido propios.
- Que la página puede recibir enlaces internos.
Como criterio práctico, no como regla de Google, evitaría crear la subcategoría si solo dispone de uno o dos productos. Un punto de partida razonable puede ser contar con al menos cinco u ocho productos relevantes y prever que la selección seguirá teniendo stock.
Si se cumplen estas condiciones, podemos crear esta url/landing https://tienda.es/zapatillas/negras/ . Y esta URL tendría una canonical autorreferente, es decir, se señalaría a sí misma como la versión principal. También aparecería en el sitemap y recibiría enlaces desde la arquitectura de categorías.
Una buena investigación de palabras clave ayuda a separar los filtros con demanda de las combinaciones que solo facilitan la navegación.
Variantes de producto: tallas y colores
Muchos ecommerce crean una URL diferente para cada talla. El usuario normalmente no busca una ficha orgánica distinta para cada talla. Estas URLs pueden ser necesarias para seleccionar la variante, controlar el stock o mostrar el SKU correcto, pero no necesitan posicionarse como páginas independientes.
La URL base sería:
https://tienda.es/camiseta/
Y las variantes técnicas:
https://tienda.es/camiseta/?talla=s
https://tienda.es/camiseta/?talla=m
https://tienda.es/camiseta/?talla=l
En una implementación habitual:
- Las variantes equivalentes declaran como canonical la URL base.
- El sitemap contiene únicamente /camiseta/.
- Los enlaces internos apuntan a /camiseta/.
- Las URLs de talla no se trabajan como landings SEO.
Los datos estructurados de variantes ayudan a Google a comprender que las tallas y colores pertenecen a un mismo producto principal. El marcado puede identificar el grupo, cada variante, su color, talla, precio, SKU y disponibilidad.
Productos agotados o descatalogados
Conviene reducir las situaciones a tres decisiones principales:
| 📌Situación |
✅Qué recomendamos |
| El producto volverá |
Mantener la URL y mostrar el estado |
| No volverá, pero tiene sustituto equivalente |
Redirección 301 al sustituto |
| No volverá y no existe sustituto relevante |
Devolver 404 o 410 |
Cuando el producto está agotado temporalmente, podemos mantener la página con estado 200, indicar que no está disponible y ofrecer:
- Productos similares.
- Una fecha estimada de reposición.
- Un campo para dejar el email y recibir una notificación.
- Datos estructurados con disponibilidad OutOfStock.
Si el producto no volverá y existe un sustituto realmente equivalente, puede utilizarse una redirección 301. No deberíamos redirigir automáticamente cualquier producto hacia la home, una categoría genérica o un producto vagamente parecido.
Lo mismo ocurre con una categoría eliminada. Si existe una categoría nueva que responde a la misma necesidad, podemos redirigirla. Si no existe un destino relevante, es preferible devolver un 404 o 410.
Cómo detectar contenido duplicado en una web
Una herramienta puede avisarnos de que existen páginas similares, pero la alerta no decide si se trata de un problema real. Primero debemos comprobar qué URLs están afectadas, si responden a la misma intención y qué versión queremos priorizar.
1. Buscar manualmente en Google
Podemos buscar una frase representativa entre comillas: site:https://esmartia.com "auditoria seo"
También podemos limitar la búsqueda a un dominio: Por ejemplo: site:https://esmartia.com. Eso sí…¡Prueba con tu web, no con la nuestra!
Esto ayuda a descubrir páginas repetidas, pero el operador site: no ofrece un listado completo de todas las URLs indexadas.
En el informe de indexación y en Inspección de URLs podemos comparar:
- La canonical declarada por la web.
- La canonical seleccionada por Google.
- Las páginas excluidas por duplicación.
Algunos estados habituales son:
- Duplicada: Google ha elegido una versión canónica diferente a la del usuario.
- Duplicada: el usuario no ha indicado ninguna versión canónica.
- Página alternativa con etiqueta canónica adecuada.
El último caso no siempre es un error. Puede significar que Google ha encontrado una versión alternativa y ha respetado correctamente la canonical.
3. Utilizar Semrush Site Audit
Semrush Site Audit puede detectar páginas similares, titles duplicados, metadescripciones repetidas y problemas de canonicalización. Semrush utiliza un umbral de similitud del 85 %. Es una regla de la herramienta, no un porcentaje definido por Google.
4. Rastrear la web con Screaming Frog
Screaming Frog SEO Spider permite detectar duplicados exactos y páginas casi idénticas. También identifica:
- Titles repetidos.
- Metadescripciones duplicadas.
- H1 iguales.
- Canonicals.
- URLs indexables y no indexables.
Su análisis de páginas casi duplicadas utiliza por defecto un umbral del 90 %, que puede modificarse.
5. Utilizar IA para comparar URLs
Una IA con acceso web o a archivos puede ayudarnos a revisar un blog pequeño. Podemos proporcionarle un sitemap o una lista de URLs para que compare los titles, H1, metadescripciones y contenido principal.
También puede:
- Agrupar artículos similares.
- Detectar fragmentos repetidos.
- Separar contenido principal de bloques comunes.
- Identificar posibles falsos positivos.
- Proponer qué páginas necesitan una revisión manual.
No sustituye a un crawler en un ecommerce grande. Para webs grandes, es más fiable seguir este flujo:
| 📌Situación |
✅Qué recomendamos |
| El producto volverá |
Mantener la URL y mostrar el estado |
| No volverá, pero tiene sustituto equivalente |
Redirección 301 al sustituto |
| No volverá y no existe sustituto relevante |
Devolver 404 o 410 |
Mini prompt para detectar contenido duplicado
Actúa como especialista en SEO técnico.
Utiliza este sitemap o listado de URLs:
[PEGAR SITEMAP O URLS]
Analiza un máximo de 50 páginas por lote.
Para cada página extrae:
- URL.
- Title tag.
- Meta description.
- H1.
- Tema principal.
- Contenido principal, ignorando menú, footer, avisos legales, cookies y CTA comunes.
Después:
- Agrupa páginas con contenido exacto o muy similar.
- Separa duplicados de contenido de metadatos repetidos.
- Indica las URLs afectadas.
- Explica qué partes o temas se repiten.
- Asigna una confianza alta, media o baja.
- Distingue duplicados reales de bloques compartidos.
- Propón si conviene mantener, fusionar, redirigir, canonicalizar o diferenciar.
No afirmes que has analizado una URL si no has podido acceder a ella.
No inventes porcentajes de similitud.
Antes de recomendar una solución, comprueba si las páginas responden a la misma intención de búsqueda.
¿Tu auditoría muestra cientos de duplicados y no sabes cuáles importan?
Una alerta no siempre representa un error. En Esmartia analizamos las URLs, su intención y su configuración para separar problemas reales, duplicados controlados y falsos positivos.