Cómo funciona el SEO: rastreo, indexación y posicionamiento
Qué hace un buscador en cada capa, que exige de verdad y que no promete, y donde actua el SEO en cada una.
Casi todas las explicaciones de esto usan la metáfora de la biblioteca: Google es un bibliotecario que recorre estanterías y ordena libros. La metáfora es cómoda y esconde justo donde se rompen los sitios reales. En una auditoría, los fallos que más dinero cuestan casi nunca están en el paso de ordenar, que es del que habla todo el mundo. Están en los dos anteriores, y tienen nombres concretos que aparecen escritos en Search Console si uno sabe dónde mirar.
¿Cómo funciona el SEO paso a paso?
Un buscador rastrea, indexa y ordena, y el SEO actúa en las tres capas. En un sitio nuevo el cuello de botella es el rastreo y la indexación; en uno de autoridad media es cómo se ordena frente a competidores parecidos; en uno consolidado son las señales de calidad, que se mueven despacio y sin aviso.
Respuesta rápida
- Son tres operaciones distintas y encadenadas: rastrear, indexar y ordenar. Un fallo arriba anula todo lo de abajo.
- Bloquear en robots.txt no desindexa. Impide el rastreo, y si la página tiene
noindex, Google no puede leerlo porque no entra. - La mayoría de los problemas graves están en la indexación, y son visibles en el informe de páginas de Search Console.
- Ordenar es la última capa, y encima de ella hay ahora una más: cómo se presenta el resultado.
| Operación | Qué decide | Dónde se comprueba |
|---|---|---|
| Rastreo | Si el buscador puede entrar y leer | robots.txt, informe de rastreo |
| Renderizado | Si ve lo que ve un usuario | Prueba de URL en directo |
| Indexación | Si guarda la página y con qué canónica | Informe de páginas indexadas |
| Ordenación | En qué puesto sale ante cada consulta | Informe de rendimiento |
| Presentación | Qué muestra de ti y si hay resumen encima | La propia página de resultados |
1. Rastreo: si no entra, no existe
Googlebot descubre páginas de dos maneras: siguiendo enlaces desde páginas que ya conoce y leyendo el sitemap. Las dos importan y no son intercambiables. El sitemap declara que una URL existe; el enlace interno declara que importa.
Una página que solo aparece en el sitemap y no recibe ningún enlace interno queda en un limbo frecuente. En una auditoría propia sobre un sitio de 312 páginas había 35 huérfanas, y las dos con más impresiones no recibían ni un enlace interno pese a sumar unas 106.000 impresiones entre las dos. La estructura interna no llegaba a unas 180.000 impresiones al trimestre.
El error que más se repite en esta capa
Bloquear una sección en robots.txt creyendo que así se desindexa. Son operaciones distintas: robots.txt impide el rastreo, y noindex es una instrucción que vive dentro de la página. Si bloqueas la ruta, Googlebot no entra, no lee el noindex y la URL puede seguir apareciendo en resultados sin descripción.
La secuencia correcta cuando hay que sacar algo del índice es dejar rastrear, poner noindex, esperar a que se procese y solo entonces bloquear el rastreo si hace falta ahorrar presupuesto. Las doce causas por las que una página no se indexa desarrollan el resto de casos.
2. Renderizado: el paso que las guías se saltan
Entre rastrear e indexar hay una operación intermedia que decide muchos casos raros. Googlebot descarga el HTML y, si la página construye su contenido con JavaScript, tiene que ejecutarlo para ver lo que ve una persona. Ese renderizado ocurre en una cola aparte y no siempre a la vez que el rastreo.
La consecuencia práctica es que un sitio puede estar perfectamente rastreado y aun así indexarse con la mitad del contenido, porque en el momento de la evaluación el texto todavía no existía en el HTML. Se comprueba en la prueba de URL en directo de Search Console, mirando el HTML renderizado en lugar de fiarse del código fuente.
3. Indexación: dónde se pierde el trabajo
Aquí es donde una auditoría encuentra el dinero. El informe de páginas de Search Console clasifica cada URL con un motivo, y esos motivos son mucho más informativos de lo que sugiere su nombre.
| Estado en Search Console | Qué significa de verdad |
|---|---|
| Descubierta: actualmente sin indexar | La conoce y no ha querido gastar rastreo en ella |
| Rastreada: actualmente sin indexar | Entró, la leyó y decidió no guardarla |
| Duplicada: Google eligió otra canónica | Considera que otra página tuya dice lo mismo |
| Página alternativa con canónica adecuada | Correcto, es una variante declarada |
| Excluida por la etiqueta noindex | Se lo pediste tú, comprueba que era intencionado |
| Bloqueada por robots.txt | No pudo entrar |
Los dos primeros estados son los más malinterpretados. "Descubierta: actualmente sin indexar" en volumen suele indicar un problema de presupuesto de rastreo o de valor percibido del sitio, no un fallo de la página concreta. "Rastreada: actualmente sin indexar" es más específico y más incómodo: el buscador la leyó entera y decidió que no aportaba lo suficiente.
Y un noindex heredado de un entorno de pruebas es el fallo con peor relación entre tamaño y daño de todo el oficio. Una línea que nadie quitó al pasar a producción puede mantener un sitio entero fuera del índice durante meses sin producir ningún error visible.
4. Ordenación: la capa de la que habla todo el mundo
Ante una consulta, el buscador interpreta qué se está pidiendo, recupera un conjunto de candidatos entre lo indexado y los ordena. Las señales que usa son muchas y su peso exacto no es público, así que conviene desconfiar de cualquier lista que las presente como hechos confirmados con porcentajes.
Lo que sí está establecido es qué tipo de cosas evalúa: si el contenido responde la intención de esa consulta concreta, la calidad y el respaldo del documento, y la experiencia de la página. Dos matices que evitan la mayoría de los errores de estrategia:
La intención se evalúa por consulta, no por página. Una misma página puede ordenar bien para una consulta y muy mal para otra parecida, porque una pide una guía y otra pide un producto.
Y el índice se recalcula todo el rato. En 2026 hubo cuatro actualizaciones confirmadas, y la de marzo fue la más volátil registrada: el 79,5 % del top 3 cambió de posición y casi una de cada cuatro páginas del top 10 se cayó del top 100. Ante una caída, lo primero es mirar esas fechas y no el plugin de caché.
5. Presentación: lo nuevo de los últimos dos años
Ordenar dejó de ser el último paso. Encima del primer resultado puede aparecer un resumen generado, y eso cambia qué parte del trabajo produce visitas.
Los resúmenes de IA aparecen en cerca del 43 % de las búsquedas de Google, con un 48 % medido en marzo de 2026, y cuando están presentes el CTR orgánico con resumen cayó de 1,76 % a 0,61 % según Seer Interactive. En ese mismo estudio, las consultas sin resumen también cayeron, de 2,72 % a 1,62 %, así que una parte de la pérdida venía ocurriendo igual. Las búsquedas que terminan sin ningún clic pasaron del 56 % al 69 % entre mayo de 2024 y mayo de 2025.
La lectura correcta no es que el rastreo y la indexación importen menos. Es que ahora hay una capa más donde se puede perder el resultado después de haberlo ganado todo lo demás. El detalle de cómo se comporta esa capa está en AI Overviews de Google.
En qué orden se arregla un sitio
El orden importa porque arreglar abajo sin arreglar arriba no produce ningún efecto medible.
- Que se pueda rastrear. robots.txt, errores de servidor, redirecciones encadenadas.
- Que se indexe lo que debe. Revisar los motivos de exclusión uno a uno, empezando por el volumen.
- Que la estructura interna llegue a lo que importa. Las huérfanas primero.
- Que la intención coincida. Comparar lo que responde la página con lo que piden las consultas por las que aparece.
- Que el resultado sea reconocible. Títulos que contengan lo que la gente escribe.
Ese quinto paso parece el más superficial y suele ser el más rentable a corto plazo. En el sitio de las 312 páginas, el trabajo con mejor retorno de todo el proyecto fue reescribir títulos, sin una palabra nueva de contenido.
Cuándo NO empezar por lo técnico
Cuando el sitio ya está indexado con solvencia y el problema es de clics. Si las impresiones son altas y estables y los clics no llegan, el rastreo no es el culpable y auditar servidores es gastar el presupuesto en el sitio equivocado.
Lo que el buscador exige, y lo que no promete
La mecánica se entiende mejor sabiendo dónde está la frontera real, y es más estrecha de lo que parece. Google publica tres requisitos técnicos para que una página pueda aparecer: que Googlebot no esté bloqueado, que devuelva HTTP 200 y que tenga contenido indexable en un formato admitido.
Y a continuación, la frase que casi nadie cita: cumplirlos no garantiza la indexación. El buscador decide qué guarda, y guarda menos de lo que se le ofrece cuando no tiene motivos para creer que el resto aporta algo.
Eso reordena el modelo mental con el que casi todo el mundo llega. El SEO no consiste en cumplir condiciones para acceder a un derecho, porque el derecho no existe. Consiste en quitar los obstáculos que impiden que te vean y después dar razones para que te elijan, y solo la primera mitad tiene reglas publicadas.
Dónde actúa cada capa
En el rastreo y la indexación, que es la puerta: si no pasa, nada de lo demás ocurre. El orden está en SEO técnico y el diagnóstico cuando falla, en por qué Google no indexa mi página.
En la ordenación, donde compiten páginas parecidas y decide qué responde mejor a la intención: intención de búsqueda.
Y en la presentación, que ya no es solo una lista de enlaces: AI Overviews y los fragmentos destacados cambian qué parte del clic llega.
Lo que un buscador declara y lo que no, con las actualizaciones que mueven todo esto, está en actualizaciones de Google.
Los doscientos factores, que nadie ha visto nunca
Casi todos los resultados que ocupan esta consulta, comprobados el 13 de agosto de 2026, explican el funcionamiento del buscador con la misma cifra: el algoritmo de Google tiene unos doscientos factores. Aparece como dato de partida, sin fuente, y de ahí sale la mitad del contenido de la página.
Google no ha publicado nunca esa lista. Sus propios ingenieros llevan años diciendo que no hay un número fijo, que muchas señales se generan solas y que el peso de cada una cambia según la consulta. La cifra circula desde hace casi veinte años y sobrevive porque es cómoda: convierte algo continuo y cambiante en un inventario que parece que se puede terminar.
El daño no es de exactitud, es de método. Quien empieza con la idea del inventario se pone a buscar la lista, y el trabajo real no consiste en marcar doscientas casillas sino en pasar las cinco capas de arriba en orden, porque fallar la primera hace irrelevantes las otras cuatro. Un sitio que no se rastrea no tiene factor doscientos ni factor uno.
Errores que se repiten
- Bloquear en robots.txt para desindexar. Impide leer el
noindexy consigue lo contrario. - Fiarse del código fuente en sitios con JavaScript. Lo que cuenta es el HTML renderizado.
- Leer "Rastreada: actualmente sin indexar" como un error técnico. Es un juicio de valor sobre el contenido.
- Publicar en el sitemap y no enlazar internamente. Declara existencia sin declarar importancia.
- Buscar causas internas ante una caída sin comprobar el calendario de actualizaciones.
- Arreglar una URL y no barrer el resto. Los defectos aparecen en una página y luego en decenas.
Datos y transparencia
Que los primeros resultados en español para esta consulta presentan la cifra de doscientos factores como dato de partida es una observación propia del 13 de agosto de 2026 y se recoge como afirmación circulante, no como fuente. Que Google no publica esa lista y que sus ingenieros han dicho que no existe un número fijo de señales procede de sus declaraciones públicas, comprobado el mismo día.
Que los tres requisitos técnicos son que Googlebot no esté bloqueado, que la página devuelva HTTP 200 y que tenga contenido indexable en un formato admitido, y que cumplirlos no garantiza la indexación, procede de la documentación pública de Google sobre requisitos técnicos, comprobada el 12 de agosto de 2026.
Los casos de páginas huérfanas y de la página en posición 1 sin clics proceden de una auditoría propia sobre un recetario de cocina colombiana en inglés, 312 páginas en WordPress, ejecutada en 2026; es trabajo de cliente y no se nombra, y las cifras van redondeadas. Los datos de volatilidad del algoritmo en 2026 proceden de SE Ranking. Los de presencia de resúmenes de IA proceden de Similarweb (Generative AI Landscape 2026) para el 43 % y BrightEdge (verticales comerciales, marzo de 2026) para el 48 %; los de caída de CTR, de el estudio de Seer Interactive sobre 10 millones de impresiones, ventana de junio de 2024 a septiembre de 2025; y la serie de búsquedas sin clic, de Similarweb. Los estados de indexación citados corresponden a las etiquetas del informe de páginas de Google Search Console vigentes a agosto de 2026. Verificado a agosto de 2026.
Fuentes primarias, abiertas el 13 de agosto de 2026: el estudio de Seer Interactive; la encuesta de SE Ranking.
Lo que esto cambia
La imagen del bibliotecario tiene un problema de fondo: sugiere que el sistema quiere encontrar tus páginas y solo necesita que se lo pongas fácil.
Lo que muestran los informes de indexación de cualquier sitio mediano es otra cosa. Hay un presupuesto de atención, se reparte según lo que el sitio ha demostrado valer, y buena parte de lo que publicas puede no llegar nunca a ser evaluado. Deja de ser un problema de convencer al que ordena y pasa a ser uno de merecer que te lean. La mayoría de los sitios que se declaran estancados en posiciones tienen, en realidad, un porcentaje incómodo de páginas que Google nunca llegó a guardar.
Preguntas frecuentes
¿Cuál es la diferencia entre rastrear e indexar?
Rastrear es que Googlebot entre en la página y lea su contenido. Indexar es que Google decida guardarla en su índice y considerarla candidata a aparecer en resultados. Una página puede rastrearse y no indexarse, y Search Console lo indica con el estado "Rastreada: actualmente sin indexar", que significa que la leyó y decidió no guardarla.
¿Bloquear una página en robots.txt la saca de Google?
No, y con frecuencia consigue lo contrario. El archivo robots.txt impide el rastreo, así que Googlebot no entra y no puede leer una etiqueta noindex que hubiera dentro. La URL puede seguir apareciendo en resultados sin descripción. Para sacar una página del índice hay que permitir el rastreo, poner noindex y esperar a que se procese.
¿Qué significa "Descubierta: actualmente sin indexar"?
Significa que Google conoce la existencia de esa URL pero no la ha rastreado todavía. En volumen suele apuntar a un problema de presupuesto de rastreo o de valor percibido del sitio entero, más que a un defecto de la página concreta. Es distinto de "Rastreada: actualmente sin indexar", donde sí entró y decidió no guardarla.
¿Cuánto tarda Google en indexar una página nueva?
No hay un plazo fijo y depende de la autoridad del sitio, de la frecuencia con que publica y de cuántos enlaces internos apunten a esa página. Lo que sí acelera el proceso de forma consistente es enlazarla desde páginas que ya se rastrean con frecuencia, en lugar de dejarla solo declarada en el sitemap.
¿Por qué mi página tiene buena posición y no recibe visitas?
Porque ordenar y ser visitado son operaciones distintas. Las causas habituales son que el título no contiene el término que la gente escribe, que un resumen de IA responde antes de que el usuario baje, o que apareces para consultas cuya intención tu página no resuelve. Se diagnostica comparando impresiones contra clics por consulta, nunca mirando la posición media.
La mayoría de sitios no tienen un problema de posicionamiento
Tienen un problema de qué pasa cuando alguien llega. Se puede estar primero en Google y no vender nada. El diagnóstico mira las dos cosas y te dice cuál de ellas te está costando dinero.
Ver el diagnóstico