Ir al contenido principal

Manual SEO 7ª Parte (Bots y Spiders)

Hasta ahora he comentado los trucos y mejoras en tu web para permitir que los buscadores la indexen

pero, como es normal, hay zonas o secciones que no queremos que indexen, como el área privada de los usuarios o páginas con el mismo contenido pero menor relevancia.

Pueden ser muchos los motivos por los que no quieras indexar una página o incluso una web entera, por ejemplo que está en BETA, es una página personal o no quieres problemas de contenido duplicado.

Para ello, hay que decirle a los spiders (que son los robots que usan los buscadores para rastrear tu web e indexarla), que no lo hagan.



Robots.txt

Si quieres que los spiders no rastreen una o varias de tus páginas, la forma mas segura es utilizar un archivo llamado robots.txt, y que no es mas que un simple archivo de texto (que puedes crear con el notepad) en el que se establecen ciertos criterios que informan a los buscadores sobre lo que no deben rastrear.

Para crear el robots.txt basta con crearlo usando el notepad y el siguiente código:

User-Agent: Googlebot
Disallow: /no-lo-indexes.html
Disallow: /carpeta-no-indexable/
Disallow: /*/subcarpeta-no-indexable/

En User Agent se establece el buscador al que quieres hacer referencia, y bajo el, en cada disallow una url de tu web que no quieres que sea indexada. Si quieres establecer que todos los buscadores sigan esas instrucciones, basta con poner el signo * en User-Agent (aunque dado que cada buscador premia unas u otras cosas aveces puede interesar permitir que unos indexen lo que otros no quieres que vean).

Para conocer los nombres de todos los buscadores busca aquí una lista, yo te dejo los spiders mas interesantes:

  • Google: Googlebot
  • Yahoo: yahoo_slurp
  • MSN: msnbot
  • Altavista: Scooter
  • Lycos: Lycos_Spider_(T-Rex)

Cuidado al colocar varios spiders y un comodín, ya que los spiders no harán caso de lo que ponga el comodín si tienen su sección propia, de tal manera que lo siguiente permitiría a Google indexar tu web pero al resto de buscadores no:

User-Agent: *
Disallow: /
User-Agent: Googlebot
Disallow: /carpetita/

Lo mismo sucede si por error te olvidas de poner algo tras el disallow, estarías diciendo que permites que indexen toda la página:

User-Agent: *
Disallow: /directorio/
Disallow:

Respecto a las páginas que no quieres indexar, puedes colocar archivos, directorios enteros, tipos de archivos, parámetros, etc. Para ello puedes utilizar el asterisco como comodin (que representa uno o varios caracteres indefinidos) y el dólar ‘$’ que indica que la url debe finalizar ahí. Te muestro unos ejemplos:

User-Agent: *
Disallow: /*/primavera/
Disallow: /*?
Disallow: /*.gif$
Disallow: /*userid=
Disallow: /*/*id=

El anterior robots impediría el acceso al subdirectorio primavera, cualquier URL que contenga un QueryString (o el símbolo ?), los gifs y cualquier url en que se incluya el parámetro userid o subdirectorio en que se incluya el parámetro id.

Si no utilizamos bien el $ podemos tener problemas, ya que sin él se especifica que cualquier URL que empiece por la cadena establecida no sea recorrida por los spiders, pero con él, se establece que deben terminar en eso. De forma que “/usabilidad/” impide el acceso al directorio usabilidad, “/*usabilidad” impide el acceso a cualquier URL que contenga usabilidad y “/*usabilidad$” impide el acceso a cualquier URL que termine en usabilidad. Ahora imaginemos que por error ponemos esto:

User-Agent: *
Disallow: /*?

Pretendiendo denegar el acceso a las páginas que contengan un QueryString vacío, estaríamos denegando en realidad cualquier página que contenga un QueryString, para lo primero debe ponerse el $ al final, indicando que tras el ? no debe haber nada mas y, si lo hay, entonces sí debe indexarse.

Por último, si lo que buscas es cerrar la web entera a los buscadores, bastaría con poner la barra de la raíz así:

User-Agent:*
Disallow: /

Nofollow y Noindex

Por otro lado, es posible que en tu página des opción a los usuarios a colocar enlaces y te encuentres con el problema que tuvieron en Wikipedia, y es que todo el mundo metía enlaces a sus webs aprovechando el prestigio de la famosa enciclopedia y empezaba a llenarse de spam hasta que apareció el nofollow, propiedad que sobre un enlace le dice a Google que no lo tenga en cuenta, con lo que ya no puede servir a esos usuarios para incrementar su Page Rank.

No lo sigas!!
No lo indexes!!

Además del nofollow, también existe el noindex, que le dice a Google que, aunque si puede seguir ese enlace (y por tanto tener en cuenta la página a la que apunta) no debe indexarla en sus búsquedas, esta etiqueta también puede ponerse en un meta de la página para asegurarse, aunque si pones este meta, recuerda quitar la página del robots.txt, o Google no pasará por la página y no podrá verlo.

Ten en cuenta que aunque le digas a Google en el robots que no rastree una de tus páginas, eso no implica que Google no la pueda indexar, ya que puede que haya un enlace a la misma en otras páginas, por lo que es necesario usar el meta noindex y quitar la página del robots para que vuelva a rastrearla y sepa que no la debe indexar.

Ah, y no os preocupéis, en mi Blog no he puesto que vuestros enlaces tengan un nofollow, es lo menos que puedo hacer por quienes comentan, dejar un enlace a su página con el anchor text que prefieran, siempre y cuando no sea spam claro… así que no esperes mas y empieza a poner comentarios para que parte de mi PR3 se redirija a tu página

Por cierto recordaros que podéis dejar vuestros comentarios sobre la entrada, o complementar esta información y eso es un enlace directo de mi Pagerank a vuestras Webs... yo no digo nada ;-)


Comentarios

Anónimo ha dicho que…
Puedo usar tu información haciendo referencia tu nombre???
Unknown ha dicho que…
OK, sólo pon un enlace a: CoberturaGSM.com

Gracias!!

Entradas populares de este blog

De quitarse el sombrero

Tanto me ha llamado la atención el comentario que he leído hoy en un importante blog español, escrito por Felix Maocho que no he podido más que hacer el "copy-paste" y colocarlo aquí, me parece una de las reflexiones más reveladoras, claras y precisas que jamás he escuchado.
La discusión viene a raíz de una charla de Zaryn Dentzel, fundador de Tuenti, donde comentaba sus aventuras y desventuras para crear su negocio.En plena discusión de gente que lo critica contra los que le adoran surge este genial comentario:
"Eres estudiante de la vida, no de una asignatura, siempre tienes que aprender", a mis 65 años estoy totalmente de acuerdo con ese chaval, intento seguir sabiendo más de la vida.Independientemente que ese chico parezca a unos sensacional y a otros un cantamañanas, (yo me inclino por lo primero), me encanta enseñanza americana, porque forma personas con iniciativa y no como la española, que forma empleados.Yo lo achaco que aquí, desde pequeño, te preparan para…

A vueltas con los intercambios de enlaces

Desde hace tiempo ser el primero en Google (o en otros buscadores, pero especialmente este) se ha convertido en un tesoro muy codiciado para webmasters, bloggers, etc.

En ocasiones habrás visto la famosas cadenas de enlaces, las cuales, en mi opinión tienen más interés como enlaces para los otros participantes, que ven tu web y visitan tu página, aunque sea por curiosidad.

El mayor problema que veo en estas cadenas es la ausencia de "Pagerank" en las páginas en las que se muestran, es decir generalmente no se encuentran en la portada con lo que poco interés pueden generar, y al no tener ranking Google, no importa demasiado que tu enlace esté ahí, como pudimos ver en la tabla de enlaces necesarios para "Pagerank"

Es por ello que propongo una nueva idea, yo utilizo una pequeña aplicación que podéis ver en mi portada, en la columna de la izquierda y que se llamae-referrer, al principio yo la empleaba para ver el "origen de mis visitas"pero con el tiempo he vist…

TomTom 7 Navigator ya disponible en MundoPDA

Nos es grato informar a todos los usuarios de PDA que hemos puesto a la venta la nueva versión del navegador más popular: TomTom 7

Actualmente podéis encontrarlo tanto en un atractivo pack de navegación con el HTC Touch HD, el cual incluye todos los accesorios necesarios para convertir tu PDA en un GPS. (Cargador de mechero y soporte)

Si ya tienes PDA, y sólo quieres adquirir el software puedes hacerlo en nuestra web, tenemos TomTom Iberia preinstalado en MicroSD, para tu PDA.

Esta nueva versión, introduce mejoras sustanciales, (además de mapas actualizados a 2009) como la función MapShare, que nos permite compartir las modificaciones realizadas en los mapas por otros usuarios, así como modificarlos nosotros para corregir errores.

Dispone tambien de funciones para evitar atascos, una nueva interfaz para introducir direcciones, convirtiendo, una vez más a TomTom en el mejor y más completo software de navegación.

Aquí tienes la lista de dispositivos compatibles:
HTC P3600HTC P3470HTC Touch Cr…