Ir al contenido principal

Manual SEO 7ª Parte (Bots y Spiders)

Hasta ahora he comentado los trucos y mejoras en tu web para permitir que los buscadores la indexen

pero, como es normal, hay zonas o secciones que no queremos que indexen, como el área privada de los usuarios o páginas con el mismo contenido pero menor relevancia.

Pueden ser muchos los motivos por los que no quieras indexar una página o incluso una web entera, por ejemplo que está en BETA, es una página personal o no quieres problemas de contenido duplicado.

Para ello, hay que decirle a los spiders (que son los robots que usan los buscadores para rastrear tu web e indexarla), que no lo hagan.



Robots.txt

Si quieres que los spiders no rastreen una o varias de tus páginas, la forma mas segura es utilizar un archivo llamado robots.txt, y que no es mas que un simple archivo de texto (que puedes crear con el notepad) en el que se establecen ciertos criterios que informan a los buscadores sobre lo que no deben rastrear.

Para crear el robots.txt basta con crearlo usando el notepad y el siguiente código:

User-Agent: Googlebot
Disallow: /no-lo-indexes.html
Disallow: /carpeta-no-indexable/
Disallow: /*/subcarpeta-no-indexable/

En User Agent se establece el buscador al que quieres hacer referencia, y bajo el, en cada disallow una url de tu web que no quieres que sea indexada. Si quieres establecer que todos los buscadores sigan esas instrucciones, basta con poner el signo * en User-Agent (aunque dado que cada buscador premia unas u otras cosas aveces puede interesar permitir que unos indexen lo que otros no quieres que vean).

Para conocer los nombres de todos los buscadores busca aquí una lista, yo te dejo los spiders mas interesantes:

  • Google: Googlebot
  • Yahoo: yahoo_slurp
  • MSN: msnbot
  • Altavista: Scooter
  • Lycos: Lycos_Spider_(T-Rex)

Cuidado al colocar varios spiders y un comodín, ya que los spiders no harán caso de lo que ponga el comodín si tienen su sección propia, de tal manera que lo siguiente permitiría a Google indexar tu web pero al resto de buscadores no:

User-Agent: *
Disallow: /
User-Agent: Googlebot
Disallow: /carpetita/

Lo mismo sucede si por error te olvidas de poner algo tras el disallow, estarías diciendo que permites que indexen toda la página:

User-Agent: *
Disallow: /directorio/
Disallow:

Respecto a las páginas que no quieres indexar, puedes colocar archivos, directorios enteros, tipos de archivos, parámetros, etc. Para ello puedes utilizar el asterisco como comodin (que representa uno o varios caracteres indefinidos) y el dólar ‘$’ que indica que la url debe finalizar ahí. Te muestro unos ejemplos:

User-Agent: *
Disallow: /*/primavera/
Disallow: /*?
Disallow: /*.gif$
Disallow: /*userid=
Disallow: /*/*id=

El anterior robots impediría el acceso al subdirectorio primavera, cualquier URL que contenga un QueryString (o el símbolo ?), los gifs y cualquier url en que se incluya el parámetro userid o subdirectorio en que se incluya el parámetro id.

Si no utilizamos bien el $ podemos tener problemas, ya que sin él se especifica que cualquier URL que empiece por la cadena establecida no sea recorrida por los spiders, pero con él, se establece que deben terminar en eso. De forma que “/usabilidad/” impide el acceso al directorio usabilidad, “/*usabilidad” impide el acceso a cualquier URL que contenga usabilidad y “/*usabilidad$” impide el acceso a cualquier URL que termine en usabilidad. Ahora imaginemos que por error ponemos esto:

User-Agent: *
Disallow: /*?

Pretendiendo denegar el acceso a las páginas que contengan un QueryString vacío, estaríamos denegando en realidad cualquier página que contenga un QueryString, para lo primero debe ponerse el $ al final, indicando que tras el ? no debe haber nada mas y, si lo hay, entonces sí debe indexarse.

Por último, si lo que buscas es cerrar la web entera a los buscadores, bastaría con poner la barra de la raíz así:

User-Agent:*
Disallow: /

Nofollow y Noindex

Por otro lado, es posible que en tu página des opción a los usuarios a colocar enlaces y te encuentres con el problema que tuvieron en Wikipedia, y es que todo el mundo metía enlaces a sus webs aprovechando el prestigio de la famosa enciclopedia y empezaba a llenarse de spam hasta que apareció el nofollow, propiedad que sobre un enlace le dice a Google que no lo tenga en cuenta, con lo que ya no puede servir a esos usuarios para incrementar su Page Rank.

No lo sigas!!
No lo indexes!!

Además del nofollow, también existe el noindex, que le dice a Google que, aunque si puede seguir ese enlace (y por tanto tener en cuenta la página a la que apunta) no debe indexarla en sus búsquedas, esta etiqueta también puede ponerse en un meta de la página para asegurarse, aunque si pones este meta, recuerda quitar la página del robots.txt, o Google no pasará por la página y no podrá verlo.

Ten en cuenta que aunque le digas a Google en el robots que no rastree una de tus páginas, eso no implica que Google no la pueda indexar, ya que puede que haya un enlace a la misma en otras páginas, por lo que es necesario usar el meta noindex y quitar la página del robots para que vuelva a rastrearla y sepa que no la debe indexar.

Ah, y no os preocupéis, en mi Blog no he puesto que vuestros enlaces tengan un nofollow, es lo menos que puedo hacer por quienes comentan, dejar un enlace a su página con el anchor text que prefieran, siempre y cuando no sea spam claro… así que no esperes mas y empieza a poner comentarios para que parte de mi PR3 se redirija a tu página

Por cierto recordaros que podéis dejar vuestros comentarios sobre la entrada, o complementar esta información y eso es un enlace directo de mi Pagerank a vuestras Webs... yo no digo nada ;-)


Comentarios

posicionament ha dicho que…
Puedo usar tu información haciendo referencia tu nombre???
José Manuel Benítez ha dicho que…
OK, sólo pon un enlace a: CoberturaGSM.com

Gracias!!

Entradas populares de este blog

¿Qué está pasando con las tarifas de telefonía?

En lo que a tarifas de telefonía móvil se refiere Octubre está siendo un mes loco, desde Yoigo con su tarifa del 8, que no hace más que seguir la línea de Simyo y ahora Más Móvil


Recordar que estas dos últimas son operadoras móviles virtuales (OMV) las cuales no disponen de red propia y deben llegar a acuerdos para emplear redes existentes de otros operadores que si cuentan con infraestructura propia.

No obstante son movimiento muy interesantes ya que virtuales o no, ya existe la posibilidad de hablar (y mensajearse), con una cobertura más que razonable, pagando en algunos casos un 35% de lo que cuesta el minuto con otros operadores más conocidos.

Tanto Yoigo como Más Móvil cómo Simyo disponen de una tarifa de 8 cent./min (más impuestos) a cualquier hora y con cualquier operador, estas opciones presentan una novedad en cuanto a sencillez de tarifas, ya que en algunos casos, elegir una tarifa con Movistar o Vodafone, se convierte en un estudio que te puede llevar horas.

No olvidar que uno …

Manifiesto “En defensa de los derechos fundamentales en internet”

Ante la inclusión en el Anteproyecto de Ley de Economía sostenible de modificaciones legislativas que afectan al libre ejercicio de las libertades de expresión, información y el derecho de acceso a la cultura a través de Internet, los periodistas, bloggers, usuarios, profesionales y creadores de Internet manifestamos nuestra firme oposición al proyecto, y declaramos que:Los derechos de autor no pueden situarse por encima de los derechos fundamentales de los ciudadanos, como el derecho a la privacidad, a la seguridad, a la presunción de inocencia, a la tutela judicial efectiva y a la libertad de expresión.La suspensión de derechos fundamentales es y debe seguir siendo competencia exclusiva del poder judicial. Ni un cierre sin sentencia. Este anteproyecto, en contra de lo establecido en el artículo 20.5 de la Constitución, pone en manos de un órgano no judicial -un organismo dependiente del ministerio de Cultura-, la potestad de impedir a los ciudadanos españoles el acceso a cualquier p…

Pensando en BlackBerry

Hace más o menos un mes que está conmigo, como en toda relación hemos pasado algún que otro altibajo, fruto de la falta de entendimiento inicial, pero después de este tiempo he llegado a un entendimiento total.

Ayer, decidí actualizar su Rom, una operación entre comillas delicada, no es exactamente instalar un software, aquí es donde me llevé la sorpresa, la nueva Rom 4.5 es compatible con todos los modelos de BlackBerry, tu la descargas y dependiendo de tu modelo (en mi caso una pearl 8120) actualiza más o menos componentes.

Durante esta actualización me hizo una copia de seguridad de todo, y cuando digo todo es que al restaurarla (automáticamente por supuesto, como proceso de la actualización) me devolvió mi configuración de WiFi tanto del trabajo como la de mi casa, la del Parrot CK3100 del coche, por supuesto mis cuentas de email, SMS´s... Hasta el registro de llamadas!!

Esta ha sido la guinda de un pastel que se compone de un uso increíblemente sencillo e intuitivo, una calidad d…