Background

Mikä on robots.txt ja miten se toimii?

Robots.txt on pieni mutta tärkeä tiedosto, joka kertoo hakukoneroboteille, mitä sivuja niiden tulisi tai ei tulisi käydä läpi. Oikein käytettynä se parantaa hakukonenäkyvyyttä, mutta väärin käytettynä se voi estää koko sivuston näkymisen Googlelle.

1. Mikä robots.txt on?

Robots.txt on tekstitiedosto, joka sijaitsee verkkosivuston juurihakemistossa:

https://www.yritys.fi/robots.txt

Sen tehtävä on kertoa hakukoneroboteille:

  • mitä sivuja saa indeksoida
  • mitä sivuja ei saa indeksoida
  • miten robotin tulisi liikkua sivustolla
    Robots.txt ei ohjaa käyttäjiä — vain hakukoneita.

2. Miten robots.txt toimii käytännössä?

Kun Googlebot saapuu sivustollesi, se tarkistaa ensimmäisenä robots.txt-tiedoston. Tiedosto sisältää komentoja, kuten:

User-agent: *
Disallow: /admin/
Allow: /

Tämä tarkoittaa:

  • kaikki robotit (*)
  • eivät saa indeksoida /admin/
  • mutta voivat indeksoida kaiken muun

3. Mitä robots.txt EI tee?

On tärkeä ymmärtää, mitä robots.txt ei tee: ❌ Ei estä sivua näkymästä Googlessa, jos muu sivu linkittää siihen
❌ Ei suojaa yksityisiä sivuja
❌ Ei estä sivun URLia näkymästä hakutuloksissa
❌ Ei poista sivuja indeksistä
Se vain kertoo, mitä robotit saavat crawlata. Jos haluat estää sivun näkymisen Googlessa, käytä:

<meta name="robots" content="noindex">

4. Yleisimpiä robots.txt-esimerkkejä

1. Perus, kaikille sallittu robots.txt

User-agent: *
Disallow:

Kaikki robotit saavat indeksoida kaiken.

2. Estetään hallintasivu

User-agent: *
Disallow: /admin/
Disallow: /login/

3. Estetään tietyt tiedostomuodot

User-agent: *
Disallow: /*.pdf$
Disallow: /*.xls$

4. Estetään koko sivusto (VAARALLINEN)

User-agent: *
Disallow: /

Tämä estää indeksoinnin kokonaan — yleinen vahinkojen aiheuttaja.

5. Robots.txt ja SEO

Robots.txt vaikuttaa:

  • crawl budjettiin
  • sivujen löydettävyyteen
  • siihen, mitä Google käy läpi
  • siihen, mitkä sivut Google näkee tärkeinä
    Jos Google käyttää aikaa turhiin sivuihin kuten:
  • suodatussivut
  • tagisivut
  • hakusivut
    se ei ehdi indeksoida tärkeitä sisältöjä. Siksi robots.txt auttaa ohjaamaan indeksointia oikein.

6. Mitkä sivut kannattaa estää robots.txt:llä?

Useimmilla sivustoilla kannattaa estää:

  • /cart/
  • /checkout/
  • /login/
  • /admin/
  • /wp-admin/ (WordPress)
  • filtteröidyt tuotelistaukset
  • sisäiset haku-sivut (/?s=...)
  • testisivut
  • kehitysympäristön sivut
    Tämä vapauttaa Googlelle aikaa oikeille sisältösivuille.

7. Mitä sivuja EI saa estää robots.txt:llä?

Älä estä:

  • palvelusivuja
  • laskeutumissivuja
  • blogeja
  • kategorioita
  • tuotesivuja
  • tärkeää sisältöä
    Jos Google ei pääse crawlamaan sivua, se ei myöskään pysty ymmärtämään sitä.

8. Robots.txt ja sivukartta (sitemap)

Tärkeä lisäys robots.txt-tiedostoon on:

Sitemap: https://www.yritys.fi/sitemap.xml

Tämä kertoo Googlelle, mistä se löytää kaikki tärkeät sivut.

9. Yleisimmät virheet robots.txt-tiedostossa

❌ 1. Koko sivuston estäminen vahingossa

Yleinen virhe kehitysympäristöistä.

❌ 2. Tärkeiden sivujen estäminen

Palvelusivuja ei pidä estää — se tappaa näkyvyyden.

❌ 3. Luullaan, että Disallow estää indeksin

Sivu voi silti näkyä Googlella, jos Google löytää siihen linkin.

❌ 4. Liian monimutkainen robots.txt

Keep it simple.

Yhteenveto

Robots.txt:

  • ohjaa hakukonerobottien toimintaa
  • säätelee, mitä sivuja Google saa crawlata
  • ei estä sivua näkymästä Googlessa (vain crawlata)
  • auttaa kohdistamaan crawl budjetin tärkeisiin sivuihin
    Hyvin tehty robots.txt:
  • tukee SEO-strategiaa
  • vähentää päällekkäistä sisältöä
  • varmistaa tärkeiden sivujen indeksoinnin
    Väärin tehty robots.txt voi estää koko sivuston näkymisen.

Ota seuraava askel liidikoneiston käynnistämiseksi – Valitse yhteydenottotapa

Soita meille Jätä soittopyyntö Varaa aika kalenterista