Robots.txt on pieni mutta tärkeä tiedosto, joka kertoo hakukoneroboteille, mitä sivuja niiden tulisi tai ei tulisi käydä läpi. Oikein käytettynä se parantaa hakukonenäkyvyyttä, mutta väärin käytettynä se voi estää koko sivuston näkymisen Googlelle.
1. Mikä robots.txt on?
Robots.txt on tekstitiedosto, joka sijaitsee verkkosivuston juurihakemistossa:
https://www.yritys.fi/robots.txt
Sen tehtävä on kertoa hakukoneroboteille:
- mitä sivuja saa indeksoida
- mitä sivuja ei saa indeksoida
- miten robotin tulisi liikkua sivustolla
Robots.txt ei ohjaa käyttäjiä — vain hakukoneita.
2. Miten robots.txt toimii käytännössä?
Kun Googlebot saapuu sivustollesi, se tarkistaa ensimmäisenä robots.txt-tiedoston.
Tiedosto sisältää komentoja, kuten:
User-agent: *
Disallow: /admin/
Allow: /
Tämä tarkoittaa:
- kaikki robotit (*)
- eivät saa indeksoida
/admin/
- mutta voivat indeksoida kaiken muun
3. Mitä robots.txt EI tee?
On tärkeä ymmärtää, mitä robots.txt ei tee:
❌ Ei estä sivua näkymästä Googlessa, jos muu sivu linkittää siihen
❌ Ei suojaa yksityisiä sivuja
❌ Ei estä sivun URLia näkymästä hakutuloksissa
❌ Ei poista sivuja indeksistä
Se vain kertoo, mitä robotit saavat crawlata.
Jos haluat estää sivun näkymisen Googlessa, käytä:
<meta name="robots" content="noindex">
4. Yleisimpiä robots.txt-esimerkkejä
1. Perus, kaikille sallittu robots.txt
User-agent: *
Disallow:
Kaikki robotit saavat indeksoida kaiken.
2. Estetään hallintasivu
User-agent: *
Disallow: /admin/
Disallow: /login/
3. Estetään tietyt tiedostomuodot
User-agent: *
Disallow: /*.pdf$
Disallow: /*.xls$
4. Estetään koko sivusto (VAARALLINEN)
User-agent: *
Disallow: /
Tämä estää indeksoinnin kokonaan — yleinen vahinkojen aiheuttaja.
5. Robots.txt ja SEO
Robots.txt vaikuttaa:
- crawl budjettiin
- sivujen löydettävyyteen
- siihen, mitä Google käy läpi
- siihen, mitkä sivut Google näkee tärkeinä
Jos Google käyttää aikaa turhiin sivuihin kuten:
- suodatussivut
- tagisivut
- hakusivut
se ei ehdi indeksoida tärkeitä sisältöjä.
Siksi robots.txt auttaa ohjaamaan indeksointia oikein.
6. Mitkä sivut kannattaa estää robots.txt:llä?
Useimmilla sivustoilla kannattaa estää:
- /cart/
- /checkout/
- /login/
- /admin/
- /wp-admin/ (WordPress)
- filtteröidyt tuotelistaukset
- sisäiset haku-sivut (/?s=...)
- testisivut
- kehitysympäristön sivut
Tämä vapauttaa Googlelle aikaa oikeille sisältösivuille.
7. Mitä sivuja EI saa estää robots.txt:llä?
Älä estä:
- palvelusivuja
- laskeutumissivuja
- blogeja
- kategorioita
- tuotesivuja
- tärkeää sisältöä
Jos Google ei pääse crawlamaan sivua, se ei myöskään pysty ymmärtämään sitä.
8. Robots.txt ja sivukartta (sitemap)
Tärkeä lisäys robots.txt-tiedostoon on:
Sitemap: https://www.yritys.fi/sitemap.xml
Tämä kertoo Googlelle, mistä se löytää kaikki tärkeät sivut.
9. Yleisimmät virheet robots.txt-tiedostossa
❌ 1. Koko sivuston estäminen vahingossa
Yleinen virhe kehitysympäristöistä.
❌ 2. Tärkeiden sivujen estäminen
Palvelusivuja ei pidä estää — se tappaa näkyvyyden.
❌ 3. Luullaan, että Disallow estää indeksin
Sivu voi silti näkyä Googlella, jos Google löytää siihen linkin.
❌ 4. Liian monimutkainen robots.txt
Keep it simple.
Yhteenveto
Robots.txt:
- ohjaa hakukonerobottien toimintaa
- säätelee, mitä sivuja Google saa crawlata
- ei estä sivua näkymästä Googlessa (vain crawlata)
- auttaa kohdistamaan crawl budjetin tärkeisiin sivuihin
Hyvin tehty robots.txt:
- tukee SEO-strategiaa
- vähentää päällekkäistä sisältöä
- varmistaa tärkeiden sivujen indeksoinnin
Väärin tehty robots.txt voi estää koko sivuston näkymisen.