Kort svar: Tre ting afgør det: om robots.txt giver tjenestens søge-agent adgang, om indholdet står i serverens HTML eller først bygges i browseren, og om siden ligger bag et login eller en betalingsmur. Fejler bare én af de tre, findes indholdet reelt ikke for tjenesten, uanset hvor godt det er skrevet.

Hvad kan det skyldes?

robots.txt lukker søge-agenten ude

En bred regel mod alle bots rammer også de agenter, der henter kilder til svar. Trænings-crawlere og søge-agenter er ikke det samme, og en samlet blokering skelner ikke.

Indholdet bygges først i browseren

Er teksten hentet med JavaScript efter sideindlæsningen, står der næsten ingenting i den HTML, en crawler får. Det rammer især enkeltsideapplikationer og indhold i faner og harmonikaer.

Siden kræver login eller samtykke først

Indhold bag et login, en betalingsmur eller en aldersport bliver ikke hentet. Det samme gælder indhold, der først vises, når et cookiebanner er besvaret.

Sådan finder du ud af det

  1. Se jeres robots.txt igennem, og tag stilling til hver enkelt agent.
  2. Hent jeres egen side uden JavaScript, og se hvad der faktisk står i svaret.
  3. Kontrollér, at det vigtigste indhold ikke ligger bag en interaktion.
  4. Sørg for, at siden må indekseres og levere et uddrag.

Det kan hverken vi eller et tjek afgøre

  • At en tjeneste kan læse siden, betyder ikke, at den vælger den som kilde. Det er to forskellige spørgsmål.
  • Tjenesternes crawlere og deres navne ændrer sig, og adfærden er ikke fuldt dokumenteret.
  • Ahorizon måler observerbare forudsætninger. Ingen kan måle udefra, hvad en model faktisk har læst.

Kontrollerne bag svaret