Dit website kan være fuldt synligt i Google og samtidig helt fraværende hos enhver AI-assistent. Reglerne matches pr. crawler, og næsten ingen har læst deres egne.

Næsten alle med det her problem har fået det ved et uheld. Ingen har sat sig ned og besluttet at blive udelukket fra AI-søgning. Nogen installerede et sikkerhedsplugin med en "bloker aggressive bots"-indstilling, eller indsatte et robots.txt-uddrag fra en forumtråd under et scraping-angreb, eller tilføjede en firewall-regel klokken tre om natten for at stoppe en trafikspids. Reglen blev stående. Google kørte videre, så intet så forkert ud.

Hvordan ved jeg om mit website blokerer AI-crawlere?

Åbn din egen robots.txt på ditdomæne.dk/robots.txt og læs den regel for regel, og hold hver User-agent-blok op mod de crawler-tokens AI-udbyderne offentliggør. En regel gælder kun de user agents den nævner, så et website kan tillade Googlebot og blokere GPTBot i samme fil uden nogen advarsel. Det er tiden værd at læse filen igennem én gang, men reglerne skrider, og derfor bør tjekket gentages med jævne mellemrum.

To detaljer driller, første gang man læser filen. Den ene er, at en User-agent: *-blok er en reserveregel og ikke en global regel: har en crawler sin egen navngivne blok et sted i filen, gælder wildcard-blokken slet ikke for den. Den anden er, at den mest restriktivt udseende linje ikke nødvendigvis er den gældende — der matches på den mest specifikke user agent-blok, ikke på hvilken regel der står sidst.

Derfor er "vi tillader alt" en både udbredt og upålidelig overbevisning. Den bygger næsten altid på wildcard-blokken, som er præcis den blok en navngiven crawler ser bort fra.

Hvad er forskellen på GPTBot og OAI-SearchBot?

Begge er OpenAI, og de laver forskelligt arbejde. GPTBot indsamler sider der kan bruges som træningsdata til modellen. OAI-SearchBot opbygger søgeindekset bag ChatGPT, og ChatGPT-User henter en side live, når nogen stiller et spørgsmål der kræver det. Blokerer du GPTBot, holder du dig ude af træningen og forbliver citerbar; blokerer du OAI-SearchBot og ChatGPT-User, ryger du ud af svarene.

Alle de store udbydere har den samme opdeling, og navngivningen hjælper dig næsten ikke med at skelne. Anthropic bruger ClaudeBot til træning og Claude-User til live-opslag. Googles fravalg af træning hedder Google-Extended og er slet ikke en crawler — der kommer aldrig en forespørgsel med den user agent; det er et signal, som Googlebot respekterer på Geminis vegne. Apple gør det samme med Applebot og Applebot-Extended.

Konsekvensen er, at en regel skrevet ud fra et navn man halvt kan huske, er en lodtrækning. TrustCtrl vedligeholder kataloget og rapporterer hver crawler med udbyder og formål, så spørgsmålet du tager stilling til, bliver "vil vi gerne citeres af Perplexity?" i stedet for "var PerplexityBot nu den der træner?".

Bør jeg blokere AI-crawlere?

Det kommer an på hvilke, og svaret er sjældent alt eller intet. Blokerer du trænings-crawlerne, holder du dine tekster ude af træningsdata. Blokerer du retrieval-crawlerne, fjerner du dig selv fra de AI-svar der ellers ville citere dig og sende besøgende. De fleste virksomheder der tænker det igennem, ender med at tillade retrieval og tage stilling til træningen særskilt, fordi de to har modsat forretningsmæssig effekt.

Det hjælper at holde de to spørgsmål adskilt frem for at besvare det ene og gå ud fra det andet:

  • Vil vi gerne optræde i AI-svar? For næsten enhver virksomhed der sælger noget: ja. En assistent der citerer dig, gør det samme som et søgeresultat — bare med en stærkere underforstået anbefaling. Det taler for at tillade retrieval-crawlerne.
  • Har vi noget imod at vores indhold bliver træningsdata? En legitim forretningsbeslutning uden noget universelt svar. Medier og virksomheder hvis tekster er produktet, har ofte meget imod det. En webshop med produktsider sjældnere. Det er trænings-spørgsmålet, og det er et andet.
  • Prøver vi at stoppe scraping? Så er robots.txt det forkerte værktøj — se nedenfor. Rate limiting og bot management er de rigtige, og de skal sættes op, så de ikke fanger de crawlere du gerne vil citeres af.

Stopper robots.txt overhovedet AI-crawlere?

Det er en anmodning, ikke en spærring. De store udbydere oplyser at de respekterer robots.txt, og i praksis gør de kendte crawlere det. Den giver dig ingen beskyttelse mod en crawler der ignorerer filen eller kalder sig noget andet. Robots.txt er derfor det rigtige værktøj til at udtrykke et ønske over for seriøse udbydere og det forkerte til at stoppe målrettet scraping.

Blander man de to sammen, ender man med det værste fra begge. En virksomhed der er bekymret for scraping, blokerer alt i robots.txt, scraperne fortsætter uanfægtet fordi de aldrig læser filen, og de eneste der adlyder, er de assistenter som ville have sendt trafik. Sitet mister synligheden og beholder scrapingen.

Den regel der ikke står i robots.txt

Robots.txt er kun det halve billede, og den anden halvdel er sværere at få øje på. Dit website kan tillade enhver AI-crawler efter bogstavet i filen og alligevel servere dem noget ubrugeligt, fordi et lag foran sitet træffer sin egen beslutning: en bot-beskyttelsestjeneste der udsteder en JavaScript-udfordring, en CDN-regel der behandler ukendte user agents som mistænkelige, en WAF der blokerer alt uden et browser-fingeraftryk.

Set fra assistentens side er resultatet det samme som en blokering. Den beder om din artikel og modtager en "vi kontrollerer din browser"-side, så den citerer en konkurrent. Set fra din side ser intet forkert ud, for du besøger aldrig dit eget website som GPTBot.

Den eneste pålidelige måde at finde det på er at spørge som hver crawler og sammenligne. TrustCtrl kører netop det tjek — henter dine sider som hver AI-user agent og markerer hvor svaret adskiller sig væsentligt fra det en almindelig besøgende får. Den springer de rene robots.txt-signaler som Google-Extended over, fordi det hverken ville bevise det ene eller det andet at spørge med en user agent, ingen crawler nogensinde sender.

Hvad du kan gøre i denne uge

Læs din robots.txt med crawler-listen ved siden af, og tag stilling til trænings-spørgsmålet og retrieval-spørgsmålet hver for sig. Undersøg om noget foran sitet — CDN, WAF, bot-beskyttelse, sikkerhedsplugin — filtrerer på user agent, og bekræft at AI-crawlerne ligger på den tilladte side. Sørg derefter for at tjekket gentager sig, for det der ødelægger det her, er ikke den beslutning du træffer i dag. Det er den ændring om et halvt år, der intet har med sagen at gøre.

TrustCtrl rapporterer hver AI-crawler som tilladt, blokeret eller ukendt ved hver crawl, opdeler dem efter træning og retrieval og tester for svar der afhænger af user agent. Det ligger sammen med resten af tjekkene — om dit indhold overlever uden JavaScript, om dit sitemap taler sandt, hastighed, tilgængelighed og security headers — så hele billedet kommer fra ét besøg. Den overordnede strategi ligger i sådan bliver du citeret i AI-svar.