Co v článku najdete
- Proč by vás to mělo zajímat
- Jeden den robotického provozu na konkrétním webu
- Články ho nezajímaly, ptal se na SSH klíče
- Skutečného bota není snadné ověřit
- Bezpečnostní systém vůbec nezaznamenal problém
- Dvě z těchto cest jsou zcela nové
- Cloudflare publikoval opravu
- Vytvořit problém, propagovat ho a pak nabízet řešení
- Podívejte se na svoje protokoly
- Často kladené otázky (FAQ)
Finanční ředitel společnosti Cloudflare Thomas Seifert prohlásil, že za pět let bude robotická návštěvnost webových stránek až 1000× větší než ta lidská a člověk se na internetu stane pouhou "zaokrouhlovací chybou". Co to znamená pro majitele a provozovatele webů a jak byste se měli na ofenzivu strojů připravit?
Proč by vás to mělo zajímat
Společnost Cloudflare, která je jednou z největších světových síťových a bezpečnostních služeb, dříve očekávala, že strojový provoz překročí ten lidský v roce 2027. Jenže k tomu došlo už v květnu 2026. Přitom nedochází k poklesu lidské návštěvnosti, ale k extrémně rychlému nárůstu té nelidské.
Dosavadní odhady expertů výrazně podcenily realitu, což představuje ten nejvýznamnější argument, proč brát tyto prognózy vážně. Samotné základní měření vycházející ze skutečnosti ukazuje, že už méně než polovina všech požadavků na HTML stránky dnes pochází od reálných lidí. Strojoví návštěvníci jsou realitou, ovšem otázkou zůstává, co přesně zmíněný údaj (1000 : 1) vlastně počítá.
Jeden den robotického provozu na konkrétním webu
Slobodan Manić, zakladatel společnosti No Hacks zaměřené na optimalizaci webových stránek pro stroje, provedl experiment na svém vlastním webu nohacks.co. Od Cloudflare si stáhl podrobný přehled AI robotů, kteří navštívili tento web během 24 hodin, konkrétně od 6. do 7. srpna večer.
- „Za tento jediný den dorazilo přibližně 3 000 požadavků, z nichž zhruba třetina skončila chybou. To představuje masivní nárůst o více než 1 000 % oproti předchozímu období,“ uvádí Slobodan Manić.
Přehled návštěvnosti podle jednotlivých botů:
- CCBot: 1 510 požadavků
- ChatGPT (uživatelské přihlášení): 375 požadavků
- ClaudeBot: 296 požadavků
- Googlebot: 245 požadavků
- PetalBot: 107 požadavků
- Třináct dalších botů: 353 požadavků.
CCBot, který web navštívil nejvíckrát, je hlavním crawlerem platformy Common Crawl. Jedná se dlouhodobě fungující neziskový webový archiv, z jehož obří databáze čerpá a trénuje významná část velkých jazykových modelů (LLM), o kterých dnes celý svět diskutuje. Z čistě teoretického pohledu tedy fakt, že právě tento bot byl vůbec nejaktivnějším návštěvníkem, nepředstavuje nic zvláštního. Jenže pak si Slobodan vyexportoval konkrétní navštívené adresy a cesty na webu.
Články ho nezajímaly, ptal se na SSH klíče
Nejžádanější cesty v provozu z AI crawleru s přesnými počty požadavků tak, jak vypadaly v exportu:
- /.ssh/known_hosts (42 požadavků)
- /phpinfo.php (31 požadavků)
- /.boto (30 požadavků)
- /.env.production (29 požadavků)
- /.vscode/launch.json (28 požadavků)
- /.env.test (27 požadavků)
- /firebase-service-account.json (26 požadavků)
- /.gitconfig (24 požadavků)
- /server/.env (24 požadavků)
To pokračovalo pro stovku dalších různých cest: /.id_rsa, /.id_ecdsa, /private-key, /ssl/localhost.key, /key.json, /serviceAccountKey.json, /.aws/config, /actuator/configprops, /api/v1/env, /Dockerfile, /values.yaml a /@fs/proc/self/environ, což představuje pokus o neoprávněný přístup k adresářové struktuře serveru.
- „Napříč těmito stovkami cest proběhlo 1 028 požadavků s přenosem 6,7 MB dat a nula doporučeními. Počet požadavků na cokoliv, co jsem skutečně napsal, se zaokrouhluje na čistou nulu. Nejblíže k mému obsahu se robot dostal u adresy /blog/wp-login.php, což byl pokus o přihlášení do WordPressu zaměřený na web, který WordPress nikdy nepoužíval, a u dvou požadavků na /blog/null,“ upozorňuje Slobodan Manić.
Podle něj má právě tento poslední detail daleko větší význam, než by se na první pohled mohlo zdát. Protože ať už je ten automat cokoliv, nečte si vaše stránky předtím, než položí dotaz. Pouze proklikává seznam, a to přesně ten stejný seznam, který prochází všude možně, a váš web pro něj představuje jen jediný řádek ve smyčce: „Jedná se o klasický skener přístupových údajů. Common Crawl sice sleduje odkazy a stahuje stránky, ale nemá jediný důvod požadovat po webu zaměřeném na podcasty klíč k účtu služby Firebase.“
Skutečného bota není snadné ověřit
Slobodan Manić nemohl ověřit zdrojové IP adresy, aby prokázal zosobnění bota, kvůli tomu, že detailní IP data pro jednotlivé požadavky nebyla v jeho cenovém tarifu k dispozici. Common Crawl nabízí jen jednoduchý test, protože reálný provoz bota CCBot pochází ze zdokumentovaných adresních rozsahů a při zpětném převodu se mění na doménová jména končící na crawl.commoncrawl.org. Cokoliv z toho by však někdo s přístupem k serverovým logům ověřil během minuty.
- „Co však mohu jasně popsat, je to, co na web reálně dorazilo, co robot požadoval a jak byl označen: AI přehled v rozhraní Cloudflare připisuje tyto požadavky právě projektu Common Crawl jako jeho provozovateli a započítává každý jednotlivý požadavek do celkového součtu mé robotické návštěvnosti,“ říká Manić.
Bezpečnostní systém vůbec nezaznamenal problém
A to je věc, která zakladatele No Hacks znepokojuje nejvíc. Když totiž tyto požadavky hledal v přehledu bezpečnostních událostí na jeho serveru, nenašel absolutně nic. Bezpečnostní protokol zaznamenává pouze takové požadavky, které přímo poruší nastavené pravidlo.
- „A jelikož tuto komunikaci nijak neblokuji, požadavek projde, server ho obslouží a nezanechá po sobě žádnou bezpečnostní stopu. Objevuje se tak na jediném konkrétním místě v celém mém ovládacím panelu, a to v přehledu AI crawlerů pod hlavičkou neziskového výzkumného archivu, hned vedle oficiálních botů ChatGPT-User či Googlebot,“ popisuje Slobodan Manić.
Skener přihlašovacích údajů byl dokonale čitelný jako provoz automatického agenta, ale jako bezpečnostní hrozba zůstal úplně neviditelný. Oficiální CCBot samozřejmě SSH klíče nehledá. Data ale ukázala, že se za tuto známou identitu schovával útočný skener, který Cloudflare nesprávně započítal pod důvěryhodného bota.
Dvě z těchto cest jsou zcela nové
V celém Manićově seznamu jsou schované adresy /.mcp.json (požadovaná 30×) a /.continue/config.json (požadovaná 24×).
Oba tyto soubory představují konfigurační podklady pro autonomní AI agenty a vývojářské nástroje. První definuje nastavení MCP serveru (Model Context Protocol) a druhý obsahuje nastavení asistentů pro kódování. Obvykle v sobě nesou privátní API klíče a přístupové tokeny, to proto, že je do nich vývojáři často vkládají a při neopatrném nasazení webu je omylem nahrají přímo na veřejný server.
- „Někdo očividně přidal tyto přístupové údaje agentů do standardního seznamu pro automatizované skenování hesel. Přesně ten samý skript, který se na každém webu na internetu už odpradávna vyptává na soubor /.env, dnes požaduje i soubory říkající, jaké nástroje mohou vaši agenti volat a jakými klíči se ověřují. Nikdo o tom nedal vědět a celé se to seběhlo extrémně rychle. Pokud dnes provozujete cokoliv "agentního", tento aktualizovaný skenovací seznam k vám dorazil dříve, než většina lidí stihla dopsat kód pro svůj první MCP server,” vysvětluje Manić.
Cloudflare publikoval opravu
Tu nejvýznamnější protiváhu k tvrzením postaveným na přehnaných prognózách přitom nabízí technický článek od samotného Cloudflare. Text je zaměřený na internet plný AI agentů a uvádí, že obrovská část provozu od korektně fungujících botů pouze opakovaně stahuje stránky, na kterých se nic nezměnilo. Výsledkem jsou miliardy zbytečných serverových požadavků, a jak článek říká, jde o obrovské množství robotického úsilí, které nepřináší vůbec žádný výsledek.
Jenže samotná aktivita robotů a skutečný přínos představují dvě úplně odlišné věci. Manićova vlastní data tento problém ukazují v ještě ostřejším světle: Vůbec největší generátor jeho robotického provozu nebyl jen neužitečný, ale byl přímo nepřátelský. A přesto se započítal do celkových čísel.
Crawler od společnosti Meta vám prochází stránky, aniž by vám zpátky přivedl jediného návštěvníka. Z pohledu majitele webu jde o ukázkový příklad zbytečného provozu. Bezpečnostní skener maskovaný za vyhledávacího bota, který vám na serveru slídí po cloudových přístupových údajích, se nachází ještě o úroveň níž. V grafech a statistikách ale obě tyto kategorie končí v jednom a tomtéž sloupci. Takže když křivka grafu stoupá, můžete se jen ptát, co z toho je skutečná návštěvnost.
Vytvořit problém, propagovat ho a pak nabízet řešení
Podle Slobodana Maniće je naprosto jasné, jakou strategii Cloudflare razí, a sluší se na to otevřeně upozornit. Jde o to, že firma "vymyslí" problém, dá o něm všem vědět a následně začne prodávat řešení.
- „Podívejte se jenom na první srpnový týden. Varovné prognózy o nárůstu botů během konferenčního hovoru pro investory, blogový článek vyčíslující, jak obří část internetu už netvoří lidi, bezpečnostní skener připravenosti na AI agenty (který vám pochopitelně oznámí, že připraveni nejste), nový AI produkt pro získání přehledu, nástroj pro zpřístupnění vašich webových funkcí agentům a k tomu výchozí nastavení, které začne část těchto robotů od září automaticky blokovat, pokud se nerozhodnete jinak,“ vypočítává autor metodiky pro tvorbu webových stránek, které fungují v první řadě pro stroje, ale vždycky také pro lidi.
Každý z těchto produktů představuje rozumnou reakci na reálnou hrozbu, což dělá z celé strategie funkční koncept, který nelze jen tak ignorovat. Firma, která problém měří, sama vysvětluje jeho interpretaci a zároveň prodává řešení, je jedna a ta samá společnost. To znamená, že ovládá jak samotný "měřák", tak i "ventil".
Slobodan však nechce hned kritizovat a vyvolávat rozepře, protože v minulosti podpořil celou řadu řešení od Cloudflare, jako je zpoplatnění dat pro crawlery, iniciativa Den nezávislosti obsahu nebo možnost volby majitelů, které stroje na svůj web pustí. Cloudflare dokáže dělat skvělé věci se správným směřováním i takové, které působí přinejmenším pochybně, což je stejné i u většiny ostatních firem na trhu. Největší chybou by proto bylo nálepkovat někoho jako toho hodného, nebo naopak toho zlého, a podle toho pak nekriticky posuzovat každý jeho krok.
Podívejte se na svoje protokoly
Berte čísla návštěvnosti vážně, ale k jejich interpretaci přistupujte s patřičným odstupem. Většinu požadavků dnes skutečně tvoří stroje, což je naměřený a nezpochybnitelný fakt. Proto si otevřete své analytické nástroje zaměřené na webové crawlery a čtěte konkrétní cesty, ne jenom celkové součty.
Slobodan odhalil tři věci, o kterých neměl ani tušení:
- Největší AI crawler je ve skutečnosti skener.
- Bezúčelně spaluje megabajty šířky pásma.
- Seznam adres, se kterými pracuje, obsahuje konfigurační soubory, ve kterých podle jeho předpokladů sídlí nástroje pro vlastní AI agenty.
Žádný z těchto detailů v populárních prognózách nenajdete. Samotný objem ano. Patnáct set takových požadavků dorazilo na jeden malý web za jediný den a každý z nich se započítal do poměru tisíc ku jedné, který popisoval Thomas Seifert z Cloudflare. Jenže ani jeden jediný z těchto požadavků nechtěl nic z toho, co Manić skutečně napsal a publikoval na svém webu. Co tedy stroje vlastně chtějí?
Často kladené otázky (FAQ)
Je nutné kvůli nárůstu AI botů začít blokovat veškerou strojovou návštěvnost?
Určitě ne, plošné blokování by vám uškodilo. Klíčové je, abyste rozlišovali mezi užitečnými roboty, jako jsou třeba běžní vyhledávací boti, zbytečným balastem spalujícím výkon a skutečnými bezpečnostními skenery, které se za oficiální boty jen schovávají.
Jak poznat, že přes server prochází útočný skener maskovaný za AI bota?
V běžných souhrnných statistikách to neuvidíte, protože návštěvy se započítají do celkového objemu daného crawlera. Musíte nahlédnout přímo do serverových logů a sledovat konkrétní požadované cesty. Jakmile se bot dotazuje na SSH klíče, soubory .env nebo konfigurační skripty agentů, jde o skener.
Proč bezpečnostní systémy na webu útočné boty často vůbec nezaznamenají?
Většina bezpečnostních protokolů zaznamenává pouze požadavky, které přímo poruší nastavené blokovací pravidlo. Jestliže nemáte přístup k těmto citlivým cestám explicitně zablokovaný nebo hlídaný, server požadavek v tichosti obslouží (případně vrátí chybu 404) a bezpečnostní systém událost vyhodnotí jako běžný provoz.
Zdroj: searchengineland.com, searchenginejournal.com, marketingland.com, facebook.com, cpcstrategy.com
Autor: Martin Kulhánek
Foto zdroj: AI, pixabay.com