Co v článku najdete
- Tři vrstvy načítání
- Odhalení vyhledávacího systému ChatGPT
- Jak jsou rozdané karty v kanálech
- Tlačítko Myslet mění webové stránky, které ChatGPT vidí
- Webový index OpenAI funguje jinak než Bing
- Ekonomika má přednost před technologií
- Čtenářská mezipaměť sdílená všemi
- Slepé místo v analytice
- Záhada: Citace, které se objevují odnikud
- Měli byste psát nadpisy o délce 289 znaků?
- Nekonečný boj: Znáte odpovědi na skutečné otázky lidí?
- Co zůstává zahaleno tajemstvím
- Často kladené otázky (FAQ)
Když ChatGPT odkazuje na konkrétní webovou stránku, kde ji vlastně vzal? Nová studie výzkumného týmu renomované francouzské agentury Resoneo odhaluje "střeva" odpovědního systému ChatGPT počínaje tím, co přesně vyhledává a čte, až po to, co nakonec reálně sděluje lidem ve svých odpovědích.
Tři vrstvy načítání
V červenci 2026 v Resoneo zachytili a podrobně zanalyzovali 1 200 odpovědí ChatGPT, 88 000 výsledků vyhledávání a 26 900 různých webových stránek. Objevili tři základní vrstvy, na kterých ChatGPT staví svoje odpovědi:
- Vyhledávací index pro dohledání stránek.
- Čtecí mezipaměť uchovávající kompletní kopie stažených stránek.
- Malou skupinu stránek, které si AI otevírá v reálném čase.
Každá z těchto vrstev funguje podle vlastních pravidel, má odlišnou míru stárnutí dat i svá specifická slepá místa. Jakmile tyto vrstvy pochopíte, snadněji si vysvětlíte podstatnou část citačního chování ChatGPT.
Odhalení vyhledávacího systému ChatGPT
Nainstalované rozšíření pro Chrome zaznamenávalo čistý datový stream posílaný z ChatGPT do prohlížeče, včetně políček, která běžné uživatelské rozhraní vůbec nezobrazuje. Až do 21. července tento stream obsahoval pole nazvané result_source. To přesně pojmenovávalo interní kanál, ze kterého pocházel každý jednotlivý výsledek vyhledávání.
V datech se neustále dokola vracely čtyři hodnoty: labrador, bright, oxylabs a serp. Žádnou z nich přitom společnost OpenAI nikde oficiálně nedokumentuje a veřejně mluví výhradně o poskytovatelích vyhledávání třetích stran.
Jenže ze dne na den toto pole ze streamu úplně zmizelo. Stalo se to přes noc a na všech účtech, které výzkumníci sledovali. Dnes už každý kanál identifikují podle jeho specifických formátovacích znaků (jako je délka úryvku nebo struktura titulku) pomocí klasifikátoru, který se trefuje s přesností na 98 %. Verze V5 zmíněného rozšíření už má tento klasifikátor zabudovaný přímo v sobě.
- „Abychom nespoléhali jen na dohady a viděli přesně, co roboti od OpenAI reálně načítají, nasadili jsme také celou flotilu testovacích účtů napříč různými tarify i zeměmi. Přes API od OpenAI jsme na nich spouštěli identické dotazy a na vlastní doméně jsme publikovali takzvané kanárkové stránky (canary pages) s detailním logováním serveru,“ přibližuje zákulisí experimentu spoluzakladatel Resoneo Olivier de Segonzac.
Jak jsou rozdané karty v kanálech
Co si výzkumníci ujasnili už před touto fází výzkumu a co pořád platí:
- Labrador představuje vlastní vyhledávací uzel přímo od OpenAI. Vedle klasického webu prohledává zprávy, akademické práce (arXiv), Reddit i YouTube. Funguje tak jako hlavní dirigent interních indexů, otevřených databází typu Wikipedie a partnerských mediálních domů.
- Bright a Oxylabs zastupují v reálném čase nakupované výsledky z Google přes SERP API.
- Kanály P1/P2/P3 obsluhují nákupy z vlastních e-commerce zdrojů OpenAI, přičemž Google jim slouží primárně jako referenční zdroj pro porovnání cen a recenzí.
- B1/B3, Yelp a TripAdvisor servírují lokální výsledky, ale s jedním zajímavým háčkem: Odkazy, které se nakonec zobrazí lidem v rozhraní, směřují přímo na Google Mapy.
Nákupy i lokální vyhledávání se přitom s klasickým webovým vyhledáváním vůbec nepotkají. To znamená, že když prodáváte fyzické zboží nebo provozujete restauraci, váš hlavní boj se odehrává v obchodních kanálech a firemních zápisech, nikoliv v klasických citačních zdrojích. Ta největší překvapení však na inženýry čekala především ve webovém vyhledávání.
Tlačítko Myslet mění webové stránky, které ChatGPT vidí
Šest týdnů po červencové studii experti znovu spustili identické dotazy napříč všemi konfiguracemi ChatGPT, tedy v bezplatných i placených verzích, v režimech Instant, Think a Thinking a s různě nastavenou úrovní náročnosti (effort). Až do tohoto testu běžel režim Thinking výhradně jako placená služba. Uživatelé bezplatné verze mají na výběr v podstatě jen ze dvou režimů vyhledávání: Instant a Think. Prvním velkým překvapením je zjištění, že objem vyhledávaných zdrojů a jejich původy představují dvě úplně odlišné věci.
U bezplatného účtu kliknutí na tlačítko Think více než zdvojnásobí počet prohledávaných adres, konkrétně z 15,1 na 35,3 URL na konverzaci a z 9,8 na 16,3 různých domén. Bezplatný režim Think tak získává téměř stejný objem zdrojů jako placený Thinking při středním nastavení náročnosti.
Jenže tyto dva režimy neprohledávají ten stejný web. Think tahá 74,7 % výsledků z vlastního indexu OpenAI labrador, pouhá 3,1 % ze živého SERP scraperu pro Google a 22,2 % ze zdroje oxylabs, který krmí jeho zpravodajský kanál. Placený režim Thinking funguje jako téměř dokonalé zrcadlo: 75,3 % výsledků bere ze scraperu pro Google a 24,7 % z rejstříků labrador.
Tento rozdíl hraje zásadní roli pro viditelnost v AI vyhledávání (GEO/AEO). Dva lidé mohou zadat navlas stejný dotaz, načíst zhruba stejné množství zdrojů, a přesto dostanou odpovědi poskládané z úplně jiných databází. Dobré pozice v klasickém vyhledávači Google tak sice zůstávají klíčové pro placený vyhledávací režim Thinking, ale ještě vám nezaručí, že se vaše stránka dostane do výběru v bezplatném režimu Think, kde jako hlavní strážce vstupu funguje vlastní index OpenAI.
Placený režim Thinking navíc mezi červencem a srpnem výrazně zeštíhlel. U stejných zadání se střední náročností klesl počet prohledávaných adres z 3,56 na 1,90 na konverzaci, celkový počet URL ze 47,2 na 33,9 a počet odlišných domén z 21,9 na 15,5. Při pokročilém nastavení náročnosti padala čísla ještě výrazněji: z 67 URL se stalo 40,5 a z 29,5 domén zbylo 14,7. Serverové logy výzkumníků z Resoneo datují tento zlom mezi 26. a 31. červenec, tedy ještě před oficiální aktualizací modelu OpenAI z 6. srpna.
Bezplatný režim Instant sice nevykázal žádnou měřitelnou změnu v objemu vyhledávání, ale chování v jeho okolí se změnilo zásadně: Uvažování (reasoning) se objevilo u 96,7 % srpnových odpovědí oproti pouhým 0,6 % v červenci a výrazně se přerozdělil i mix nabízených produktů v nákupním kanálu.
Samotné vyhledávací dotazy se zároveň posunuly výrazně navigačním směrem. Vyhledávací parametr site: se dnes objevuje v 3,5 % bezplatných dotazů v režimu Instant, v 10,8 % bezplatných dotazů v Think, ve 41,9 % placených dotazů v Thinking se střední náročností a v 58,1 % dotazů s vysokou náročností.
Při vysoké náročnosti vzrostlo využití parametru site: ze 40,8 % na konci července na 58,1 % v polovině srpna, a to i přesto, že celkový počet dotazů klesl. ChatGPT vyhledává méně doširoka a častěji si chodí najisto přímo pro domény, značky a oficiální zdroje, u kterých už dopředu očekává reálný přínos.
Varování pro každého, kdo dělá benchmarking přes API: API neodpovídá reálnému chování aplikace. Výzkumný tým přehrál identická zadání napříč čtyřmi produktovými režimy ChatGPT a čtyřmi modely v API a následně pomocí Jaccardova indexu podobnosti změřil překrývání značek zmíněných v odpovědích.
Jednotlivé varianty v API se vzájemně překrývají v poměru 0,32 až 0,39, režimy v ChatGPT v poměru 0,25 až 0,37, ale podobnost mezi chováním aplikace a API klesá na pouhých 0,23 až 0,27. API vám sice dobře ukáže, co konkrétní rodina modelů o vaší značce ví, ale rozhodně podle něj nepředpovíte reálnou odpověď v rozhraní ChatGPT.
Dokonce i dva různé režimy přímo v ChatGPT sdílejí jen asi třetinu značek, které ve výstupech zmíní. Je to tím, že se liší jejich vyhledávací databáze, dostupné nástroje, systémové instrukce i samotný výpočetní výkon. Nejvíc se přibližují dvojice podle oficiálního interního mapování OpenAI: Bezplatný Think má nejblíže k vlastnímu modelu Luna a placený ChatGPT k modelu Sol. Názvy těchto modelů se však v běžném uživatelském rozhraní ChatGPT nikde nezobrazují.
Webový index OpenAI funguje jinak než Bing
OpenAI spoléhá na svůj vlastní webový index a Bing mu podklady neposkytuje. Výzkum to ověřil hned třemi různými způsoby:
- V první dvacítce výsledků na Bingu se pro stejný vyhledávací dotaz objevuje pouhých 1,5 % identických URL adres, jaké vrací index labrador.
- Žádný úryvek (snippet) z kanálu labrador neodpovídá úryvku z Bingu. Bing navíc u nadpisů striktně drží pevný limit 75 znaků, zatímco 24 % nadpisů v indexu labrador tuto hranici překračuje. Nejdelší zachycený nadpis měl dokonce 289 znaků.
- Tento index obsluhuje v podstatě veškeré citace z vyhledávání v režimu Instant, tedy v rychlém režimu, který mají k dispozici uživatelé bezplatné verze. Výjimku tvoří pouze dotazy vyžadující téměř reálná data v čase (Kdo vyhrál včerejší zápas?), kde se o slovo dělí půl na půl s výsledky z Google.
Výsledek načtený z indexu OpenAI obsahuje pouze tři věci:
- URL adresu.
- Celý název stránky, který nikdy není zkrácený, i kdyby byl absurdně dlouhý.
- Úryvek (snippet) o délce přibližně 200 znaků.
Skladba tohoto úryvku si zaslouží detailnější pohled, protože představuje ten jediný text z vaší stránky, který se do modelu v režimu Instant opravdu dostane. Bývá ukotvený v nadpisu H1 (vykresleném velkými písmeny) a nasává veškerý viditelný text, který se nachází bezprostředně kolem něj.
Do výběru se tak mohou dostat i věci, které byste tam sami zrovna mít nechtěli:
- Název kategorie umístěný nad hlavním nadpisem.
- Alternativní text (alt text) obrázku pod nadpisem.
- Jméno autora.
- Datum publikace.
- Prvky z obsahu článku.
- „Naměřili jsme i případ, kdy úryvek tvořila ze 100 % jen tato omáčka kolem a ze samotného obsahu článku v něm nebylo vůbec nic. Zobrazí se zkrátka pouze to, co se vejde do zmiňovaných 200 znaků, a nic dalšího. Klasické meta popisky (description) tento systém absolutně ignoruje. A je tu ještě jedna klíčová věc: Vůbec nezáleží na konkrétním dotazu. Stejná URL adresa vrací pořád ten samý zmrazený úryvek, ať už se uživatel ptá na cenu, historii nebo vedlejší účinky. Text se ořízne jednorázově při indexaci a v této podobě se servíruje až do dalšího přeprocházení webu botem,“ upozorňuje Olivier de Segonzac.
Pohledem moderních vyhledávacích standardů jde o poměrně primitivní řešení. Úryvky nezávislé na zadaném dotazu představují koncept, který klasické webové vyhledávače opustily tak před dvaceti lety. A přesto tu v roce 2026 máme systém, který na takovém principu funguje a pohání jednoho z nejpoužívanějších AI asistentů na světě.
Odborníci předpokládají, že jde jen o dočasné řešení, které OpenAI v brzké době vylepší, ovšem pro tuto chvíli se jedná přesně o ten podklad, podle kterého AI váš obsah posuzuje.
Pro srovnání: Výsledky ze zdroje bright se chovají úplně stejně jako klasický Google. Nadpisy zkracují na přibližně 60 znaků a ukončují trojtečkou, úryvkům dávají kolem 160 znaků a meta popisek použijí zhruba v jednom z tří případů. Váš popisek tak sice pro index labrador neznamená vůbec nic, ale v kanálech napojených na Google pořád spolehlivě funguje.
Ekonomika má přednost před technologií
Proč si OpenAI udržuje oba přístupy naráz? Odpověď je schovaná v nákladech. V režimu Instant musí ChatGPT odpovědět během několika málo vteřin a uživatel za to většinou neplatí ani korunu. Systém se proto ptá výhradně databáze, kterou už OpenAI sama vlastní, to znamená uzlu labrador. Žádná webová stránka se přitom neotevírá naživo (během výzkumu neotevřel bot v 93 % odpovědí v režimu Instant ani jednu URL). Výsledná odpověď tak stojí čistě na nadpisech a úryvcích textu o 200 znacích. To je vše.
V režimu Thinking už uživatel investuje do předplatného a je ochotný si na odpověď chvilku počkat. Teprve tady se zapínají drahé nástroje, tedy stahování pozic z Google přes bright (75 % výsledků vyhledávání v tomto režimu) a otevírání reálných webových stránek robotem ChatGPT-User. Bot projde cca 100 výsledků napříč zhruba 28 doménami oproti pouhým 11 výsledkům v režimu Instant.
Cokoliv, co stojí peníze (platby dodavatelům za scraping) nebo čas (otevírání URL adres, volání živých API), si OpenAI šetří výhradně pro režim, ve kterém uživatelé platí a čekají. V tomto faktu spočívá zásadní komerční poznatek: Více než 90 % uživatelů ChatGPT "jede" na bezplatné verzi.
Bezplatná verze znamená režim Instant a režim Instant znamená labrador. Kanál, o kterém ještě před půl rokem nikdo neměl ani tušení, dnes rozhoduje o viditelnosti značek v drtivé většině konverzací, které v ChatGPT právě v tuto chvíli probíhají.
Čísla tuto situaci dokumentují naprosto přesně:
- V celém vzorku sledovaném týmem Resoneo se v postranním panelu zdrojů objevilo 61 332 URL adres.
- Z nich se 5 032 dostalo do pozice hlavního citovaného zdroje.
- Naživo bot otevřel pouhých 759 stránek a bez výjimky šlo o konverzace v režimu Think/Thinking.
- Pokud AI stránku opravdu otevře, cituje ji v 74 % případů.
- Stránku, kterou si pouze načetla v indexu, ale nikdy ji naživo neotevřela, zmíní jen v 7 % případů.
Čtenářská mezipaměť sdílená všemi
Po konzultaci s Jérôme Salomonem z přední podnikové platformy pro technické SEO a datovou analýzu webů Oncrawl výzkumníci zásadně změnili svůj pohled na to, co vlastně znamená, že ChatGPT navštívil mou stránku.
Ruku v ruce s vyhledávacím indexem si ChatGPT udržuje mezipaměť každé webové stránky, kterou kdy načetl. A nejde o žádné krátké výtažky. V databázi končí kompletní stránky, převedené z HTML do formátu Markdown. Tato mezipaměť je klíčovaná podle URL adresy a sdílejí ji mezi sebou všichni uživatelé bez ohledu na tarif. Pokud se bezplatný uživatel v Brně zeptá na stránku, jejíž stažení minulý týden spustil platící uživatel v Chicagu, dostane Brňák přesnou kopii z Chicaga.
Logika obnovování dat staví na principu, kterému vývojáři říkají stale-while-revalidate (servíruj staré, zatímco na pozadí ověřuješ čerstvost). Stažená kopie se považuje za čerstvou po dobu přibližně 30 minut. Během tohoto okna dostávají všichni uloženou verzi a váš server zaznamená přesně nula požadavků.
Po uplynutí půlhodiny dostane první uživatel ještě starou kopii, zatímco na pozadí se spustí požadavek, který ji obnoví až pro toho následujícího v pořadí. Plán opětovného procházení vašich stránek se tak řídí podle jednoho jediného signálu: Jak často se na ně uživatelé ChatGPT ptají. Populární stránky zůstávají čerstvé. Na ty nepopulární bude donekonečna "sedat prach".
Jérôme Salomon zdokumentoval doručení kopií i více než 90 dní od jejich prvního stažení, aniž by systém nastavil jakékoliv limity pro promazávání starých dat. Vaše HTTP hlavička Cache-Control: no-store? Ignorovaná. Vaše direktiva noindex? Taktéž ignorovaná.
Samotný převod dat do Markdownu má navíc své vlastní rozmarné chování:
- Skripty, iframe prvky i strukturovaná data JSON-LD systém nekompromisně odřízne (ano, vaše strukturovaná data se touto cestou k modelu v životě nedostanou).
- Alternativní texty obrázků (alt texty) proces naopak přežijí.
- Text skrytý pomocí CSS robot vytáhne, takže si přečte i obsah, který běžní lidští návštěvníci na webu nikdy neuvidí.
Konkrétní dopady si můžete domyslet sami. Detekce maskování obsahu (cloakingu) zatím nepatří k nejsilnějším stránkám OpenAI.
Každé živé načtení naráží na dva natvrdo nastavené limity. Robot nespouští JavaScript, takže obsah vykreslovaný na straně klienta je pro něj absolutně neviditelný. A velikost stránek má pevný strop na 4 MB. Jakmile tuto hranici překročíte, stránka se nezkrátí. Systém ji rovnou odmítne s chybou HTTP 400 a model si z ní nepřečte vůbec nic. Příliš objemná stránka se neodbaví ani zčásti a v očích AI neexistuje.
Přesto v tom všem vědci našli jedno velmi příjemné překvapení: Parametr v API vrací přesné datum procházení uložené kopie dané URL adresy. Načtete si přes něj své vlastní stránky a hned zjistíte, kdy uživatel ChatGPT naposledy přiměl bota, aby si váš web opravdu přečetl. Získáváte tak perfektní, prakticky bezplatnou metriku reálné viditelnosti v AI, kterou dneska téměř nikdo nesleduje.
Slepé místo v analytice
Pravděpodobně už jste ve svých analytických přehledech narazili na parametrický řetězec utm_source=chatgpt.com. Tento parametr se automaticky připojuje ke klikatelným odkazům, které se zobrazují uživatelům v rozhraní AI, a měří odchozí prokliky.
Jenže ne každá citace tento sledovací parametr obsahuje. Výzkum odhalil, že stránky, které ChatGPT sám o sobě otevírá naživo v režimu Think/Thinking, žádné utm_source v odkazech zobrazených uživatelům nemají.
V praxi to znamená docela zásadní věc, protože stránky, které si model skutečně přečetl v plném rozsahu, tedy ty s vysokou (74%) mírou citace, za sebou nezanechávají vůbec žádnou UTM stopu. Jestliže svou viditelnost a zásah v ChatGPT měříte pouze filtrováním podle tohoto parametru, počítáte jenom prokliky a absolutně vám unikají skutečná přečtení. Chcete-li mít kompletní obrázek, musíte v serverových lozích vedle toho sledovat i uživatelského agenta (user-agenta) ChatGPT-User.
Záhada: Citace, které se objevují odnikud
Autoři studie ovšem narazili i na věc, která se zatím vymyká jakémukoliv logickému vysvětlení. Část výsledků, které se k modelu dostanou, neobsahuje vůbec žádný úryvek textu. Mají pouze název a URL adresu. U výsledků z platforem jako arXiv nebo Reddit, které pocházejí z databází s přímým přístupem OpenAI, to žádné velké překvapení není. Jenže v datech figuruje i spousta úplně běžných webů.
V režimu Instant dostávají URL adresy bez textových úryvků (s výjimkou Redditu, YouTube a arXiv) citaci podstatně častěji než stránky, ke kterým model úryvek má (14,9 % oproti 8,2 %). Z toho vyplývá, že systém upřednostňuje citování stránek, o kterých si přečetl vůbec nejméně. Ještě podivnější je, že některé odkazované zdroje v rozhraní vůbec neodpovídají žádnému ze zjištěných výsledků vyhledávání.
Jak Olivier de Segonzac upřesnil, hypotéza počítá s tím, že model tyto stránky vytahuje přímo ze své parametrické paměti, to znamená ze znalostí zapsaných přímo v jeho vnitřní struktuře z fází trénování:
- „Téměř vždycky jde o čisté kořenové domény známých webů, které ale systém svědomitě opatří koncovkou utm_source=chatgpt.com, jako by prošly klasickým vyhledáváním. Významnou část toho, co ChatGPT nakonec čtenářům doporučí a odcituje, tak může tvořit jednoduše to, co si sám pamatuje z tréninku, a nikoliv to, co zrovna čerstvě načetl z webu. Tento jev dokážeme v data-setu jasně pozorovat, ale zatím ho neumíme zcela přesně změřit, a upřímně bychom uvítali, kdyby se do rozklíčování tohoto oříšku pustil i někdo další.“
S tím souvisí ještě jedna zvláštnost. Akademický repozitář arXiv se ve sledovaném vzorku objevil více než 2 600×, ale jako citovaný zdroj skončil pouze desetkrát. U diskuzní platformy Reddit byl vidět navlas stejný vzorec. ChatGPT sice poctivě čte akademické studie i fóra, aby o tématu hlouběji přemýšlel, ale běžným uživatelům pak jako zdroj servíruje klasické webové stránky. Být prohledávaný a být opravdu citovaný jsou dvě úplně odlišné roviny.
Měli byste psát nadpisy o délce 289 znaků?
Celý název se do modelu dostane nezkrácený, takže přímo ukrajuje z vaší kapacity kontextového okna (grounding). Těch 200 znaků hned za nadpisem H1 představuje jediný text, který model v režimu Instant reálně vidí.
Odstranění nadbytečných popisků kategorií, dat publikace a různých widgetů, které se pletou mezi nadpis H1 a první skutečně užitečnou větu, tak přímým způsobem zlepšuje to, co se ChatGPT o vaší stránce dozví. Obojí představuje reálné, měřitelné a okamžitě proveditelné kroky.
Při úpravách ale postupujte s rozvahou a citlivě:
- Napište název jako samostatnou větu, nikoliv jako shluk slov optimalizovaný pro zkracování v SERPu.
- Prvních 200 znaků hned za nadpisem H1 musí nést vaše hlavní sdělení.
- Umístěte informativní alternativní text (alt text) co nejblíže k horní části stránky.
- Meta popisky ponechte, protože je pořád aktivně využívají kanály napojené na Google.
- Držte celkovou velikost stránky pod 4 MB a zajistěte, aby byla plně čitelná i bez spouštění JavaScriptu.
Určitě ale nepředělávejte celý web od základu jen kvůli jedné dočasné technické zvláštnosti. Systém se mění extrémně rychlým tempem: Pole result_source zmizelo ze streamu doslova přes noc, poskytovatelé nákupních výsledků byli anonymizovaní během jednoho týdne a tokeny Nákupů Google se změnily z čitelných na šifrované za pouhé čtyři dny. Jakýkoliv konkrétní mechanismus popsaný ve studii Resoneo tak může být ve chvíli, kdy čtete tento článek, dávno minulostí.
Dvě strukturální fakta ale zůstávají pevná a můžete na nich bez obav stavět:
- Velké jazykové modely (LLM) umělé inteligence mají znalosti omezené termínem uzávěrky trénovacích dat a dál už nevědí vůbec nic. Jsou tak předurčené k tomu, aby se spoléhaly na vyhledávače, které jim pomáhají překlenout mezeru mezi tréninkem a momentální realitou. Na vyhledávání čerstvých informací tak zůstane trvale závislý každý AI asistent.
- Všechny vyhledávače, o které se umělá inteligence opírá, bude trh postupně tlačit ke kvalitě na úrovni Google. Primitivní indexy totiž generují jen nejjednodušší odpovědi a uživatelé si toho velmi rychle všimnou. Úryvek textu o 200 znacích tak s velkou pravděpodobností dlouho nevydrží, ale potřeba nabízet tu nejlepší odpověď tady bude pořád. Proto se vám klasické základy, to znamená hladce procházitelné stránky, jasné a výstižné nadpisy i obsah, který lidem užitečně odpovídá na jejich otázky, pořád vyplatí bez ohledu na to, jaké soustrojí pod "kapotou" zrovna běží.
Nekonečný boj: Znáte odpovědi na skutečné otázky lidí?
Optimalizace mechaniky úryvků znamená čistou taktiku, ovšem skutečná strategie spočívá v tom, že přesně víte, na co se lidé AI asistentů doopravdy ptají. Jedině tak můžete stát v první linii jako zdroj, který jim poskytne nejlepší řešení.
Nikdo se umělé inteligence neptá na kočárek s šířkou rámu 49 cm. Lidé se ptají na kočárek, se kterým bez problémů projedu turnikety v metru. Nikdo ve vyhledávači nehledá hustotu pěny u náušníků sluchátek. Ptá se, která sluchátka ho nebudou tlačit při nošení brýlí. Nebo se ptá, která sedačka bez úhony přežije drápky domácí kočky. A tak podobně.
Tato mezera mezi suchou řečí technických parametrů a živým lidským jazykem dnes určuje viditelnost v AI vyhledávání. Stroje na konverzační dotazy odpovídají takovým obsahem, který na ně dokáže nejlépe a "nejlidštěji" zareagovat.
Už teď přitom máte ve vlastních rukou dobrou polovinu dat, která tyto dotazy odhalují:
- Zákaznické recenze a hodnocení.
- Přepisy rozhovorů ze zákaznické podpory.
- E-maily, které vám každý den chodí do schránky.
- Dotazníky a průzkumy, které už dlouho nikdo neotevřel.
Ta druhá polovina žije vlastním životem mimo vaši kontrolu. Je v tom, co lidé o vašich produktech píší na diskusních fórech, na sociálních sítích, v komentářích pod videi, v tiskových zprávách nebo na blozích.
Když je obě poctivě prostudujete, hlavní přednosti i slabá místa vašich produktů vyplavou na povrch přímo slovy vašich zákazníků. A jsou to přesně ta samá slova, která denně vidí i AI asistenti. Těžte z těchto poznatků a odpovídejte na to, co lidi zajímá, přímo na stránkách, které AI roboti dokážou snadno přečíst. Optimalizujete tak pro všechny vyhledávací systémy naráz včetně těch, které v OpenAI ještě ani nestihli naprogramovat.
Co zůstává zahaleno tajemstvím
Experti pořád ještě s jistotou nevědí, který konkrétní crawler vlastně plní index labrador daty. Kanárkové stránky během výzkumu zachytily bota OAI-SearchBot jen minimálně, zatímco index dál bez problémů servíroval čerstvé výsledky.
U Redditu je situace celkem jasná, protože OpenAI má v rámci partnerské dohody z roku 2024 přímý přístup k jeho datovému API v reálném čase. U YouTube jde ale o zcela jiný příběh. Bez jakékoliv veřejné dohody a bez viditelného vysvětlení, jak se tyto výsledky do systému vlastně dostávají. A stejně tak nadměrné citování URL adres bez textových úryvků pořád stojí pouze na hypotéze.
Technologické soustrojí OpenAI je zkrátka čím dál složitější sledovat. Datová políčka mizí ze streamu ze dne na den, dodavatelé dat se anonymizují, směrování se mění týden co týden a celý systém se s postupem času stává čím dál méně průhledným.
Často kladené otázky (FAQ)
Jaký je hlavní rozdíl mezi načítáním webu v bezplatné a placené verzi ChatGPT?
Bezplatná verze (režim Instant/Think) šetří náklady a čerpá až ze tří čtvrtin z vlastního vyhledávacího indexu OpenAI (labrador), přičemž webové stránky otevírá naživo jen zcela výjimečně. Placený režim Thinking si naopak může dovolit drahé nástroje, takže 75 % výsledků stahuje přes živé SERP scrapery z Google a reálné stránky otevírá běžně robotem ChatGPT-User.
Proč nestačí měřit viditelnost v ChatGPT jen pomocí utm_source=chatgpt.com?
Tento parametr se automaticky doplňuje primárně do odchozích odkazů v uživatelském rozhraní, které měří klasické prokliky na web. Stránky, které si model sám o sobě otevře a přečte naživo v režimu Thinking (a má u nich až 74% míru citace), však tuto UTM stopu nezanechávají, takže je v analytice odhalíte pouze sledováním user-agenta ChatGPT-User v serverových lozích.
Jak nejlépe upravit stránky, aby z nich AI index vytěžil maximum?
V režimu Instant dostává umělá inteligence z indexu pouze název stránky a prvních přibližně 200 znaků textu hned za nadpisem H1. Odstraňte proto z prostoru mezi hlavním nadpisem a prvním odstavcem nadbytečné prvky (předpisy kategorií, data publikace či jména autorů), umístěte to nejpodstatnější hned na začátek a držte celkovou velikost stránky do 4 MB bez nutnosti spouštět JavaScript.
Zdroj: searchengineland.com, searchenginejournal.com, marketingland.com, facebook.com, cpcstrategy.com
Autor: Martin Kulhánek
Foto zdroj: AI, pixabay.com