Co v článku najdete
Dvě nové analýzy ukázaly, že citované zdroje v ChatGPT se měnily podle toho, jak se vyhledávací provoz přesouval mezi různými skrytými systémy pro získávání informací.
Výzkumy Chrise Greena a Suganthana Mohanadasana ukazují na další komplikaci při sledování viditelnosti v AI: z výsledné odpovědi není patrné, jak ChatGPT své zdroje vybral.
Oba výzkumníci identifikovali interní označení pro výběr zdrojů, například Labrador, Bright, Oxylabs a SERP.
Tato označení jsou skrytá za samotnou odpovědí a uživatel je v citačních kartách nevidí.
Skryté systémy měnily zdroje
Green otestoval 1 000 promptů, každý z nich až desetkrát, a zaznamenal 9 946 dokončených vyhledávání. Většina promptů zůstávala u jednoho zdroje vyhledávání. Labrador tvořil v jeho datasetu 88,1 % primárních vyhledávacích zdrojů, následoval Bright s 9,9 %, Oxylabs s 1,7 % a SERP s 0,3 %.
U 11,6 % promptů se při opakovaných vyhledáváních primární zdroj změnil.
Když se zdroj vyhledávání změnil, překryv URL klesl z 0,273 na 0,149. Překryv domén klesl z 0,265 na 0,155. Green to vyhodnotil jako přibližně 45% pokles překryvu URL a 42% pokles překryvu domén.
Označení, která se skrývají za výsledky
Mohanadasan analyzoval dva dny nezpracovaného síťového provozu ChatGPT z jednoho přihlášeného účtu Pro a během několika desítek vyhledávání zaznamenal přibližně 1 240 záznamů o zdrojích.
U webových výsledků našel pole result_source se čtyřmi zaznamenanými hodnotami: SERP, Labrador, Bright a Oxylabs.
Labrador popsal jako zdroj zahrnující zavedená média a referenční weby, Bright jako zdroj spojený s Bright Data, Oxylabs jako zdroj spojený s Oxylabs a SERP jako základní zdroj otevřeného webu, který se objevoval především u výsledků ve stylu zpravodajství.
Greenův test opakovaných promptů ukázal, že v jeho datasetu jednoznačně dominoval Labrador. Mohanadasan naopak ve svém vzorku zaznamenal větší roli Bright, zejména u komerčních, nákupních, finančních, meteorologických a lokálních dotazů.
Některé prompty vyhledávání dokonce přeskočily
Mohanadasan také zjistil, že ChatGPT některé dotazy před samotným vyhledáváním klasifikovalo pomocí pole turn_use_case. Některé prompty byly zařazeny jako textové a webové vyhledávání se u nich vůbec nespustilo, přestože se týkaly aktuálních témat. V takových případech nebylo možné načíst, citovat ani použít žádnou stránku jako důkaz.
Složitější dotazy v režimu „thinking“ se chovaly jinak. Mohanadasan zjistil, že ChatGPT může vyhledávání rozvětvit do mnoha samostatných dotazů, včetně dotazů typu site: ověřování cen nebo vyhledávání nepojmenovaných konkurentů.
Toto chování mění okruh stránek, které se mohou dostat do procesu tvorby odpovědi, protože ChatGPT může pracovat s přeformulovanými dotazy, přímými dotazy na konkrétní weby nebo následnými ověřeními namísto přesné fráze, kterou uživatel zadal.
Načtená stránka neznamená citovanou stránku
Mohanadasan rozlišil tři možné výsledky: načtená stránka, citovaná stránka a zmíněná stránka.
Stránka může být načtena do kontextu ChatGPT, aniž by ji uživatel viděl. Může být také citována jako zdroj konkrétní věty. Nebo může být zmíněna určitá stránka, aniž by byla zdrojem daného tvrzení.
V jeho malém vzorku komerčních dotazů byly často načítány Reddit a YouTube, ale Reddit byl citován, zatímco YouTube nikoli. Rozdíl přisuzoval dostupnosti textu: Redditová vlákna obsahují přímo text, zatímco výsledky vyhledávání na YouTube často poskytují spíše metadata než kompletní přepisy videí.
Stránky prodejců byly citovány u vlastních údajů, například cen a technických specifikací. Stránky třetích stran naopak častěji sloužily jako podklad pro obecnější doporučení.
Proč je to důležité?
Neexistuje jeden univerzální výsledek viditelnosti v ChatGPT, který by bylo možné jednoduše měřit. Vaše stránka se do procesu vůbec nemusí dostat, pokud ChatGPT vyhledávání přeskočí, použije jiný vyhledávací zdroj nebo najde srozumitelnější stránku třetí strany, která dané tvrzení lépe podpoří.
Stránky, které se snadno načítají a čtou, měly větší šanci být použity. Obě analýzy ukázaly, že výběr zdrojů v ChatGPT částečně závisel na tom, jak snadno dokázal systém obsah načíst a zpracovat.
Mohanadasan zaznamenal případy, kdy ChatGPT zřejmě upřednostnil oficiální stránky s cenami, ale následně přešel na zdroje třetích stran, pokud byly ceny skryty za JavaScriptem nebo se jinak obtížně načítaly.
Greenovy výsledky ukázaly, že změna zdroje vyhledávání ovlivňovala, které URL adresy a domény se vůbec dostaly do množiny potenciálních zdrojů pro odpověď.
Větší význam tak získávají čisté HTML, fakta se snadným procházením, jasně uvedené ceny a specifikace, kvalitní pokrytí ze strany třetích stran a obsahově bohaté textové stránky. A to zvlášť ve chvíli, kdy výběr zdrojů závisí na tom, zda ChatGPT dokáže obsah bez problémů načíst a pochopit.
FAQ
Proč se citace v ChatGPT mohou při stejném dotazu měnit?
ChatGPT může při opakovaném vyhledávání použít různé skryté vyhledávací systémy, a pokaždé tak najít jiné zdroje. Proto se mohou měnit nejen citace, ale i stránky a domény, které se v odpovědi objeví.
Znamená načtení stránky ze strany ChatGPT, že ji také uvede jako zdroj?
Ne. ChatGPT může stránku načíst a využít její obsah, aniž by ji následně citoval. Důležité je proto nejen to, zda je web dohledatelný, ale také zda je jeho obsah snadno dostupný a srozumitelný pro AI.
Co mohou firmy udělat pro lepší viditelnost v ChatGPT?
Základem jsou dobře dostupné a čitelné stránky s jasně uvedenými fakty, cenami a specifikacemi. Důležitou roli ale hrají také kvalitní zmínky a zdroje třetích stran, které může ChatGPT využít při tvorbě odpovědí.
Zdroj: searchengineland.com, searchenginejournal.com, marketingland.com, facebook.com, cpcstrategy.com
Autor: Vlastimil Malík
Foto zdroj: AI, pixabay.com