Ktoś z zespołu otwiera ChatGPT, wpisuje nazwę firmy i dostaje przyjazny akapit. Zrzut ekranu trafia na Slacka. Zwykle to ostatni raz, kiedy ktokolwiek coś mierzy.
Odpowiedź nie jest dowodem. Konto, na którym byłeś zalogowany, wcześniejsze czaty, własne instrukcje i dokładne brzmienie tego jednego promptu pociągnęły odpowiedź w Twoją stronę. Mierzyć widoczność AI zaczyna się od wyrzucenia tego testu. Zamiast niego potrzebujesz metody, którą powtórzysz: stały zestaw pytań, sesje bez Twojej historii, więcej niż jeden silnik i regułę scoringu zapisaną zanim zobaczysz wyniki. Narzędzie może wykonać tę pętlę. Nie wymyśli pytań. Przeczytaj też: rekomendacja AI dla dostawców: fakty do shortlisty - luki w treści, które na pytaniach z ograniczeniami wychodzą jako zera.
W tym artykule:
- Dlaczego pytanie ChatGPT o własną markę nic nie dowodzi?
- Co właściwie mierzyć?
- Skąd wziąć pytania?
- Jak to uruchamiać i jak często?
- Arkusz, licencja SaaS czy self-hosting?
- Jak czytać rozbicie wyników?
- Jak widzieć ruch AI w analityce i co raportować?
- Najczęstsze pytania
Dlaczego pytanie ChatGPT o własną markę nic nie dowodzi?
Zalogowany ChatGPT pamięta Cię. Wcześniejsze czaty, własne instrukcje i wszystko, co produkt wyciąga z konta, ciągną odpowiedź w stronę marek, o których i tak mówisz. Jesteś ostatnią osobą, która powinna robić ten test, bo system próbuje pomóc Tobie - a nie kupującemu, który nigdy nie słyszał Twojej nazwy.
Jeden run i tak jest anegdotą. Zadaj to samo pytanie dwa razy w świeżej sesji, a shortlista często się przesuwa. Dzieje się tak z trzech zwykłych powodów i żaden z nich nie jest spiskiem przeciwko Twojej marce.
Pierwszy to sposób pisania modelu. Nie sięga po zapisaną listę zatwierdzonych dostawców. Generuje odpowiedź token po tokenie, a wybór następnego słowa ma odrobinę losowości. Dwa runy z identycznym promptem mogą więc podać różne firmy, nawet gdy w sieci nic się nie zmieniło.
Drugi to retrieval. Przy wielu pytaniach asystent pobiera też strony w trakcie odpowiadania, a strony, które znajduje, nie tworzą stałej biblioteki. Ranking przecrawlowany wczoraj, tabela specyfikacji konkurenta opublikowana dziś rano, wątek na forum lekko wyżej dziś - każdy z nich może wejść do odpowiedzi w następnym runie i zniknąć w kolejnym.
Trzeci to sformułowanie. „Najlepsze pompy zęzowe do jachtów” i „jaka pompa zanurzeniowa 12 V pasuje do schowka 400 mm w wodzie słonej” brzmią podobnie dla człowieka, a dla modelu to różne zadania. Ciągną inne źródła i zwracają inne nazwy. Jeśli pytasz tylko w wersji brandowej, wyglądasz na widocznego i nadal brakuje Cię przy promptach, które decydują o zakupie.
Metoda, która następuje, jest nudna - dlatego działa. Zamroź pytania i zapisz je. Gdy zmieniasz sformułowanie, nadaj mu numer wersji, żeby wynik z zeszłego miesiąca nadal znaczył to samo. Uruchamiaj zestaw w czystym stanie: wylogowany, przez API albo przez narzędzie bez Twojej historii. Potem powtarzaj. Kilka runów na pytanie, na więcej niż jednym silniku, zanim uznać brak za brak.
Co właściwie mierzyć?
Potrzebujesz czterech liczb. Każda ukrywa coś, czego nie pokazują pozostałe - jeden nagłówek zawsze będzie więc niepełny.
Mention rate (wskaźnik wzmianki) to udział pytań, przy których marka w ogóle pada. To liczba na slajd, bo odpowiada: „Czy jesteśmy w odpowiedzi?”. Ukrywa natomiast, gdzie się pojawiłeś. Wzmianka w siódmym zdaniu długiej odpowiedzi to nie to samo co pierwsza nazwa na shortliście trzech firm.
Citation rate (wskaźnik cytowania) to udział odpowiedzi, które linkują Twoją domenę. Często nie zgadza się ze wskaźnikiem wzmianki. Modele wymieniają firmy, do których nie mogą wskazać, i cytują strony, które Cię nie nazywają. Wskaźnik cytowania ma szansę stać się wizytą, bo link można kliknąć. Gdy citation rate stoi na zero, a mention rate wygląda dobrze, sprawdź, czy fetchery w ogóle docierają do Twoich stron - zobacz czy AI naprawdę może odczytać Twoją stronę internetową.
Position (pozycja) to miejsce w odpowiedzi, gdzie pada marka. Na shortliście trzech pierwsza wymieniona zostaje w pamięci kupującego. Jeśli liczysz „wspomniane gdzieś” jako sukces, raportujesz liczbę, której później nie wytłumaczysz nikomu, kto faktycznie czyta odpowiedzi.
Share of voice to Twoje wzmianki na tle wszystkich wzmianek dostawców w kategorii. Zarządy lubią ten wskaźnik, bo przypomina udział w rynku. Szybko wprowadza w błąd. Mianownik to kogo model akurat wymienił w tym tygodniu przy tej formułowce - a nie prawdziwy zestaw konkurentów. Traktuj go jako podział do obserwacji, nie jako liczbę do sterowania.
Regułę scoringu zapisz przed pierwszym runem. Z góry ustal, co się liczy: wzmianka spółki zależnej, wzmianka bez linku, strona konkurenta, która Cię wymienia, lista „marki jak X”, gdzie przechodzisz mimochodem. Jeśli zmienisz regułę po zobaczeniu liczb, baseline jest już bezużyteczny - nie wiesz, czy ruszył się wynik, czy egzamin.
Poniżej jeden wypełniony wiersz, żeby arkusz nie był abstrakcją. Firma jest fikcyjna. Odpowiedzi są wymyślone, żeby pokazać kolumny - nie pochodzą z runu na żywo.
| Data | Silnik | Q | Formułka | Run | Wzmianka | Cytat | Pozycja | Co odpowiedź naprawdę mówiła |
|---|---|---|---|---|---|---|---|---|
| 2026-08-26 | ChatGPT | 5 | v1 | 2 | Nie | Nie | brak | Wymieniono dwóch innych producentów pomp. Zacytowano ranking „best bilge pumps 2026”. Bez Northwake. |
Przy ptaszkach trzymaj surowy tekst odpowiedzi. W brzmieniu widać, dlaczego Cię zabrakło: model chciał rozmiaru, którego nigdy nie opublikowałeś, wziął cenę sprzed roku, pomylił Cię z podobną nazwą albo zaufał rankingowi, który nigdy nie prosił Cię o fakty.
Skąd wziąć pytania?
Wymyślone pytania mierzą Twoje założenia. Prawdziwe pochodzą z miejsc, gdzie kupujący już rozmawiali.
Bierz je ze skrzynki sprzedaży i notatek z przegranych deali, z dokumentów RFI, ticketów supportu, nagrań rozmów za zgodą, zapytań Search Console w formie pytań i z forów, których kupujący faktycznie używają. Zostaw słowa kupującego, także te niechlujne. Zapisuj źródło i datę dodania każdego pytania, żeby później zobaczyć, które źródła dały braki, które mają znaczenie.
Zestaw musi obejmować więcej niż „czy znasz naszą nazwę?”. Kupujący, który ma już Twoją markę w głowie, to inna osoba niż ta, która poprosiła asystenta o trzech dostawców pasujących do schowka.
| Typ | Do czego | Szacunkowy udział |
|---|---|---|
| Brandowe | Czy model w ogóle może o Tobie mówić? | Mały. Wystarczy, żeby sprawdzić rozpoznanie encji. |
| Kategoria i „najlepsi” | Czy pojawiasz się, gdy nikt Cię nie podał? | Duży. To shortlista. |
| Świadome problemu | Czy przetrwasz akapit ograniczeń? | Duży. Tak kupujący naprawdę pytają. |
| Porównanie | Co się dzieje, gdy mają już dwie nazwy? | Średni. |
| Koszt | Czy poda cenę, przedział albo uczciwe „nie opublikowano”? | Średni. |
| Segment | Inny kupujący, ten sam produkt. | Kilka. |
| Geografia i język | To samo zadanie na innym rynku. | Rozdziel zestaw. Nie uśredniaj. |
Zestaw głównie z pytań brandowych daje wygodną liczbę - i bezużyteczną. Wydajesz się obecny w wynikach i nadal jesteś niewidoczny przy promptach, które decydują o dealu. Dwanaście do dwudziestu dobrze udokumentowanych pytań z kilkoma formułkami każde bije pięćdziesiąt napisanych na warsztacie. Chcesz stabilny odczyt na typ, a nie okrągłą liczbę, która na slajdzie wygląda poważnie.
Poniżej zestaw startowy dla fikcyjnej marki pomp morskich Northwake. Nie sprzedajemy pomp. Lista pokazuje kształt - zamień każdą linię na pytania ze skrzynki.
- Czy Northwake to dobra marka pomp zęzowych morskich?
- Kto produkuje pompy Northwake i gdzie są montowane?
- Najlepsze pompy zęzowe do jachtów
- Które firmy robią pompy zanurzeniowe 12 V do wody słonej?
- Potrzebuję pompy zęzowej na schowek 400 mm, 12 V, w pełni zanurzalnej w wodzie słonej z osadem
- Cicha pompa zęzowa do kabiny jachtu, poniżej 15 A
- Northwake 400 versus Tidewell 400 na jacht 12 m
- Który z nich ma części zamienne w Europie?
- Ile kosztuje pompa zęzowa do jachtu?
- Czy Northwake publikuje ceny katalogowe dla serii 400 mm?
- Pompa zęzowa na statek rybacki, nie jacht rekreacyjny
- Pompa na barkę roboczą stojącą miesiącami w porcie
- Dostawcy pomp zęzowych morskich w Niemczech
- Kto sprzedaje pompy zęzowe do jachtów z serwisem w Europie Północnej?
Pytania 1 i 2 Cię uszczęśliwią, jeśli encja jest znana. Pytania 5, 6, 11 i 13 zamieniają się w strony, bo to te, które kupujący wpisują, zanim mają shortlistę. Gdy odpowiedź mówi, że brakuje IP rating albo wymiarów, poprawką jest zwykle czytelny tekst na stronie, a nie kolejne brandowe FAQ - zobacz tekst w obrazach i SEO, dlaczego specyfikacje tylko w grafice psują wyszukiwarkę i fetchery.
Zamroź rdzeń i zostaw go w spokoju. Gdy rynek się przesuwa, dodawaj pytania z nowym numerem wersji. Jeśli po cichu podmienisz linię 5, uwierzysz, że treść przesunęła metrykę, choć zmieniłeś egzamin.
Przy podziale geografii i języka traktuj każdy rynek jako osobny podzestaw zamiast uśredniać wyniki - ten sam schemat co przy wielojęzycznym katalogu, gdzie jeden język rankuje, a drugi zostaje niewidoczny.
Jak to uruchamiać i jak często?
Schemat jest prosty - i to ta część, która ma przetrwać rok: obejmij miejsca, gdzie kupujący naprawdę pytają, i więcej niż jeden rodzaj retrieval, bo te powierzchnie się nie zgadzają. Asystent czatu, silnik odpowiedzi oparty na cytatach i to, co Google robi z generowanymi odpowiedziami w wyszukiwarce, to różne zadania. Jeden może Cię wymieniać za każdym razem, inny nigdy. Taki podział to normalny pierwszy wynik. To nie bug metody.
Produkty w tych slotach będą się zmieniać. Na moment pisania przykład to ChatGPT, Perplexity i Google AI Overviews lub AI Mode, plus Copilot, Claude lub Gemini tylko jeśli rozmowy sprzedażowe już je wymieniają. Nie traktuj tej listy jak metody. Zapytaj zespół, gdzie startują deale, wpisz te powierzchnie do arkusza i pomiń te, których nikt na Twoim rynku nie używa, tylko dlatego, że ranking je wymienił.
Nie potrzebujesz każdego silnika pierwszego dnia. Dwa lub trzy różnych typów już pokazują, czy brak to „jesteśmy nieznani”, czy „jesteśmy nieznani na tej powierzchni”. Dodaj kolejny tylko wtedy, gdy ktoś faktycznie przeczyta ten dodatkowy podział.
Niektóre powierzchnie nadal wymagają człowieka. Produkt czatu po zalogowaniu, pasek boczny w przeglądarce, odpowiedź dopiero po doprecyzowaniu: API i scrapery tego nie łapią. Zaplanuj kilka ręcznych runów na pytania, które decydują o dealach, resztę automatyzuj.
Pełną baseline uruchom raz, potem lżejszy podzestaw w rytmie. Kluczowe pytania z ograniczeniami co dwa tygodnie lub co miesiąc wystarczą większości zespołów. Długi ogon wraca, gdy masz powód - nowy rynek, świeżo opublikowana strona. Codzienne wyniki na 200 promptach wyglądają na zajęte. Rzadko zmieniają to, co napiszesz w przyszłym tygodniu.
Zapisuj odpowiedzi, nie tylko ptaszki. Brak z komunikatem „żadna pompa tego rozmiaru bez IP rating na liście” to zadanie contentowe: nigdy nie opublikowałeś ratingu. Brak, który Cię wymienia, ale przypisuje wycofany model sprzed roku, to zadanie korekty: model znalazł starą stronę. Oba dają ten sam wynik w scoringu, gdy trzymasz tylko tak/nie - i wysyłasz niewłaściwą osobę po niewłaściwą poprawkę.
Arkusz, licencja SaaS czy self-hosting?
Każde płatne narzędzie widoczności AI robi tę samą pętlę, którą właśnie czytałeś: zestaw pytań, kilka silników, wynik. Zakup nie zastępuje pętli. Skaluje ją, żebyś mógł zadawać więcej pytań częściej bez wklejania do czatu całe popołudnie.
Stan na sierpień 2026: rynek dzieli się na trzy drogi. Nazwy poniżej to przykłady kategorii, nie ranking. Lista się przesunie.
| Arkusz, czyste sesje | Platformy GEO lub dodatek suite SEO | Self-hosting | |
|---|---|---|---|
| Zasięg | Kilka silników, tyle runów, ile masz godzin | Szeroki, w harmonogramie | Co podłączysz |
| Kto pisze pytania | Ty | Ty plus domyślna lista vendora | Ty |
| Surowe odpowiedzi | Jeśli wkleisz | Różnie. Część trzyma tekst, część tylko wynik | Ty je przechowujesz |
| Benchmarki konkurentów | Ręcznie | Zwykle w produkcie | Tylko nazwy, które sam zbierzesz |
| Koszt | Czas | Za seat, za prompt albo oba | Czas inżynierów plus rachunki API |
| Utrzymanie | Ty | Vendor | Ty |
Platformy dedykowane w tej kategorii to m.in. Profound, Peec i Otterly. Suite SEO z doszukanym trackingiem: Semrush AI toolkit, Ahrefs Brand Radar. Publikujemy opcję self-hosting, Ansvisor. Licencja MIT, trzymasz prompty i odpowiedzi, wzór scoringu leży w repozytorium. Nie wymyśli danych konkurentów, których nie zebrałeś, i nie zastąpi człowieka na powierzchniach bez użytecznego API. Arkusz plus wylogowana przeglądarka to akceptowalny pierwszy tydzień.
Zakup wygrywa, gdy nikt nie utrzymuje skryptów, potrzebujesz share of voice konkurentów, którego sam nie zbierzesz, a zarząd chce dashboard przed następnym spotkaniem.
Self-hosting wygrywa, gdy pytania decydujące o dealach muszą zostać Twoje, potrzebujesz surowych odpowiedzi za pół roku i cena za seat robi się absurdalna przy rosnącym zestawie. Bierzesz też na siebie zmiany formatów, limity rate i lukę między odpowiedzią API a tym, co użytkownik widzi w produkcie. Ta luka jest realna. Pipeline to nie to samo co siedzenie w czacie.
Większość zespołów ląduje hybrydowo: kupione narzędzie na szerokość, krótki własny zestaw na dziesięć pytań, które naprawdę domykają pracę. Własny zestaw to ten, który oceniasz ręcznie, gdy dashboard i skrzynka sprzedaży się nie zgadzają.
Jak czytać rozbicie wyników?
Średnia to najmniej interesująca liczba w arkuszu.
40 % wskaźnika wzmianki może znaczyć: jesteś przy każdym pytaniu brandowym i przy żadnym z ograniczeniami. Albo: widać Cię po angielsku, znikasz po niemiecku. Albo: ChatGPT Cię wymienia, Perplexity nigdy. Trzy sytuacje, ten sam nagłówek, trzy różne backlogi - nagłówek nie jest tym, na czym działasz.
Podziel wyniki według silnika, języka i typu pytania, zanim kogokolwiek briefujesz. Zwykle nie widzisz czystego zera wszędzie. Jest przyzwoity wynik ogólny z dziurą w jednym podziale. Ta dziura to praca.
Brak staje się stroną, gdy pytanie jest prawdziwe, sprzedaż się nim interesuje i nic na czytelnym URL na nie odpowiada. Lista braków to nie plan - dziesięć niepowiązanych zer da dziesięć cienkich FAQ. Najpierw grupuj. Jedna tabela specyfikacji może zamknąć trzy pytania z ograniczeniami. Dziesięć cienkich FAQ nie zamknie żadnego dobrze. Strony, które naprawiają braki na pytaniach z ograniczeniami, to te, które CMS i tak powinien wspierać - typowane pola, tabele, HTML do crawlowania, opisane w 10 funkcjach SEO, które powinien mieć nowoczesny CMS.
Nie traktuj ruchu z jednego tygodnia jako dowodu, że nowa strona zadziałała. Odpowiedzi skaczą z tych samych powodów, dla których pierwszy test kłamał: próbkowanie, retrieval, formułka. Potrzebujesz zamrożonego podzestawu, wystarczającej liczby runów i czasu, zanim przypiszesz przyczynę. Dopóki tego nie masz, raportuj obecność i luki. Nie raportuj, że wpis na blogu „ruszył ChatGPT”.
Jak widzieć ruch AI w analityce i co raportować?
Część asystentów przekazuje referrer. W GA4 szukaj hostów typu chatgpt.com i perplexity.ai i zbuduj segment. Wiele czatów nie przekazuje nic - wizyta ląduje jako Direct, wymieszana z ludźmi, którzy wpisali URL. First-touch i last-touch w tej sytuacji kłamią, bo research odbył się w rozmowie, której nie posiadasz.
Tagi UTM na własnych linkach nadal pomagają w kampaniach, które kontrolujesz. Nie tagują cytatu wewnątrz ChatGPT. Gdy model Cię wymieni, a kupujący wpisze homepage z pamięci, analityka nie wie, że ChatGPT był w grze.
Google Search Console to inne okno - i patrzy tylko na Google. 3 czerwca 2026 Google uruchomiło Search generative AI performance reports. Pokazują impressions, gdy Twoje URL pojawiły się w AI Overviews, AI Mode i funkcjach generatywnych w Discover. Pierwsza wersja to impressions: jak często strona była pokazana w tych funkcjach. Bez kliknięć, bez zapytań, które wywołały pokaz, bez ChatGPT. Raporty wdrażały się na podzbiór stron - jeśli ich jeszcze nie widzisz, to rollout, a nie brak integracji po Twojej stronie.
Search Console mówi więc, czy powierzchnie AI Google pokazały Twoje strony. Twój zestaw pytań mówi, czy ChatGPT Cię wymienił. GA4 mówi o części wizyt, które nadal niosą referrer. Żadne z trzech nie daje pełnego obrazu. Połóż je obok siebie. Nie dodawaj ich w jedną liczbę „ruchu AI” i nią nie steruj. Po stronie crawl i index, która zasila te powierzchnie Google, SEO techniczne nadal jest warstwą bazową.
Zarząd potrzebuje mniej niż wykres sesji. Obecność: na pytaniach decydujących o dealach, jak często jesteś wymieniany i na których silnikach. Luki: które typy pytań lub języki nadal mają zero. Korekty: gdzie model mówi o Tobie źle i czy źródło błędu nadal jest live. Pomiń mini-wykres ruchu Direct. Będzie skakać i rozpocznie spór, którego nikt nie domknie.
Najczęstsze pytania
Dlaczego ChatGPT daje różne odpowiedzi na to samo pytanie?
Bo nie pobiera zapisanej karty faktów. Za każdym razem generuje odpowiedź z odrobiną losowości - następne słowo nie jest w pełni ustalone, dwa identyczne prompty mogą dać dwie shortlisty. Przy wielu pytaniach pobiera też strony w trakcie odpowiedzi, a znalezione strony mogą zmieniać się co godzinę. Gdy zmienisz choć kilka słów promptu, dajesz mu inne zadanie - spodziewaj się innych nazw. Gdy jesteś zalogowany, pamięć i wcześniejsze czaty ciągną odpowiedź do Ciebie dodatkowo. Mierzenie przez szum: zamroź formułkę, użyj czystej sesji, traktuj kilka runów jako dane. Jedna odpowiedź to historia.
Ile ruchu naprawdę pochodzi z AI?
Nie ma jednego udziału dla każdej strony. Część wizyt to referrals z hostów asystentów. Część chowa się w Direct, bo czat nie przekazał referrera. Duża część wpływu nigdy nie staje się sesją: kupujący dostał trzy nazwy i poszedł do zwycięzcy bez dotknięcia Twojej analityki. Dlatego zestaw pytań ważniejszy niż procent ruchu. Mierz, jak często jesteś wymieniany i cytowany. GA4 to częściowy widok wizyt, nie wielkość szansy.
Czy widzę referrals AI w GA4?
Część. Zbuduj segment referral dla hostów, które faktycznie widzisz w raportach. Licz się z niedoszacowaniem - wiele czatów wysyła gościa bez referrera. Nie używaj tego segmentu jako jedynej liczby w raporcie.
Co to jest dobry wynik widoczności AI?
Nie ma uniwersalnego dobrego wyniku - liczba to średnia po Twoich pytaniach. Zestaw pełen promptów brandowych wygląda mocno. Zestaw pełen promptów z ograniczeniami słabiej i mówi więcej. Oceniaj ruch na pytaniach decydujących o dealach względem własnej baseline, a nie względem procentu ze czyjegoś zrzutu ekranu.
Czy kupować narzędzie widoczności AI?
Kup, jeśli potrzebujesz wolumenu, benchmarku konkurentów i nie będziesz utrzymywał skryptów. Zestaw pytań i reguła scoringu niech zostaną Twoje. Seat, który odpala tylko domyślne prompty vendora, raportuje rynek, który nie jest Twoim. Arkusz przez tydzień wystarczy, żeby zobaczyć, czy masz problem tylko brandowy, czy z ograniczeniami. Decyduj po tym, nie przed.
Uruchom baseline w tym tygodniu
Skopiuj tabelę scoringu z wcześniejszej części artykułu. Weź dwanaście pytań ze skrzynki, nie z burzy mózgów. Uruchom je na dwóch lub trzech powierzchniach, których kupujący już używają, po kilka razy każde, wylogowany. Oceń wzmiankę, cytat i pozycję i czytaj zera według typu, a nie jako jedną średnią.
Jeśli potrzebujesz wolumenu i benchmarków konkurentów, wybierz seat z kategorii pasującej do tego, jak i tak kupujesz oprogramowanie. Jeśli chcesz pytania i surowe odpowiedzi na maszynach, które kontrolujesz, self-hostuj. Ansvisor utrzymujemy na tej ścieżce.
Jeśli masz już stronę i chcesz wiedzieć, czy jest gotowa, żeby modele Cię znalazły i zacytowały, napisz do nas. Wyślij URL. Zrobimy audyt: czy strony są czytelne, czy pojawiasz się na pytaniach, które kupujący naprawdę zadają, i gdzie są dziury. Arkusz dostaniesz tak czy inaczej.