Indeksowanie

Jak działa Indeksowanie i budowany jest ranking w Google? Informacje z dokumentów sądowych

W sierpniu 2025 roku sąd w Waszyngtonie wydał 230-stronicowy wyrok w sprawie antymonopolowej przeciwko Google. Dla niektórych to kontynuacja i potwierdzenie tego czego dowiedzieliśmy się w wyniku procesów w 2023, dla innych być może pierwsze spotkanie z tego typu wiadomościami. Poniżej zebrałem najważniejsze informacje.

To co przez lata spekulowaliśmy, testowaliśmy, teraz mamy czarno na białym, w dokumentach sądowych. Zagłębmy się w techniczne szczegóły tego, co naprawdę dzieje się „pod maską” Google.

🔍 Indeks Wyszukiwania – fundament wszystkiego

Zacznijmy od podstaw. Sąd zdefiniował indeks wyszukiwania precyzyjnie:

„Search Index means any databases that store and organize information about websites and their content that is crawled from the web”

Brzmi prosto? W rzeczywistości to monumentalne przedsięwzięcie. Google crawluje “trillions of web pages” (tak, tryliony – nie literówka). Ale nie wszystkie trafiają do indeksu.

Jak Google decyduje, co indeksować?

Tutaj pojawia się pierwszy fakt. Dokumenty sądowe ujawniają, że dane o zapytaniach użytkowników bezpośrednio wpływają na to, co Google crawluje i jak często:

„Query data helps a GSE understand what web pages to crawl and how frequently. And building and maintaining a comprehensive and fresh search index is essential to answering user queries, especially those of the long-tail variety.”

Co to oznacza w praktyce?

Jeśli użytkownicy często szukają informacji z określonej tematyki, Google będzie częściej crawlował strony z tej branży. To pętla zwrotna – popularne zapytania = częstsze crawlowanie = świeższe dane w indeksie.

Sygnały decydujące o crawlowaniu

Z dokumentów dowiadujemy się, że Google używa konkretnych sygnałów do optymalizacji crawlowania:

  1. Quality signals (sygnały jakości)
  • pomagają określić częstotliwość crawlowania,
  • wysokiej jakości strony = częstsze odwiedziny crawlera
  1. Popularity signals (sygnały popularności)
  • strony często klikane przez użytkowników,
  • wyższa częstotliwość aktualizacji
  1. Spam score 
  • strony z wysokim spam score są crawlowane rzadziej lub wcale,
  • Google aktywnie filtruje „spam-heavy or pornographic pages”

„Google assigns a score to the pages it crawls, and it endeavors to exclude from its web search index pages without value to users, such as spam-heavy or pornographic pages.”

Freshness – świeżość ma znaczenie

Jeden z najważniejszych fragmentów dokumentu:

„’Freshness,’ or the recency, of information is an important factor in search quality. GSEs 'need to know how to recrawl sites to make sure that they do at all times have a reasonably fresh copy of the web that you are looking at.”

Google nie crawluje wszystkich stron z tą samą częstotliwością. Strony z aktualnościami – codziennie, a treści evergreen – rzadziej. System jest dynamiczny i uczy się na podstawie tego, jak często strona faktycznie zmienia zawartość.

🎯 Glue i Navboost – nazwy systemów, które musicie znać

Teraz przechodzimy do kluczowej części. Dokumenty sądowe opisują szczegóły dwóch systemów Google.

Glue – „Super Query Log”

Sąd opisuje Glue jako:

„Glue is essentially a 'super query log’ that collects a raft of data about a query and the user’s interaction with the response.”

Co dokładnie zbiera Glue?

Dokumenty wymieniają cztery kategorie danych:

  1. Dane o zapytaniu:
  • tekst zapytania,
  • język,
  • lokalizacja użytkownika,
  • typ urządzenia (desktop/mobile)
  1. Informacje o rankingu:
  • top 10 wyników („blue links”),
  • wszystkie wywołane funkcje SERP (obrazy, mapy, Knowledge Panel, „People also ask”, etc.)
  1. Dane o interakcji z SERP:
  • kliknięcia,
  • najechania kursorem (hovering),
  • czas spędzony na SERP
  1. Interpretacja zapytania:
  • korekty pisowni,
  • synonimy,
  • sugestie („did you mean”),
  • istotne terminy z zapytania

Navboost – system pamięci kliknięć

„Navboost is a 'memorization system’ that aggregates click-and-query data about the web results delivered to the SERP.”

Navboost można opisać jako gigantyczną tabelę, która zapamiętuje:

  • które wyniki użytkownicy klikali dla konkretnych zapytań,
  • jak długo zostali na stronie,
  • czy wrócili do wyników (pogo-sticking),
  • czy kliknięcie było satysfakcjonujące

Kluczowa informacja z dokumentów:

„Google trains Navboost on 13 months of user data, which is the equivalent of over 17 years of data received by Bing.”

Navboost wykorzystuje 13 miesięcy danych o kliknięciach. To oznacza, że twoje działania SEO z ostatniego roku wpływają na dzisiejszy ranking.

Jak Glue i Navboost współpracują? Przykład praktyczny

SCENARIUSZ: Użytkownik szuka „best italian restaurant near me”

KROK 1 – ZAPYTANIE

User → „best italian restaurant near me”

Google zbiera: lokalizacja, urządzenie, czas

KROK 2 – GLUE ZAPISUJE:

✓ Query text: „best italian restaurant near me”
✓ Lokalizacja: GPS/IP (np. Warszawa, Mokotów)
✓ Device type: mobile (iPhone)
✓ Czas: 18:00, piątek
✓ Język interfejsu: polski

KROK 3 – NAVBOOST SPRAWDZA:

„Dla podobnych zapytań w tej lokalizacji o tej porze, które restauracje ludzie klikali i nie wracali do wyników?”
Dane historyczne pokazują:
– Ristorante Roma: 45% CTR, avg. 3 min na stronie
– Trattoria Verde: 32% CTR, avg. 1.5 min  
– Pasta & Basta: 28% CTR, avg. 4 min

KROK 4 – RANKEMBED ROZUMIE:

Analiza semantyczna:
„best” = użytkownik szuka wysokiej jakości
„near me” = bliskość jest kluczowa  
„italian” = kuchnia włoska (nie pizza place, nie bistro)
Kontekst: piątek 18:00 = prawdopodobnie rezerwacja na kolację

KROK 5 – WYNIKI

Ranking uwzględnia:

  • Popularność (z NavBoost): Ristorante Roma często klikane
  • Semantic match (z RankEmbed): strona zawiera odpowiednie słowa kluczowe
  • Lokalizację: odległość < 2km
  • Czas: restauracje otwarte teraz + przyjmujące rezerwacje
  • Spam score: tylko zweryfikowane biznes

KROK 6 – UŻYTKOWNIK KLIKA:

Kliknął: „Ristorante Roma” (pozycja #1)
Spędził: 4 minuty na stronie
Akcja: Kliknął numer telefonu (intent fulfilled)
Nie wrócił do wyników = był zadowolony

KROK 7 – UCZENIE SIĘ SYSTEMU:

Glue + Navboost zapisują:
Query pattern: „best [cuisine] restaurant near me”
Location: Mokotów, Warszawa  
Time: piątek, wieczór
Winner: Ristorante Roma
Signal: długi czas na stronie + kliknięcie telefonu = sukces

NASTĘPNYM RAZEM:

Gdy ktoś w podobnej lokalizacji, o podobnej porze, wyszuka podobne zapytanie: → Ristorante Roma będzie wyżej w rankingu → Sygnał wzmocniony dla zapytań związanych z włoskimi restauracjami → System „wie”, że to dobry wynik dla tego typu intencji

🤖 RankEmbed – AI w służbie zrozumienia zapytań

Trzeci kluczowy system to RankEmbed (później rozwinięty do RankEmbedBERT). To model deep learning:

„RankEmbed and its later iteration RankEmbedBERT are ranking models that rely on two main sources of data: 70 days of search logs plus scores generated by human raters and used by Google to measure the quality of organic search results.”

Co Robi RankEmbed?

  1. Semantic Matching (dopasowanie semantyczne)

RankEmbed rozumie znaczenie zapytania, nie tylko słowa kluczowe:

„Embedding based retrieval is effective at semantic matching of docs and queries”

Jeśli szukasz „jak naprawić kran”, RankEmbed wie, że:

  • „wymiana uszczelki w kranie” to trafny wynik,
  • „hydraulik Warszawa” może być trafny,
  • „historia kranów w Polsce” nie jest trafny
  1. Long-tail Queries

Dokumenty podkreślają szczególną siłę RankEmbed:

„RankEmbed particularly helped Google improve its answers to long-tail queries.”

Long-tail queries to zapytania, które pojawiają się rzadko (mniej niż 100 razy w ciągu 12 miesięcy). Przykłady:

  • „jak zresetować bluetooth w honda civic 2019”
  • „czy można dodać dynię do pierników”
  • „wordpress custom post type archive pagination broken”

Te zapytania stanowią ponad 38% wszystkich wyszukiwań (dane z dokumentu, badanie Bing).

  1. Efektywność

„RankEmbed is trained on 1/100th of the data used to train earlier ranking models yet provides higher quality search results.”

System używa 100 razy mniej danych niż poprzednie modele, a daje lepsze wyniki. To pokazuje moc deep learning.

📊 Sygnały rankingowe – co faktycznie się liczy?

Dokumenty sądowe potwierdzają istnienie setek sygnałów rankingowych. Nie otrzymaliśmy pełnej listy, ale potwierdzaja kluczowych kategorii:

Top-Level Signals (Sygnały Najwyższego Poziomu)

Z zeznań eksperta Google wynika, że istnieją „top-level signals” będące agregatami wielu pod-sygnałów:

  1. Quality Score (wynik jakości)
  • głównie oparty o PageRank,
  • autorytet witryny,
  • liczba i jakość linków
  1. Popularity score (wynik popularności)
  • dane z chrome (wizyty użytkowników),
  • liczba „anchors” (linków do strony),
  • częstotliwość odwiedzin
  1. Spam Score
  • identyfikacja niskiej jakości treści,
  • wykrywanie manipulacji,
  • filtrowanie pornografii i spamu
  1. Sygnały z NavBoost
  • historyczne dane o kliknięciach,
  • satysfakcja użytkowników,
  • czas spędzony na stronie
  1. RankEmbed signals
  • dopasowanie semantyczne,
  • dopasowanie do intencji

User-Side Data – dane o zachowaniu użytkowników

Sąd zdefiniował „User-side Data” jako:

„all data that can be obtained from users in the United States, directly through a search engine’s interaction with the user’s Device, including software running on that Device, by automated means.”

Co to konkretnie oznacza? Każda interakcja z wynikami:

  • na który link kliknąłeś,
  • ile czasu spędziłeś na stronie,
  • czy wróciłeś do wyników (pogo-stick),
  • jak szybko przewijałeś stronę,
  • czy kliknąłeś w inne elementy (telefon, formularz)

Długi Ogon (Long-Tail) – gdzie liczy się każdy sygnał

Dokumenty szczególnie podkreślają znaczenie danych dla long-tail queries:

„Google’s scale advantage affords it greater insight into what information users are looking for and which results they find relevant and authoritative.”

Jeśli Twoja strona dobrze obsługuje long-tail (zapytania specyficzne, rzadkie), masz przewagę. Dlaczego?

  1. Mniej konkurencji
  • mniej stron targetuje te frazy
  • łatwiej się wyróżnić
  1. Wyższe CTR ma większe znaczenie
  • google ma mniej danych historycznych
  • każde kliknięcie i czas na stronie liczą się bardziej
  1. Lepsze dopasowanie = lepszy ranking
  • RankEmbed szczególnie pomaga w long-tail
  • dopasowanie semantyczne jest kluczowe

💡 Praktyczne wnioski dla SEO

1. CTR i czas na stronie mają znaczenie

Navboost używa danych o kliknięciach z 13 miesięcy. Co możesz zrobić:

✓ Optymalizuj Title i Description dla CTR

  • używaj liczb (5 sposobów, 10 przykładów),
  • dodawaj rok (Poradnik 2025),
  • komunikuj unikalną wartość

✓ Zmniejsz Pogo-Sticking

  • spełnij search intent od razu,
  • użyj jasnych nagłówkóch pokazujących, co znajdzie użytkownik

✓ Zwiększ zaangażowanie

  • dodaj interaktywne elementy (kalkulatory, quizy, mini gry)
  • rozbij długie teksty na sekcje
  • używaj przykładów i case studies

2. Świeżość treści

Dokumenty potwierdzają:

„Freshness, or the recency, of information is an important factor in search quality.”

Ale nie wszystkie strony muszą być często aktualizowane:

Aktualizuj często (częste crawlowanie):

  • aktualności i newsy,
  • cenniki i oferty,
  • trendy i statystyki,
  • wydarzenia

Fun Fact: w polskich serwisach mediowych można znaleźć relacje na żywo sprzed 20 lat 🙂

Aktualizuj rzadziej, ale wciąż aktualizuj (stabilne treści):

  • evergreen, poradniki
  • definicje
  • naukowe wyjaśnienia

Pro tip: Dodaj „ostatnia aktualizacja” w title dla stron, które regularnie aktualizujesz. To sygnał dla użytkowników, że treść jest świeża.

3. Long-Tail to ciągle złoto

Z dokumentów:

„More than 38.7 percent of searches are for rare queries that are searched less than 100 times”

Strategia long-tail:

✓ Twórz szczegółowe, specyficzne treści

Zamiast: „Marketing automation”
Lepiej: „Jak skonfigurować workflow welcome email w GetResponse 2025”

✓ Odpowiadaj na konkretne pytania

  • analizuj „People also ask” w SERP,
  • sprawdzaj related searches na dole SERP

✓ Buduj eksperckość w niszy

  • kilka bardzo szczegółowych artykułów > jeden ogólny,
  • Google doceni, jeśli stajesz się autorytetem w wąskim temacie

4. User Intent – zrozumienie jest kluczowe

RankEmbed używa semantic matching, więc:

✓ Analizuj SERP przed pisaniem

  • co Google już pokazuje dla Twojego słowa kluczowego?,
  • jaki format dominuje? (lista, poradnik, definicja),
  • jakie sub-tematy się pojawiają?

✓ Dopasuj format do intencji

Informational → Poradnik, wyjaśnienie
Transactional → Porównanie, review, „best X”  
Commercial → Case study, „how to choose”
Navigational → Konkretna strona/brand

✓ Użyj related terms i synonimów

  • rankEmbed rozumie kontekst,
  • nie upychaj keywordów – pisz naturalnie,
  • używaj LSI keywords (related terms)

5. Spam Score – nie ryzykuj

Google aktywnie filtruje spam. Dokumenty wspominają:

„Google endeavors to exclude from its web search index pages without value to users, such as spam-heavy or pornographic pages.”

Red flags (unikaj):

  • keyword stuffing,
  • ukryta treść,
  • doorway pages,
  • thin content z reklamami,
  • auto-generated content bez wartości,
  • cloaking

Green flags (stosuj):

  • research i dane,
  • buduj autorytet autora,
  • jasny przekaz wartości,

🎓 Co potwierdza dokument

Dokumenty sądowe dały nam potwierdzenie tego, co wielu SEOowców podejrzewało od dawna – taka jest nasz praca, opierać się na dokuemntacji Google odsiewając jednocześnie bullshit, którym nas karmią pracownicy korporacji.

✅ Prawdy:

  1. User signals mają znaczenie
  • CTR, czas na stronie, pogo-sticking – to nie są „fake metrics”,
  • Navboost używa 13 miesięcy danych o kliknięciach,
  • każda interakcja jest zapisywana i analizowana
  1. AI i machine learning są w centrum algorytmu
  • RankEmbed używa deep learning do zrozumienia zapytań,
  • semantyczne dopasowanie > dokładne dopasowanie słów kluczowych,
  • system uczy się na danych użytkowników
  1. Świeżość indeksu zależy od popularności strony
  • quality i popularity signals → częstsze crawlowanie,
  • wysokiej jakości strony = częstsze wizyty Googlebot,
  • to nie jest demokratyczne – liderzy dostają więcej uwagi
  1. Long-tail queries to ogromna szansa
  • 38%+ wszystkich wyszukiwań to rare queries,
  • RankEmbed szczególnie pomaga w long-tail,
  • mniej konkurencji = łatwiej wygrać
  1. Google ma gigantyczną przewagę dzięki danym
  • triliony stron w indeksie,
  • 13 miesięcy danych o kliknięciach w Navboost,
  • 70 dni logów w RankEmbed,
  • dane z Chrome o rzeczywistych wizytach

🚫 Obalione Mity:

MIT: „Google nie używa CTR do rankingu”Fakt: Navboost to dosłownie system oparty o click-and-query data

MIT: „Czas na stronie nie ma znaczenia”Fakt: Glue zapisuje „duration on SERP” i interakcje użytkowników

MIT: „PageRank nie ma już znaczenia”Fakt: PageRank jest nadal częścią Quality score

MIT: „AI w Google to tylko dodatek”Fakt: RankEmbed i deep learning są w centrum systemu rankingowego

🎯 Akcje do wykonania dziś

Na podstawie ujawnionych informacji, oto konkretne akcje, które możesz podjąć już teraz:

Taktyki krótkoterminowe:

  1. Audyt CTR w Google Search Console

→ Znajdź strony z impresjami > 1000 i CTR < 3%
→ Przepisz title i description  
→ Dodaj liczby, rok, „power words”
→ Test A/B jeśli możesz

  1. Identyfikuj i Optymalizuj Long-Tail

→ GSC → Performance → Filtruj queries po „impressions”
→ Znajdź long-tail z pozycją 4-10
→ Dodaj dedykowane sekcje lub nowe artykuły
→ Użyj dokładnych fraz w H2/H3

  1. Zmniejsz Pogo-Sticking

→ Dodaj spis treści na początku długich artykułów
→ Użyj konkretnych nagłówków opisujących treść sekcji
→ Dodaj „TL;DR” lub executive summary

→ Umieść najważniejsze info above the fold

Strategie Średnioterminowe:

  1. Odświeżenie treści

→ Zidentyfikuj top 20% stron dostarczajace ruch na stronę
→ Stwórz kalendarz aktualizacji (co 3-6 miesięcy)
→ Dodaj date aktualizacji w widocznym miejscu
→ Aktualizacja statystyk, przykładów, zdjęć

  1. Przegląd semantycznego SEO

→ Dla każdego słowa kluczowego, zrób research:
  – Jakie related terms używa top 10?
  – Jakie pytania są w „People Also Ask”?
  – Jakie podtematy pokrywa konkurencja?
→ Dodaj te elementy do swoich artykułów
→ Nie upychaj – pisz naturalnie, ale compleksowo

  1. Optymalizacja zaangażowania użytkownika

→ Dodaj interactive elements:
  – Kalkulatory, wykresy
  – Quizy 
  – Checklists (do wydrukowania/pobrania)
  – Tabelki i porównania 
→ Mierz zaangażowanie: scroll, czas na stronie, pv/sesje

Projekty Długoterminowe:

Technical SEO dla lepszego crawlowania, indeksowania oraz wsparcia mechanizmów EEAT czyli między innymi:

  • branding SEO – analiza obecności marki w Google
  • technical author optimisation
  • dane strukturalne
  • mapy witryn, rss, robots.txt, czas ładowania
  • strktura i optymalizacja treści
  • optymalizacja multimediów
  • itd.

📚 Podsumowanie: nowa era transparentności

Wiemy, że:

  • Navboost używa 13 miesięcy danych o kliknięciach do rankingu,
  • Glue zbiera każdy aspekt interakcji użytkownika z SERP,
  • RankEmbed używa AI do semantic matching i jest szczególnie skuteczny dla long-tail,
  • quality, popularity i spam scores określają częstotliwość crawlowania,
  • user signals (CTR, czas na stronie) nie są mitem – są w centrum algorytmu

To nie są spekulacje. To nie są testy. To zeznania pod przysięgą wiceprezesów Google, potwierdzone przez sąd federalny.

🔗 Źródła 

United States v. Google LLC, Case No. 20-cv-3010 (APM), Memorandum Opinion (D.D.C. Sept. 2, 2025)