Anubis: jak serwery bronią się przed masowym skrobaniem AI
System Anubis chroni strony przed agresywnym skrobaniem danych przez boty AI. Dowiedz się, jak działa ta technologia i co oznacza dla użytkowników przeglądarek.
System Anubis to technologia ochrony serwerów przed masowym skrobaniem danych przez zautomatyzowane boty, szczególnie te napędzane sztuczną inteligencją. Administrator serwisu Infokatowice.pl wdrożył to rozwiązanie, aby chronić infrastrukturę przed agresywnym pobieraniem zawartości.
Dlaczego skrobanie danych stanowi rzeczywisty problem?
Masowe pobieranie danych przez boty to nie tylko kwestia prywatności czy praw autorskich. Zautomatyzowane zapytania generują ogromne obciążenie dla serwerów, które muszą obsługiwać tysiące jednoczesnych żądań. Efektem są przestoje infrastruktury, spowolnienia dostępu do zasobów i czasowa niedostępność serwisu dla zwykłych użytkowników.
Firmy zajmujące się AI, trenując swoje modele, sięgają po zawartość stron internetowych na dużą skalę. Ta praktyka, choć z punktu widzenia firm treningowych wydaje się efektywna, w rzeczywistości destabilizuje działanie witryn, na których te dane się znajdują. Właściciele serwisów stają więc przed wyborem: albo zaakceptować straty wydajności, albo wdrożyć mechanizmy obronne.
Jak Anubis chroni serwer — mechanizm Proof-of-Work
Anubis opiera się na schemacie Proof-of-Work, algorytmie znanym z technologii blockchain, a konkretnie wzorowanym na starszym systemie Hashcash. Idea jest prosta: zanim przeglądarka uzyska dostęp do zawartości strony, musi wykonać określoną pracę obliczeniową.
W praktyce oznacza to, że każde żądanie dostępu do serwera wymaga od urządzenia użytkownika rozwiązania problemu matematycznego. Dla zwykłego odwiedzającego operacja trwa ułamek sekundy i przebiega w tle — użytkownik tego nie zauważa. Natomiast dla bota próbującego pobrać tysiące stron jednocześnie koszt operacyjny rośnie wykładniczo.
| Aspekt | Zwykły użytkownik | Bot skrobujący |
|---|---|---|
| Czas oczekiwania | Ułamki sekundy | Sekundy do minut |
| Liczba jednoczesnych żądań | 1–10 | Tysiące |
| Całkowity koszt obliczeniowy | Pomijalny | Ogromny |
| Opłacalność ataku | Zawsze | Drastycznie spadająca |
Mechanizm ten zmniejsza opłacalność masowego skrobowania. Firma AI, która chciałaby pobrać miliony stron, musiałaby zainwestować znacznie więcej zasobów obliczeniowych, co czyni całą operację ekonomicznie nieuzasadnioną.
Wymagania techniczne — rola nowoczesnego JavaScriptu
Anubis opiera się na nowoczesnych funkcjach JavaScriptu dostępnych w współczesnych przeglądarkach. System musi być w stanie wykonać obliczenia po stronie klienta, a następnie przesłać wynik do serwera w celu weryfikacji.
To właśnie tutaj pojawia się pierwszy problem praktyczny. Wtyczki prywatności, takie jak JShelter, zostały zaprojektowane, aby ograniczyć możliwości śledzenia użytkownika i chronić jego anonimowość. Niestety, jako efekt uboczny wyłączają one również funkcje JavaScriptu, które Anubis potrzebuje do działania. Użytkownik z aktywną taką wtyczką może napotkać trudności w dostępie do strony chronionej przez Anubis.
Przeglądarki headless i przyszłość identyfikacji botów
Przeglądarki headless to specjalne narzędzia, które działają bez interfejsu graficznego — są całkowicie zautomatyzowane i służą do testowania, scrapowania i innych zadań automatycznych. Boty AI często wykorzystują właśnie takie rozwiązania, ponieważ nie muszą renderować interfejsu, co znacznie przyspiesza pobieranie danych.
Identyfikacja przeglądarek headless jest wyzwaniem, ale zespół Infokatowice.pl planuje wdrożyć dodatkowy mechanizm oparty na teście renderowania czcionek. Polega on na tym, że przeglądarka musi prawidłowo wyświetlić określoną czcionkę — coś, co przeglądarki headless mogą mieć problem z wykonaniem. To byłoby dodatkową warstwą ochrony, która utrudniłaby botom imitację normalnych użytkowników.
Co to oznacza dla Ciebie jako użytkownika
Jeśli regularnie odwiedzasz strony chronione systemem Anubis, w większości przypadków nie zauważysz żadnej różnicy. Mechanizm pracuje w tle, a opóźnienie jest niemal niezauważalne na nowoczesnych urządzeniach.
Jeśli jednak korzystasz z wtyczek prywatności takich jak JShelter, możesz napotkać problemy z dostępem. W takiej sytuacji masz kilka opcji: czasowo wyłączyć wtyczkę dla danej domeny, zmienić ustawienia wtyczki (jeśli pozwala na selektywne wyłączanie funkcji) lub zaakceptować, że niektóre strony mogą być niedostępne.
Dla właścicieli stron Anubis to narzędzie, które pozwala na ochronę infrastruktury bez konieczności całkowitego blokowania botów — system je raczej zniechęca poprzez zwiększenie kosztów operacyjnych. To bardziej eleganckie rozwiązanie niż zwykły firewall, ponieważ nie uniemożliwia dostępu, lecz czyni go mniej opłacalnym dla masowych ataków.
Najczęstsze pytania
Co to jest skrobanie danych i dlaczego stanowi problem?
Skrobanie to zautomatyzowane pobieranie zawartości ze stron przez boty. Masowe skrobanie obciąża serwery, powoduje ich przestoje i uniemożliwia dostęp zwykłym użytkownikom do zasobów.
Jak działa system Anubis?
Anubis wykorzystuje mechanizm Proof-of-Work (wzorowany na algorytmie Hashcash), który wymaga od przeglądarki wykonania obliczeń przed dostępem do strony. To zwiększa koszty operacyjne dla botów skrobujących dane.
Czy Anubis wpływa na zwykłych użytkowników?
Dla normalnych odwiedzających strony system pracuje w tle. Problem pojawia się u użytkowników wtyczek prywatności, takich jak JShelter, które wyłączają funkcje JavaScript wymagane do działania Anubisa.
Jakie przeglądarki mogą mieć problemy z Anubisem?
Przeglądarki headless (bez interfejsu graficznego, używane przez boty) mogą mieć trudności. Planuje się ich identyfikacja poprzez test renderowania czcionek.
Czy mogę korzystać ze strony z wtyczkami prywatności?
Jeśli wtyczka wyłącza funkcje JavaScript wymagane przez Anubis, dostęp do strony może być utrudniony. Alternatywą jest czasowe wyłączenie wtyczki dla danej domeny.
Na podstawie: Infokatowice.pl. Tekst opracowany redakcyjnie.