Anubis – ochrona serwerów przed zautomatyzowanym skrobaniem danych
Dowiedz się, jak system Anubis chroni serwery przed agresywnym skrobaniem przez boty AI.
System Anubis to rozwiązanie techniczne wdrożone przez administratorów serwera Infokatowice.pl w celu ochrony przed agresywnym skrobaniem danych przez zautomatyzowane narzędzia, szczególnie wykorzystywane przez firmy zajmujące się sztuczną inteligencją.
Czym jest skrobanie danych i jakie problemy powoduje?
Skrobanie danych (web scraping) to proces automatycznego pobierania zawartości ze stron internetowych za pomocą botów i skryptów. Choć sama technika ma wiele legalnych zastosowań – od agregacji informacji po analizę konkurencji – masowe i agresywne skrobanie stanowi poważny problem dla operatorów serwisów.
Kiedy boty pracują na dużą skalę, generują ogromną liczbę żądań do serwera w krótkim czasie. Prowadzi to do znacznego obciążenia infrastruktury, powodując przestoje i niedostępność zasobów dla zwykłych użytkowników. Dla serwisów informacyjnych, katalogów czy platform edukacyjnych oznacza to utratę dostępu do treści dla rzeczywistych odwiedzających, a także wzrost kosztów utrzymania serwerów zdolnych do obsługi takiego natężenia ruchu.
Jak działa ochrona poprzez Proof-of-Work?
Anubis wykorzystuje schemat Proof-of-Work (dowód pracy) wzorowany na algorytmie Hashcash, znanym z technologii blockchain i ochrony przed spamem e-mailowym. Idea jest prosta, ale skuteczna: przed udzieleniem dostępu do zasobów serwera, system wymaga od odwiedzającego wykonania pewnego obliczeniowego zadania weryfikacyjnego.
Zadanie to jest na tyle proste, że zwykły użytkownik siedący przy komputerze nie zauważy opóźnienia – jego przeglądarka wykonuje obliczenia w tle w ciągu ułamków sekundy. Jednak dla bota próbującego pobrać tysiące stron jednocześnie sytuacja wygląda zupełnie inaczej. Każde żądanie wymaga osobnego rozwiązania problemu obliczeniowego, co drastycznie zwiększa całkowity czas i zasoby potrzebne do przeprowadzenia ataku.
W rezultacie koszt masowego skrobania – zarówno w sensie czasu procesora, jak i energii elektrycznej – staje się ekonomicznie nieuzasadniony. Większość automatycznych narzędzi, zwłaszcza te używane do trenowania modeli sztucznej inteligencji, szuka łatwych celów. Gdy napotkają opór w postaci Anubis, zwykle przechodzą do innych źródeł.
Wymagania techniczne i kompatybilność przeglądarek
System Anubis wymaga nowoczesnych funkcji JavaScript do prawidłowego działania. Oznacza to, że przeglądarki internetowe muszą obsługiwać zaawansowane możliwości wykonywania kodu w przeglądarce. Standardowe przeglądarki – Chrome, Firefox, Safari, Edge – nie mają z tym problemu.
Jednak pojawia się komplikacja dla użytkowników dbających o swoją prywatność. Rozszerzenia takie jak JShelter i podobne wtyczki do przeglądarek zostały zaprojektowane, aby blokować lub ograniczać pewne funkcje JavaScript, które mogą być wykorzystywane do śledzenia użytkowników lub zbierania danych o nich. Niestety, te same funkcje są niezbędne do działania Anubis.
Użytkownicy korzystający z takimi rozszerzeniami mogą napotkać problemy z dostępem do serwera – przeglądarka może być zablokowana lub dostęp może być opóźniony, ponieważ system nie będzie w stanie prawidłowo zweryfikować, że żądanie pochodzi od rzeczywistego użytkownika, a nie od bota.
Identyfikacja przeglądarek automatycznych
Jednym z planowanych usprawnień systemu Anubis jest zdolność do identyfikacji przeglądarek headless – czyli automatycznych przeglądarek bez interfejsu graficznego, które są powszechnie używane do tworzenia botów i automatyzacji zadań.
Technika polega na analizie sposobu, w jaki przeglądarka renderuje (wyświetla) czcionki. Przeglądarki headless, ponieważ nie mają graficznego interfejsu użytkownika, mogą różnić się w sposobie obsługi czcionek od zwykłych przeglądarek. Poprzez monitorowanie tych różnic, system może rozróżnić rzeczywistych użytkowników od zautomatyzowanych narzędzi.
To podejście jest bardziej zaawansowane niż proste sprawdzenie user-agenta (identyfikatora przeglądarki), ponieważ boty mogą łatwo sfałszować tę informację. Analiza renderowania czcionek jest trudniejsza do obejścia bez rzeczywistego uruchomienia pełnej przeglądarki z interfejsem graficznym.
Co to oznacza dla Ciebie?
Jeśli jesteś zwykłym użytkownikiem serwisu Infokatowice.pl lub podobnych stron z wdrożonym systemem Anubis, w większości przypadków nie zauważysz żadnej różnicy w dostępie do treści. Twoja przeglądarka automatycznie rozwiąże zadanie weryfikacyjne, a ty będziesz mieć dostęp do zasobów bez opóźnień.
Jeśli jednak korzystasz z rozszerzeń prywatności blokujących JavaScript, możesz doświadczyć problemów z dostępem. W takim przypadku masz kilka opcji: tymczasowo wyłączyć rozszerzenie dla danej domeny, zmienić ustawienia rozszerzenia, aby pozwoliło na wymagane funkcje, lub skontaktować się z administracją serwisu w celu uzyskania dodatkowej pomocy.
Dla operatorów serwisów Anubis stanowi praktyczne rozwiązanie problemu, który dotyka coraz więcej witryn – ochronę przed masowym skrobaniem bez konieczności inwestowania w droższe systemy zabezpieczeń lub znacznie zwiększoną infrastrukturę serwerową. Zmniejszenie obciążenia serwerów bezpośrednio przekłada się na niższe koszty utrzymania i lepszą dostępność usługi dla wszystkich użytkowników.
Najczęstsze pytania
Co to jest skrobanie danych i dlaczego stanowi problem?
Skrobanie (web scraping) to automatyczne pobieranie zawartości ze stron internetowych. Gdy wykonywane na dużą skalę przez firmy AI, może przeciążać serwery, powodując ich niedostępność i przestoje dla zwykłych użytkowników.
Jak działa system Anubis?
Anubis wykorzystuje schemat Proof-of-Work wzorowany na Hashcash, który wymaga od odwiedzającego wykonania obliczeniowego zadania weryfikacyjnego. To zwiększa koszt masowego skrobania i zniechęca do automatycznych ataków.
Czy Anubis wpływa na zwykłych użytkowników?
System wymaga nowoczesnych funkcji JavaScript, które są dostępne w standardowych przeglądarkach. Problemy mogą pojawić się u użytkowników korzystających z rozszerzeń prywatności, takich jak JShelter, które blokują wymagane funkcje.
Jakie przeglądarki mogą być blokowane przez Anubis?
System planuje identyfikować przeglądarki headless (automatyczne, bez interfejsu graficznego) poprzez analizę renderowania czcionek – to pozwala rozróżnić boty od rzeczywistych użytkowników.
Czy ochrona przed skrobaniem wpływa na koszty hostingu?
Tak – poprzez utrudnienie masowego pobierania danych, system zmniejsza obciążenie serwerów, co może prowadzić do redukcji kosztów infrastruktury i lepszej dostępności dla legalnych odwiedzających.
Na podstawie: Infokatowice.pl. Tekst opracowany redakcyjnie.