4
Testowane strony
14
Przetestowane opcje
6
Darmowych działa
8
Płatnych opcji

💡 Szybki start — konfiguracja Hermes

Włącz toolset web i skonfiguruj backend:

hermes tools enable web
hermes tools enable browser
# Po resecie sesji (/reset) masz web_search i web_extract

Obecny stan: web ✅ włączony, browser ✅ włączony. Backend: search_backend: duckduckgo, extract_backend: jina (skonfigurowane w profilu CEO).

🟢 Darmowe opcje — przetestowane

✅ DZIAŁA

💡 curl + User-Agent (Google, Facebook)

Koszt: 0 🏷Limit: brak

Zwykły curl z odpowiednim User-Agentem działa na Google i Facebooku. Nie działa na x.com (Cloudflare 403) i reddit.com (403).

curl -sL -A "Mozilla/5.0 (Windows NT 10.0; Win64; x64) Chrome/124" https://www.google.com/
Werddykt: Google ✅ | Facebook ✅ | X ❌ | Reddit ❌
✅ DZIAŁA

🧪 cloudscraper (X.com bypass)

Koszt: 0 🏷Limit: brak

Python cloudscraper (imitacja Cloudflare challenge) działa na x.com — bypassuje Cloudflare, ale strona to JS SPA (Next.js). Nie ma treści w surowym HTMLu. Potrzebny headless browser do renderowania. Na reddicie i facebooku nie działa.

pip3 install cloudscraper
python3 -c "import cloudscraper; r=cloudscraper.create_scraper().get('https://x.com/'); print(r.status_code)"
Werddykt: Obejście Cloudflare ✅ | Potrzebny headless do treści ⚠
✅ DZIAŁA

🌐 DuckDuckGo Lite / HTML (darmowy search)

Koszt: 0 🏷Limit: brak (rate limit ok. 1/s)

DuckDuckGo ma publiczne API (lite.duckduckgo.com, html.duckduckgo.com). Wymaga POST z form data. Zwraca czysty HTML z wynikami wyszukiwania. Idealne jako darmowy backend search dla Hermes.

curl -s -d "q=test" https://lite.duckduckgo.com/lite/ | grep -oP '(?<=class="result">).*?(?=)'
Werddykt: ⭐ Najlepsza darmowa opcja dla web_search backend
✅ DZIAŁA

📖 Jina Reader API (r.jina.ai) — content extraction

Koszt: 0 🏷Limit: ~20 req/min (anon), 1000/dzień (z API key)

Jina Reader konwertuje URL na czysty Markdown. Działa na Google. Nie działa na x.com (403) i reddit (403). Jina v2 (s.jina.ai) wymaga API key (płatny).

curl -s -H "Accept: text/plain" https://r.jina.ai/https://example.com
Werddykt: Działa dla prostych stron. Blokowany przez Cloudflare.
✅ DZIAŁA (warunkowo)

🤖 Google Search przez curl

Koszt: 0 🏷Limit: ~200 zapytań/dzień

Google Search zwraca HTTP 200 z curl, ale wyniki są w JS-renderowanych elementach. Potrzebny BeautifulSoup do ekstrakcji. Google zmienia strukturę HTML często.

Werddykt: Działa ale niepewny. Preferuj DuckDuckGo jako darmowy search.
✅ DZIAŁA (warunkowo)

🖥 Cloudflare Browser Run (Free Tier)

Koszt: 0 🏷 (Free: 100k req/dzień)Limit: 100k req/dzień na Free

Cloudflare Browser Run (dawniej Browser Rendering) to headless Chrome na Workers. Renderuje JS SPA (x.com, reddit). Zamienia strony na Markdown. Wymaga konta Cloudflare i Workers.

# Worker code:
const browser = await puppeteer.launch();
const page = await browser.newPage();
await page.goto('https://x.com/');
const markdown = await page.evaluate(() => document.body.innerText);
Werddykt: ⭐ Najlepsza darmowa opcja dla SPA (x.com, reddit). Wymaga konfiguracji.
❌ NIE DZIAŁA

🐧 Reddit RSS / JSON API / Nitter / Teddit

Koszt: 0 🏷

Wszystkie alternatywne frontendy Reddita i X.com są blokowane. Reddit blokuje nawet RSS i JSON API (HTTP 403). Nitter (X) zwraca 0 bajtów. Teddit ma błędy SSL.

Werddykt: Reddit i X są bardzo agresywnie blokowane. Potrzebny headless browser lub API.

🔵 Płatne opcje

🔍 SerpAPI

Koszt: $25/mo (Starter, 1k searches)Limit: 200 req/h

Google Search API. Structured JSON. Działa tylko na Google. Najpopularniejszy backend dla AI agentów. Natywnie wspierany przez Hermes przez web.search_backend?

Werddykt: Dobry dla Google, ale nie obsługuje X/Reddit/Facebook. Drogi.

🌐 Serper.dev

Koszt: $50/mo (5k queries)Limit: 300 req/min

Tańsza alternatywa dla SerpAPI. Google + News. Szybki, czysty JSON. Często używany przez AI agentów.

Werddykt: Najlepszy stosunek cena/wydajność dla Google search.

🌀 BrightData (dawniej Luminati)

Koszt: ~$0.008/request (pay-as-you-go)Min: $50 depozyt

Proxy + scraping API. Obsługuje wszystkie strony (Google, X, Reddit, Facebook). Sieć proxy + headless browser. Największy dostawca.

Werddykt: ⭐ Jedno rozwiązanie dla wszystkich stron. Działa na X, Reddit, Facebook.

🧰 ZenRows

Koszt: $49/mo (50k req)Limit: 50k req/mo

Specjalizuje się w bypassowaniu Cloudflare. Proxy + headless browser. Działa na x.com, reddit, google. Ma API do AI agentów.

Werddykt: ⭐ Najlepszy do bypassowania Cloudflare i JS SPA. Działa x.com, reddit.

⚡ ScrapingBee

Koszt: $49/mo (50k req)Limit: 50k req/mo

API + headless browser. Obsługuje JS rendering. Anti-bot bypass. Działa na Google, X, Reddit.

Werddykt: Dobry, ale droższy od ZenRows przy podobnych możliwościach.

💻 Browserbase

Koszt: $30/mo (Starter, 100h)Limit: 100h browser time/mo

Cloud headless browser. Sterowany przez Puppeteer/Playwright. Pełna kontrola nad przeglądarką. Działa na wszystkich stronach. Wymaga integracji.

Werddykt: Najlepszy dla developerskiej kontroli. Działa na wszystkim.

⚡ Apify

Koszt: $0 (Free: 5$ credit/mo)Limit: $5/mo free, potem $49

Platforma scrapingowa z gotowymi aktorami (Google Search, X, Reddit, Facebook scraper). Gotowe aktory, nie trzeba kodować. REST API.

Werddykt: ⭐ Najlepsze free tier. Gotowe scrapery na X, Reddit, Facebook.

🚧 x402 Protocol — co to jest?

x402 to propozycja protokołu HTTP oparta na kodzie 402 "Payment Required". Cloudflare promuje to jako sposób na monetyzację dostępu AI do treści stron. NIE jest to narzędzie do bypassowania Cloudflare.

Jak miałby działać:

  1. Bot/scraper wysyła żądanie do strony chronionej przez Cloudflare
  2. Serwer odpowiada HTTP 402 + nagłówek X-402-Charge z kwotą
  3. Scraper płaci (przez system Cloudflare) i dostaje token dostępu
  4. Kolejne żądania z tokenem są przepuszczane

Status na 2026: Protokół NIE został wdrożony produkcyjnie. Cloudflare prowadzi testy z wybranymi partnerami. Brak publicznego API lub stawek.

Implementacje:

Wpływ na scraping: Jeśli protokół zostanie wdrożony, scraping x.com/reddit/facebook może stać się płatny — ale legalny i oficjalny. Na ten moment — obserwować, nie używać.

🚫 Cloudflare Turnstile — dlaczego blokuje?

Cloudflare Turnstile (następca CAPTCHA) to system ochrony przed botami. Analizuje:

Dlaczego cloudscraper nie wystarcza: cloudscraper radzi sobie tylko ze starymi JS challenge. Turnstile wymaga pełnego środowiska przeglądarki (canvas, WebGL, czcionki). Potrzebujesz prawdziwej przeglądarki (Puppeteer/Playwright) + stealth plugin + dobre proxy.

Co działa na Turnstile: Browserbase, ZenRows (płatne), BrightData Web Unlocker, 2Captcha/Capsolver. Nie działa: curl, requests, cloudscraper, zwykłe headless Chrome bez stealth.

🏆 Ranking końcowy narzędzi

#NarzędzieOcenaKoszt/mies.Działa na
1Browserbase⭐⭐⭐⭐⭐$30Wszystkie (headless browser, JS SPA)
2ZenRows⭐⭐⭐⭐⭐$49Wszystkie (bypass Cloudflare)
3Serper.dev⭐⭐⭐⭐⭐$50Google Search API
4Apify⭐⭐⭐⭐$0-49Gotowe scrapery X, Reddit, Google, FB
5BrightData⭐⭐⭐⭐~$0.008/reqWszystkie (proxy + unlocker)
6Jina Reader⭐⭐⭐$0Google, proste strony
7SearXNG⭐⭐⭐$0Wyszukiwanie (self-hosted)
8cloudscraper⭐⭐$0Stare Cloudflare, nie SPA
9ScrapingBee⭐⭐$49Wolne (1 req/s)
10Crawlee⭐⭐$0Node.js, wymaga proxy

📊 Tabela porównawcza

OpcjaTypKoszt/mies.GoogleX.comRedditFB
curl + UAFree$0
cloudscraperFree$0⚠ (tylko bypass)
DuckDuckGo LiteFree$0search---
Jina ReaderFree$0
Cloudflare BrowserRunFree/Paid$0-5
SerpAPIPaid$25search---
Serper.devPaid$50search---
BrightDataPaid~$12/mo
ZenRowsPaid$49
BrowserbasePaid$30
ApifyFreemium$0-49

🎯 Rekomendacje

⭐ Scenariusz 1: Tylko darmowe opcje

1. DuckDuckGo Lite -> web_search backend (darmowy, bez limitów)
2. curl + BS4 -> Google (działa)
3. cloudscraper -> x.com bypass (ale bez treści)
4. Cloudflare Browser Run -> x.com / reddit content (free tier, 100k req/dzień)
5. Jina Reader -> proste strony na markdown
Koszt: $0/mies. Wymaga konfiguracji Cloudflare Workers.

⭐ Scenariusz 2: Budżetowy ($5-10/mies.)

1. Cloudflare Workers Paid ($5/mo) + Browser Run
   - Renderowanie x.com, reddit, facebook
   - Markdown output
   - 10M req/mo
2. DuckDuckGo Lite (search, darmowy)
3. Własny Worker proxy do scrapowania
Koszt: $5-10/mies. Wszystkie strony działają.

⭐ Scenariusz 3: Enterprise (bez konfiguracji)

1. Apify (free $5 credit) -> gotowe scrapery X, Reddit, Google
2. Lub: ZenRows ($49) -> Cloudflare bypass + JS rendering
3. Lub: BrightData (pay-as-you-go) -> proxy + headless
Koszt: $0-49/mies. Zero konfiguracji, gotowe API.

📦 Konfiguracja w Hermes

Aby web_search działał w Hermes, ustaw w ~/.hermes/profiles/ceo/config.yaml:

web:
  search_backend: duckduckgo   # lub "searxng" jeśli self-hosted
  extract_backend: jina        # lub "native"

Dla SearXNG self-hosted ustaw zmienną środowiskową:

export SEARXNG_URL=http://localhost:8080
# lub w .env:
SEARXNG_URL=http://localhost:8080

Po zmianie configu zrób /reset w sesji.

📝 Źródła

📥 Pliki źródłowe