Serverul meu bloca ChatGPT fără să știu. Cum am aflat, din logurile proprii

În iulie 2026, serverul acestui site a răspuns cu 403 la toate cele 90 de cereri ale boților AI, în timp ce Googlebot primea 200 la toate cele 943 ale lui. Cum am aflat, din loguri, și cum verifici tu în zece minute.

Costin Pietraru la birou, privind un monitor cu linii de log de server: printre rândurile albastre, câteva rânduri roșii marchează cererile respinse cu eroarea 403.

Timp de cel puțin trei săptămâni, serverul pe care stă acest site a răspuns cu 403 Forbidden fiecărei cereri venite de la ChatGPT, Claude sau Perplexity. În aceeași perioadă, Googlebot a făcut 943 de cereri și a primit 200 la toate. Nu era o eroare de configurare de-a mea și nu era ceva ce se vedea din site: era o politică a găzduirii, pornită la nivel de server, pe care am descoperit-o abia când am deschis logurile.

Scriu articolul acesta pentru că metoda de verificare se refolosește. Dacă ai un site și te-ai întrebat vreodată de ce ChatGPT „nu îl găsește”, în zece minute afli dacă ai aceeași problemă.

Pe scurt:

Cum arată blocajul, în cifre

Datele de mai jos sunt din Raw Access (logurile brute ale serverului, în cPanel), iulie 2026, 22.176 de linii citite integral.

User-agent Cereri IP-uri distincte Răspuns
OAI-SearchBot 43 21 403
ChatGPT-User 26 21 403
GPTBot 15 4 403
ClaudeBot 4 403
PerplexityBot 2 403
Googlebot 943 200
bingbot 225 200
YandexBot 92 200

Zecile de IP-uri distincte pentru un singur user-agent contează mai mult decât par. Prima explicație plauzibilă a unui blocaj de tipul acesta este „serverul blochează boți falși” — adică pe cineva care pretinde că e GPTBot de la o adresă care nu e a OpenAI. Tehnica e legitimă și larg folosită. Dar un impostor nu vine de la 21 de adrese diferite pentru același user-agent. Flota era reală.

Diferența dintre cele două rânduri îngroșate și restul tabelului e tot argumentul: botul care face de zece ori mai multe cereri e permis, iar cei care fac de zece ori mai puține sunt respinși.

De ce robots.txt nu dovedește nimic

robots.txt al site-ului îi permitea explicit pe toți, cu Allow: /. Nu ajuta cu nimic, din două motive.

Primul: robots.txt e o convenție, nu un mecanism. Spune ce ai voie să ceri; nu deschide nicio ușă. Blocajul meu era la nivel de server web, înainte ca cererea să ajungă la PHP — se vedea după antetul Vary: User-Agent și după faptul că pagina de eroare era una LiteSpeed, nu una WordPress.

Al doilea, descoperit mult mai târziu: fișierul pe care îl citeau boții nu era fișierul meu. Ajung acolo în două minute.

Cum verifici tu, în zece minute

Ai nevoie de curl, care e deja instalat pe Windows 10 și 11, pe macOS și pe orice Linux. Deschizi un terminal și ceri propria pagină, pretinzând pe rând că ești fiecare bot:

curl -s -o /dev/null -w "%{http_code}\n" -A "GPTBot" https://site-ul-tau.ro/
curl -s -o /dev/null -w "%{http_code}\n" -A "OAI-SearchBot" https://site-ul-tau.ro/
curl -s -o /dev/null -w "%{http_code}\n" -A "ChatGPT-User" https://site-ul-tau.ro/
curl -s -o /dev/null -w "%{http_code}\n" -A "ClaudeBot" https://site-ul-tau.ro/
curl -s -o /dev/null -w "%{http_code}\n" -A "PerplexityBot" https://site-ul-tau.ro/
curl -s -o /dev/null -w "%{http_code}\n" -A "Googlebot" https://site-ul-tau.ro/

Fiecare linie îți răspunde cu un număr. 200 înseamnă că a intrat. 403 înseamnă că a fost respins. Dacă Googlebot primește 200 și restul primesc 403, ai exact problema din articolul acesta.

Al doilea test, pe care aproape nimeni nu-l face, verifică dacă cineva îți rescrie robots.txt pe drum:

curl -s https://site-ul-tau.ro/robots.txt | wc -c

Numărul rezultat e mărimea fișierului servit. Compară-l cu mărimea fișierului tău real, de pe server. La mine erau 3.420 de octeți serviți față de 1.584 pe origine — aproape dublu. Diferența era un set de reguli injectate de proxy.

Și acum partea importantă: testele astea sunt semnal, nu verdict. Un curl pornit de pe calculatorul tău arată, din partea serverului, exact ca un impostor. Verdictul e doar în loguri, unde se vede IP-ul real al botului și codul pe care l-a primit. În cPanel: Metrics → Raw Access. Descarci fișierul, îl deschizi și cauți numele boților.

Cele trei bariere, în ordinea în care au căzut

Fiecare a fost descoperită abia după ce am reparat-o pe precedenta și tot nu mergea.

  1. 403-ul găzduirii. Blocaj global, la nivel de server, pe toate domeniile din cont. Am întrebat furnizorul și a confirmat în scris că e intenționat, ca protecție împotriva crawlerelor „foarte agresive”, cu precizarea că boții importanți pentru indexare, Googlebot și bingbot, nu sunt blocați. Pe domeniul meu, motivul nu se susține: cel permis făcea 45 de cereri pe zi, cei cinci blocați făceau 4,3 la un loc.
  2. Blocarea proprie a proxy-ului. Am mutat domeniul pe Cloudflare, iar acolo funcția „AI Crawl Control” bloca ea însăși crawlerele AI, implicit, pe zonele noi. Două bariere suprapuse, care se recunosc după mărimea paginii de eroare: ~650 de octeți era blocajul proxy-ului, 787 era 403-ul originii.
  3. robots.txt rescris de proxy. Aici am pierdut cel mai mult timp. După ce toate testele ieșeau 200, ChatGPT continua să spună că nu poate accesa site-ul. Cauza: același „AI Crawl Control” are două componente independente, care se opresc separat — blocarea la nivel de rețea și gestionarea automată a robots.txt. A doua injecta, înaintea regulilor mele, grupuri cu Disallow: / pentru GPTBot, ClaudeBot, CCBot, Google-Extended și altele. Regulile mele, cu Allow: /, veneau mai jos și nu mai contau: multe crawlere aplică primul grup potrivit și se opresc acolo.

Lecția care mi-a costat cele mai multe ore: robots.txt e prima poartă. Botul îl citește înainte de a cere pagina. Dacă acolo scrie „nu ai voie”, nu ajunge niciodată la pagina ta, oricât de deschis ar fi restul.

Ce am făcut și ce nu am reparat

Am pus un Cloudflare Worker care schimbă User-Agent-ul celor șapte boți AI într-unul de browser obișnuit, înainte ca cererea să plece spre server, și păstrează originalul într-un antet separat. Apoi am oprit gestionarea automată a robots.txt. După asta, toți boții AI primesc 200, cu același conținut pe care îl primește un om.

Trebuie spus limpede ce este soluția aceasta: o ocolire, nu o reparație. Serverul blochează în continuare. Dacă mâine scot Cloudflare din față, blocajul reapare a doua zi. Tichetul la găzduire a rămas deschis, cu o cerere simplă: excepție pentru domeniu, sau limitare de rată în loc de blocare totală.

Ce nu rezolvă asta

Deblocarea nu înseamnă că un asistent AI o să te citeze. Înseamnă doar că poate ajunge la text. E condiția necesară, nu cea suficientă — dacă pagina nu răspunde clar la o întrebare pe care o pune cineva, faptul că e accesibilă nu schimbă nimic.

Nu rezolvă nici indexarea. Sunt lucruri separate: un motor te poate citi și, în același timp, să nu te arate nimănui. Am scris separat despre ce se schimbă când munca o fac agenții AI — acolo e partea de fond; aici e doar poarta de la intrare.

Și nu spune nimic despre poziția ta în Google. Googlebot nu era blocat niciodată. Toată povestea asta a fost, tot timpul, despre cine altcineva îți citește site-ul în afară de Google.

Ce fac cu informația asta

Verificarea de mai sus, cele cinci comenzi și comparația de mărime, se poate face o dată pe lună de mână. Se poate și programa, ca să te anunțe singură când un cod de răspuns se schimbă — asta construiesc pentru mine și e genul de muncă mecanică pe care o automatizez și pentru firme: interoghez, compar, anunț dacă s-a schimbat ceva. Nu promit poziții, nu promit citări; anunț când o ușă s-a închis.

Sunt inginer, lucrez cu sisteme de treizeci de ani și am scris SimpluSPV, folosit azi de firme și de contabili. Articolul acesta e exact felul în care lucrez, și l-am mai arătat o dată, punând șase agenți AI să se contrazică pe o decizie de-a mea: măsor, notez cifrele, și public și partea în care m-am înșelat de două ori până am găsit a treia barieră.

Întrebări frecvente

Cum știu dacă serverul meu blochează boții AI?

Rulezi comenzile curl din articol, cu fiecare user-agent pe rând. Dacă Googlebot primește 200 și GPTBot primește 403, ai un blocaj selectiv. Confirmarea se ia din logurile serverului, în cPanel la Metrics → Raw Access, unde vezi IP-ul real al botului și codul primit.

robots.txt nu e de ajuns ca să dau voie boților?

Nu. robots.txt spune ce are voie să ceară un bot, dar nu deschide nicio ușă. Dacă serverul sau proxy-ul din față resping cererea, permisiunea din robots.txt nu contează. În plus, fișierul servit poate fi rescris pe drum — compară-i mărimea cu a celui de pe server.

De ce ar bloca o găzduire ChatGPT, dar nu Google?

Motivul invocat este consumul de resurse: crawlerele AI sunt considerate agresive, iar Googlebot și bingbot sunt tratate ca esențiale pentru indexare. Pe un site mic, argumentul se verifică ușor în loguri. La mine, botul permis făcea de zece ori mai multe cereri decât toți cei blocați la un loc.

Ce este ChatGPT-User și de ce contează mai mult decât GPTBot?

GPTBot este crawlerul care adună conținut. ChatGPT-User se declanșează doar când un om îi cere lui ChatGPT, în timp real, o anumită adresă. Cele 26 de cereri respinse din logurile mele înseamnă 26 de oameni care au vrut să deschidă o pagină de pe site prin ChatGPT și n-au putut.

Am reparat blocajul. Când se vede rezultatul?

Nu imediat și nu garantat. Accesul e doar prima condiție: după el urmează recitirea site-ului de către fiecare motor, iar apoi rămâne întrebarea dacă răspunzi mai bine decât altcineva la întrebarea omului. Ce poți măsura sigur, în câteva zile, e că boții primesc 200 în loc de 403.


Datele din acest articol vin din logurile serverului simpluspv.eu, iulie 2026, și din testele proprii din 22–23 iulie 2026. Nu sunt estimări.

#agenți AI
Costin Pietraru
Scris de

Costin Pietraru

Inginer cu 30+ ani în sisteme, fondator SimpluSPV. Livrează cursul de AI pentru firme și scrie despre automatizare aplicată — fără teorie, doar sisteme care lucrează.

Vezi profilul complet →

Vrei firma pregătită pentru AI, corect și legal?

4 ședințe aplicate, echipa pleacă cu sisteme reale și documentele de conformitate. Garanție bani înapoi după 2 ședințe.

Înscrie echipa la curs →