Cineva întreabă ChatGPT ce firmă de contabilitate să aleagă în orașul lui, sau întreabă Perplexity care e diferența dintre două tipuri de asigurări. Răspunsul vine cu trei-patru surse. Site-ul tău nu e printre ele, deși ai pagini bune pe exact subiectul acela. Concurentul tău apare.
Primul reflex e să cauți un loc unde „trimiți site-ul la ChatGPT”. Nu există așa ceva. Nu e nicio consolă unde înscrii domeniul. Ce există sunt trei condiții tehnice pe care site-ul le îndeplinește sau nu, plus un fel de a scrie care face conținutul ușor de citat.
Mai jos vezi de unde își iau răspunsurile aceste modele, ce roboți trimit pe site, unde se blochează fără să știi, ce ai de făcut în Bing și cum verifici dacă ești citat.
De unde își iau răspunsurile ChatGPT, Claude, Perplexity și Copilot
Un model de limbaj are două surse de informație. Prima e ce a învățat la antrenare, un text uriaș adunat cu luni înainte, din care nu poate cita o pagină precisă. A doua e căutarea în timp real: modelul caută pe web, citește câteva pagini și răspunde cu link către ele. Sursele din răspuns vin de aici.
Căutarea nu e făcută de la zero de fiecare companie. ChatGPT, când folosește căutarea web, se sprijină pe indexul Bing. Copilot, produsul Microsoft, folosește tot Bing. Perplexity are propriul robot și propriul index, dar completează cu rezultate din motoarele tradiționale. Claude, de la Anthropic, are și el un robot propriu și folosește motoare de căutare existente când răspunde cu surse.
De aici rezultă trei lucruri de verificat, în ordinea asta:
- Roboții AI să nu fie blocați pe site, nici din greșeală, nici de o setare pe care n-ai pus-o tu.
- Conținutul să fie citibil fără JavaScript și structurat clar, ca un robot să-l înțeleagă dintr-o singură citire.
- Site-ul să fie indexat în Bing, nu doar în Google. Fără Bing, ChatGPT și Copilot nu au de unde să te ia.
Ce roboți vin pe site și ce face fiecare
Fiecare companie trimite mai mulți roboți, cu roluri diferite. Se identifică prin user agent, numele pe care îl declară la fiecare cerere.
| Robot | Cine îl trimite | La ce folosește |
|---|---|---|
GPTBot |
OpenAI | Antrenarea modelelor |
OAI-SearchBot |
OpenAI | Căutarea din ChatGPT; fără el nu apari ca sursă |
ChatGPT-User |
OpenAI | Când un utilizator cere o pagină în conversație |
ClaudeBot |
Anthropic | Colectare pentru antrenare |
Claude-User |
Anthropic | Când Claude deschide o pagină pentru un utilizator |
PerplexityBot |
Perplexity | Indexul propriu de căutare |
Perplexity-User |
Perplexity | Când un utilizator cere o pagină anume |
Bingbot |
Microsoft | Indexul Bing, deci și Copilot și căutarea ChatGPT |
Google-Extended |
Controlează folosirea pentru Gemini; nu afectează căutarea Google | |
Applebot-Extended |
Apple | Controlează folosirea pentru modelele Apple |
CCBot |
Common Crawl | Arhivă publică din care se antrenează multe modele |
Meta-ExternalAgent |
Meta | Antrenare și produse AI ale Meta |
Amazonbot |
Amazon | Alexa și produse Amazon |
Antrenare sau căutare: poți bloca una și permite cealaltă
Fiecare companie are un robot de antrenare și unul de căutare, separat, ca să poți decide diferit. Dacă nu vrei ca textele tale să ajungă în datele de antrenare, blochezi GPTBot și ClaudeBot. Dacă vrei să apari în răspunsuri când cineva caută, lași deschiși OAI-SearchBot, ChatGPT-User, Claude-User, PerplexityBot și Perplexity-User.
În robots.txt, asta înseamnă un bloc User-agent: GPTBot cu Disallow: /, la fel pentru ClaudeBot, și câte un bloc cu Allow: / pentru roboții de căutare. Lista actualizată a roboților OpenAI, cu adresele IP de verificare, e în documentația OpenAI despre roboți.
Unde se blochează roboții fără să știi
Cele mai multe site-uri care nu apar în răspunsurile AI nu au decis asta. Le-a blocat o setare implicită sau un plugin pus demult. Unde se întâmplă:
- robots.txt. Un
Disallow: /rămas de la perioada de dezvoltare, sau reguli adăugate „pentru orice eventualitate” de un plugin SEO. - Cloudflare. Două setări contează: „AI bots blocking”, care taie toți roboții AI cunoscuți, inclusiv pe cei de căutare, și „Managed robots.txt”, care adaugă automat reguli de blocare în fișierul tău fără ca tu să le vezi în WordPress. Ambele sunt pornite implicit pe multe conturi.
- Reguli WAF. O regulă care respinge cererile cu user agent care conține „bot” prinde și roboții buni.
- Plugin-uri de securitate. Au liste de user agent-uri blocate. Cineva a adăugat cândva „GPTBot” după un articol alarmist și a uitat.
Cum verifici în zece minute
- Deschide
domeniultau.ro/robots.txtîn browser. Dacă apar blocuri pentru GPTBot sau ClaudeBot pe care nu le recunoști, vin de la Cloudflare sau de la un plugin. - Fă o cerere cu user agent de robot AI, dintr-un terminal:
curl -A "OAI-SearchBot" -I https://domeniultau.ro/. Dacă primești 200, e bine. Dacă primești 403 sau o pagină de verificare Cloudflare, ești blocat. - Repetă cu
PerplexityBot,Claude-Userșibingbot. - Caută aceste nume în jurnalele serverului sau în Cloudflare Analytics. Dacă în ultimele 30 de zile nu apare nicio cerere de la
bingbot, ai o problemă de indexare, nu de conținut. - În Cloudflare, la Security și apoi Bots, verifică „AI bots” și „Managed robots.txt”. Oprește-le sau lasă blocați doar roboții de antrenare.
Cloudflare poate suprascrie robots.txt fără ca fișierul din WordPress să se schimbe. Verifică întotdeauna adresa publică, nu ce ai în editor.
Bing: indexul pe care îl folosesc ChatGPT și Copilot
Multe firme au site-ul verificat în Google Search Console și nicăieri altundeva. Pentru ChatGPT și Copilot nu e suficient, pentru că ele nu citesc indexul Google. Dacă Bing nu te are, nu exiști pentru ele.
Ce ai de făcut în Bing Webmaster Tools:
- Creează un cont cu adresa de Microsoft sau Google a firmei.
- La adăugarea site-ului, alege importul din Google Search Console. Bing preia proprietățile verificate acolo, fără alt fișier de verificare.
- Trimite sitemap-ul. În WordPress e de obicei la
/sitemap.xmlsau/sitemap_index.xml, în funcție de plugin-ul SEO. - După câteva zile, verifică în raportul de indexare câte pagini au intrat și dacă apar erori de accesare.
IndexNow: site-ul anunță singur când publică ceva
IndexNow e un protocol prin care site-ul trimite un semnal la fiecare publicare sau modificare de pagină, în loc să aștepte ca robotul să revină. Semnalul ajunge la Bing, Yandex, Naver și Seznam dintr-o singură cerere. Funcționează așa: generezi o cheie, o pui într-un fișier text la rădăcina domeniului (de exemplu /abc123.txt, cu cheia înăuntru), apoi la fiecare publicare site-ul trimite o cerere POST la api.indexnow.org cu adresele schimbate. Detaliile sunt pe site-ul oficial IndexNow.
În WordPress îl ai prin plugin-uri (mai multe plugin-uri SEO îl includ, plus cel oficial de la Bing) sau prin câteva linii de cod propriu. Nu garantează indexarea, dar scurtează mult timpul până când Bing află de o pagină nouă. Merită să intre în rutina de optimizare a site-ului.
Ce e llms.txt și ce pui în el
llms.txt e un fișier text la domeniultau.ro/llms.txt, propus în 2024 ca un fel de robots.txt pentru modele de limbaj: nu spune ce e interzis, ci ce e important. Scopul e ca un model care ajunge pe site să înțeleagă rapid despre ce e vorba, fără să parcurgă meniuri, cookie-uri și subsoluri.
Conținutul e simplu, scris în Markdown:
- Un titlu cu numele firmei sau al site-ului.
- Un paragraf scurt: ce faceți, pentru cine, unde.
- Liste de linkuri către paginile principale, grupate pe teme (servicii, ghiduri, contact), fiecare cu o descriere de o propoziție.
- Opțional, o secțiune cu linkuri secundare, marcată ca fiind mai puțin importantă.
Onest spus: nici OpenAI, nici Google nu au declarat că folosesc llms.txt. E o propunere, nu un standard. Îl pui pentru că durează un sfert de oră și nu strică. Trateaz-o ca pe un rezumat bun al site-ului, nu ca pe o soluție de vizibilitate.
Ce pagini citează modelele și ce se pierde pe drum
Un model care caută primește câteva pagini și trebuie să scoată din ele un răspuns în câteva secunde. Citează paginile din care extrage ușor o afirmație clară. În practică:
- Răspunsuri directe. O secțiune cu titlul „Cât durează omologarea unei centrale termice” care începe cu răspunsul, nu cu istoricul firmei.
- Titluri care spun ceva. H2 și H3 care pot fi citite ca o listă de întrebări și răspunsuri.
- Definiții, liste, tabele. Un tabel cu prețuri sau termene e mai ușor de citat decât trei paragrafe care le descriu.
- Date explicite. Cine, când, cât, unde. „Din 2015, în București, echipă de 12 persoane” bate „experiență vastă, echipă dedicată”.
- Autor și organizație identificabile. Schema
Organizationpe site,Personpentru autori,Articlepe articole. - O pagină „Despre” credibilă, cu nume reale, adresă, an de înființare, ce face concret firma.
- Coerență cu profilurile publice. Numele, adresa și descrierea din site să se potrivească cu profilul Google Business, LinkedIn și registrul comerțului.
Ce se pierde des:
- Conținut randat doar din JavaScript. Multe teme și constructori de pagini încarcă textul după ce pagina s-a deschis. Roboții modelelor citesc de obicei HTML-ul brut; dacă textul nu e acolo, pagina e goală pentru ei.
- Acordeoane și tab-uri complicate. Un acordeon cu textul prezent în HTML e în regulă. Unul care încarcă textul la clic, prin cerere separată, nu e.
- Text în imagini. Prețuri, orare sau liste puse ca imagine nu se citesc.
Toate acestea sunt și principii bune de conținut pentru Google. Nu scrii altfel pentru AI: scrii clar, cu date și structură.
Un test rapid: rulează curl -A "OAI-SearchBot" https://domeniultau.ro/pagina-importanta/ și caută în răspuns paragraful principal. Ce vezi acolo e ce vede și robotul. Dacă primești doar un schelet cu scripturi, conținutul nu ajunge la model.
Cum verifici dacă ești citat
Nu există încă un raport oficial de tipul Search Console pentru ChatGPT sau Perplexity. Ce poți face:
- Întreabă direct modelele. Pune în ChatGPT (cu căutarea pornită), Claude, Perplexity și Copilot întrebările pe care le-ar pune un client de-al tău. Nu întreba de firma ta, întreabă de problema pe care o rezolvi. Caută domeniul tău în text și în panoul de surse. Repetă lunar, cu aceleași întrebări.
- Urmărește referrer-ul în Analytics. Traficul din răspunsuri AI apare cu sursa
chatgpt.com,perplexity.aisaucopilot.microsoft.com. Filtrează sesiunile după aceste domenii și salvează raportul. - Urmărește jurnalele. Cereri de la
ChatGPT-UsersauPerplexity-Userînseamnă că utilizatorii deschid paginile tale din conversații.
Rezultatele vin lent, în săptămâni. Dacă ai făcut tot ce e mai jos și nu vezi nimic după două luni, problema e de conținut, nu de acces.
Lista de verificare
- Citește
robots.txtla adresa publică și elimină blocările pe care nu le-ai vrut. - În Cloudflare, oprește „AI bots blocking” și „Managed robots.txt” sau lasă blocați doar roboții de antrenare.
- Verifică listele de user agent-uri blocate din plugin-ul de securitate și din regulile WAF.
- Testează cu
curl -ApentruOAI-SearchBot,PerplexityBot,Claude-Userșibingbot; toate trebuie să primească 200. - Adaugă site-ul în Bing Webmaster Tools prin import din Google Search Console și trimite sitemap-ul.
- Activează IndexNow printr-un plugin sau prin cod propriu.
- Pune schema
Organizationpe site șiArticlecu autor pe articole. - Verifică pagina „Despre”: nume, adresă, an, echipă, date care se potrivesc cu profilurile publice.
- Deschide sursa paginilor importante și confirmă că textul e în HTML, nu doar încărcat din JavaScript.
- Publică
llms.txtcu descrierea site-ului și paginile principale.
Deschide domeniultau.ro/robots.txt în browser și citește-l rând cu rând. Apoi intră în Cloudflare, la Security și Bots, și uită-te dacă „AI bots blocking” și „Managed robots.txt” sunt pornite. Dacă găsești o blocare pe care nu ai pus-o tu, ai găsit și motivul pentru care nu apari.