Το αρχείο robots.txt αποτελεί ένα απλό έγγραφο κειμένου (plain text) που τοποθετείται στον ριζικό κατάλογο (root directory) ενός ιστότοπου. Ο ρόλος του είναι να λειτουργεί ως «χάρτης πλοήγησης» για τα bot των μηχανών αναζήτησης και των συστημάτων τεχνητής νοημοσύνης (AI), υποδεικνύοντας ποιες σελίδες ή φακέλους επιτρέπεται να επισκεφθούν και ποιους πρέπει να προσπεράσουν. Αν και πρόκειται για ένα θεμελιώδες στοιχείο του τεχνικού SEO, συχνά παραμελείται, γεγονός που μπορεί να βλάψει την οργανική ορατότητα μιας ιστοσελίδας.
Γιατί Είναι Καθοριστικό το Robots.txt για το SEO
Κάθε μηχανή αναζήτησης, όπως η Google, διαθέτει έναν συγκεκριμένο προϋπολογισμό σάρωσης (Crawl Budget) για κάθε ιστότοπο. Αυτός ορίζεται από δύο παραμέτρους:
- Όριο χωρητικότητας σάρωσης (Crawl capacity limit): Ο μέγιστος αριθμός ταυτόχρονων συνδέσεων που μπορεί να χρησιμοποιήσει ένα bot χωρίς να επιβαρύνει τον διακομιστή.
- Ζήτηση σάρωσης (Crawl demand): Η δημοτικότητα των σελίδων και η συχνότητα ανανέωσής τους.
Με τη σωστή διαμόρφωση του robots.txt, κατευθύνετε τα bots μακριά από τεχνικό περιεχόμενο χαμηλής αξίας και τα αναγκάζετε να καταναλώσουν τον χρόνο τους στις πιο σημαντικές σελίδες σας. Σύμφωνα με τις οδηγίες της Google, οι κυριότερες πηγές σπατάλης του crawl budget περιλαμβάνουν:
- Faceted navigation (Σύνθετη φιλτραρισμένη πλοήγηση): Παράμετροι URL για ταξινόμηση που παγιδεύουν τα bots σε άπειρες επαναλαμβανόμενες σελίδες.
- Διπλότυπο περιεχόμενο (Duplicate content): Ίδιες πληροφορίες που είναι προσβάσιμες από διαφορετικά URLs.
- Αδιέξοδα και σφάλματα: Σελίδες Soft 404 και μεγάλες αλυσίδες ανακατευθύνσεων (redirect chains).
- Χαμηλή απόδοση διακομιστή: Καθυστερήσεις στην απόκριση που μειώνουν τον αριθμό των σελίδων που μπορεί να διαβάσει το bot.
Οι 4 Βασικές Εντολές (Directives)
Η δομή του αρχείου βασίζεται σε τέσσερις κύριες εντολές, καθεμία από τις οποίες πρέπει να γράφεται σε ξεχωριστή σειρά:
- User-agent: Ορίζει σε ποιο bot απευθύνεται ο κανόνας (το * αφορά όλα τα bots).
- Disallow: Απαγορεύει την πρόσβαση σε συγκεκριμένα μονοπάτια ή αρχεία.
- Allow: Δημιουργεί εξαιρέσεις μέσα σε έναν κανόνα Disallow.
- Sitemap: Δηλώνει την πλήρη (απόλυτη) URL διεύθυνση του XML sitemap.
Διαχείριση AI Crawlers και Στρατηγική AEO (Answer Engine Optimization)
Η διαχείριση των AI bots μέσω του robots.txt αποτελεί κρίσιμη στρατηγική απόφαση. Τα bots χωρίζονται σε δύο κατηγορίες:
- Bots εκπαίδευσης (Training bots): Συλλέγουν δεδομένα για τη δημιουργία μελλοντικών μοντέλων (π.χ., GPTBot, ClaudeBot, Google-Extended).
- Bots αναζήτησης και βοηθοί (Search bots): Σαρώνουν περιεχόμενο σε πραγματικό χρόνο για να δώσουν απαντήσεις και παραπομπές (citations) στους χρήστες (π.χ., OAI-SearchBot, Claude-SearchBot, PerplexityBot).
Η εντολή Google-Extended αφορά αποκλειστικά την εκπαίδευση του Gemini και δεν επηρεάζει την κατάταξη στην παραδοσιακή αναζήτηση της Google. Αντίθετα, αν αποκλείσετε bots αναζήτησης όπως το OAI-SearchBot, ο ιστότοπός σας δεν θα εμφανίζεται ως πηγή ή παραπομπή στις απαντήσεις των AI εργαλείων.
Για τον πλήρη αποκλεισμό των κυριότερων AI crawlers ξεχωριστά, χρησιμοποιείται η εξής δομή:
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-SearchBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Σημείωση για το CCBot: Το bot του Common Crawl συχνά παραβλέπεται, ωστόσο το δημόσιο αποθετήριό του τροφοδοτεί δεκάδες μοντέλα ανοιχτού κώδικα, καθιστώντας απαραίτητο τον έλεγχό του.
Το Πρότυπο llms.txt: Για να ενισχύσετε την κατανόηση του ιστότοπου από τα συστήματα AI χωρίς να τα αποκλείσετε, μπορείτε να δημιουργήσετε ένα αρχείο Markdown με όνομα llms.txt (και το αναλυτικότερο συνοδευτικό llms-full.txt) στον ριζικό κατάλογο. Αυτό λειτουργεί ως «μενού» που υποδεικνύει στα LLMs τις πιο έγκυρες και ενημερωμένες σελίδες σας.
Συχνά Λάθη που Πρέπει να Αποφύγετε
- Χρήση του Disallow: / σε ζωντανά sites: Μπλοκάρει ολόκληρο τον ιστότοπο από κάθε crawler, εξαφανίζοντας την ορατότητα στις μηχανές αναζήτησης.
- Μπλοκάρισμα CSS και JavaScript: Η Google χρειάζεται πρόσβαση σε αυτά τα αρχεία για να αποδώσει (render) σωστά τη σελίδα. Η απόκρυψή τους υποβαθμίζει την αξιολόγηση και την κατάταξη του ιστότοπου.
- Σύγχυση του Disallow με το Noindex: Το Disallow σταματά τη σάρωση, αλλά όχι την ευρετηρίαση. Αν μια αποκλεισμένη σελίδα έχει εξωτερικούς συνδέσμους, μπορεί να εμφανιστεί στα αποτελέσματα χωρίς περιγραφή. Η Google αγνοεί την ανεπίσημη εντολή noindex μέσα στο robots.txt από το 2019. Για de-indexing απαιτείται η ετικέτα meta robots noindex ή HTTP κεφαλίδα X-Robots-Tag.
- Χρήση του Crawl-delay για την Google: Η Google δεν υποστηρίζει την εντολή crawl-delay (καταργήθηκε και η σχετική ρύθμιση στο Search Console στα τέλη του 2023). Υποστηρίζεται μόνο από Bing, Yahoo και Yandex.
Κανόνες Σύνταξης και Ορθής Τοποθέτησης
Το αρχείο πρέπει να ονομάζεται αυστηρά robots.txt (πεζά γράμματα) και να αποθηκεύεται με κωδικοποίηση UTF-8 χωρίς Byte Order Mark (BOM).
Κάθε υποdomain (π.χ., shop.example.com) and κάθε διαφορετικό πρωτόκολλο (HTTP έναντι HTTPS) απαιτεί το δικό του ξεχωριστό αρχείο robots.txt.
Όταν υπάρχουν αντικρουόμενοι κανόνες, η Google και η Bing ακολουθούν τον πιο ειδικό κανόνα (αυτόν με το μεγαλύτερο μήκος χαρακτήρων στο path). Αν είναι ισοδύναμοι, υπερισχύει ο λιγότερο περιοριστικός (Allow).
Έτοιμα Πρότυπα Αρχείων (Templates) ανά Πλατφόρμα
Παράδειγμα για ιστοσελίδες σε Blogger:
Αν η ιστοσελίδα σας είναι στημένη στην πλατφόρμα του Blogger, το ιδανικό αρχείο robots.txt πρέπει να προστατεύει το crawl budget από τις σελίδες αναζήτησης και τις ετικέτες, επιτρέποντας παράλληλα στα bots των διαφημίσεων να λειτουργούν σωστά. Ένα βελτιστοποιημένο πρότυπο είναι το εξής (αντικαθιστώντας το yourdomain.com με το δικό σας domain):
User-agent: *
Disallow: /search
Allow: /
User-agent: Mediapartners-Google
Allow: /
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-SearchBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Sitemap: https://www.yourdomain.com/sitemap.xml
Sitemap: https://www.yourdomain.com/sitemap-pages.xml
Παράδειγμα για ιστοσελίδες σε WordPress: Στην περίπτωση που χρησιμοποιείτε WordPress, η δομή αλλάζει καθώς είναι απαραίτητο να αποκλείσετε την πρόσβαση στα αρχεία διαχείρισης και στα πρόσθετα (plugins) για λόγους ασφαλείας και εξοικονόμησης πόρων, χωρίς όμως να κλείσετε τα αρχεία CSS και JS που χρειάζεται η Google για τη σωστή εμφάνιση της σελίδας. Το σωστό αρχείο διαμορφώνεται ως εξής (αντικαθιστώντας το yourdomain.com με το δικό σας domain):
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /wp-login.php
Disallow: /wp-content/plugins/
Disallow: /readme.html
Disallow: /refer/
Disallow: */trackback/
Disallow: */feed/
Disallow: */embed/
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-SearchBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Sitemap: https://www.yourdomain.com/sitemap_index.xml
Έλεγχος και Επιβεβαίωση (Validation)
Μετά τη δημοσίευση του αρχείου στη διεύθυνση yoursite.com/robots.txt, ο έλεγχος γίνεται μέσω του robots.txt report στο Google Search Console (Ρυθμίσεις → Σάρωση). Εκεί εμφανίζονται τυχόν συντακτικά λάθη, η ημερομηνία τελευταίας ανάκτησης και παρέχεται η δυνατότητα αιτήματος για άμεσο recrawl. Για μεμονωμένα URLs, το εργαλείο URL Inspection επιβεβαιώνει εάν μια σελίδα μπλοκάρεται σωστά ή κατά λάθος.
Επιστρέφω με έναν σημαντικό οδηγό για να έχει επιτυχία ένα blog.
Είμαστε στο σημείο όπου έχουμε κατασκευάσει το blog μας και είναι στην αρχική του μορφή (σε επόμενη ανάρτηση θα μιλήσουμε για το πώς μπορούμε να αλλάξουμε το πρότυπο και να βάλουμε ένα πιο καλό) συνεχίζοντας λοιπόν θα σας εξηγήσω σε τι χρειάζεται ο κωδικός robots.txt που ανέφερα παραπάνω.
Τι κάνει το robots.txt
Στο blog μας εκτός από τα λινκ των αναρτήσεων μας υπάρχουν και τα λινκ των κατηγοριών (Labels) του τύπου https://posftiaxnoblog.blogspot.com/search/label/diamorfosh-blog όπως υπάρχουν και τα λινκ του αρχείου μας του τύπου https://posftiaxnoblog/2015/12/. Αυτά τα λινκ δεν πρέπει να αφήνουμε την Google και τις άλλες μηχανές αναζήτησης να τα καταχωρούν γιατί δημιουργούν διπλότυπο περιεχόμενο, το οποίο μπορεί να οδηγήσει σε τιμωρία του site μας από τις μηχανές αναζήτησης.
Παρακάτω σας δίνω τον κωδικό που χρησιμοποιώ κι εγώ σε αυτό το blog ώστε να τον χρησιμοποιήσετε κι εσείς εφόσον βέβαια έχετε δηλώσει και τους χάρτες ιστοτόπων στα webmasters tools.
User-agent: Mediapartners-Google
Disallow:
User-agent: *
Disallow: /search
Allow: /
Sitemap: https://posftiaxnoblog.blogspot.com/sitemap.xml
Sitemap: https://posftiaxnoblog.blogspot.com/sitemap-pages.xml
Πώς βάζω το robots.txt στο blog μου;
Αυτό το μικρούλη κωδικό θα τον κάνετε αντιγραφή και αφού αλλάξετε τα κόκκινα γράμματα με το δικό σας λινκ θα μεταβείτε στο πίνακα ελέγχου του blog σας στις ρυθμίσεις - προτιμήσεις αναζήτησης και στο σημείο που γράφει "προσαρμογή robots.txt" θα πατήσετε επεξεργασία και θα τον κάνετε επικόλληση μέσα στο κουτάκι.
Κάντε κλικ στο αποθήκευση αλλαγών και ακριβώς από κάτω που γράφει "Προσαρμοσμένες ετικέτες κεφαλίδας robots" κάντε κλικ στο επεξεργασία. Θα πρέπει να τικάρετε τα κουτάκια ακριβώς όπως φαίνεται στην παρακάτω φωτό.
Κάνουμε κλικ στο αποθήκευση αλλαγών και τώρα μπορούμε να πούμε πως έχουμε βάλει με επιτυχία το robots.txt στο blogger.
ΟΤΙ ΒΡΙΣΚΕΤΑΙ ΑΠΟ ΕΔΩ ΚΑΙ ΚΑΤΩ ΔΕΝ ΙΣΧΥΕΙ
Λοιπόν ο συγκεκριμένος κωδικός απαγορεύει στη google να διαβάζει τις αναρτήσεις μας.
Αυτό σημαίνει πως αν γράφουμε δικά μας άρθρα δεν το έχουμε ανάγκη γιατί τα άρθρα μας δεν είναι αντιγραμμένα. Αν όμως φτιάξουμε ένα blog ειδήσεις π.χ. τότε σίγουρα τα άρθρα μας θα være αντιγραμμένα και η google δε πρόκειται ποτέ να μας βάλει σε καλή θέση στην κατάταξη.
Για να βάλουμε τον κωδικό:
Καταρχήν κάνουμε σύνδεση στο blogger επιλέγουμε το ιστολόγιο που θέλουμε να εφαρμόσουμε τον κωδικό, πάμε Πρότυπο → Επεξεργασία HTML. Με Ctrl+F βρίσκουμε τη λέξη <head> και ακριβώς από κάτω βάζουμε τον παρακάτω κωδικό:
<b:if cond='data:blog.pageType == "archive"'><meta content='noindex,follow' name='robots'/></b:if><b:if cond='data:blog.pageType == "index"'><b:if cond='data:blog.url != data:blog.homepageUrl'><meta content='noindex,follow' name='robots'/></b:if></b:if>
Κάνουμε αποθήκευση και είμαστε έτοιμοι. Περιμένουμε μερικές μέρες μέχρι η google να ελέγξει το site μας για να δούμε τα αποτελέσματα.
Καλημέρα είμαι τελείως άσχετη από blogs εδώ και μια βδομάδα έχω ξεκινήσει να ασχολούμαι κάπως γιατί κατασκευάζω ένα δικό μου blog για να παρουσιάσω τη δουλειά μου.Θέλω λοιπόν να σε ρωτήσω εγώ που έχω ένα προσωπικό blog και κάνω τις δικές μου προσωπικές αναρτήσεις χρειάζεται να γράψω κάτι στο robots για να μου τα εμφανίζει στις αναζήτήσεις της google ή όχι;;; και αν χρειάζεται τί γράφω;;;Σ΄ευχαριστώ πολύ
Κωνσταντινα ευχαριστω για το σχολιο. Για αρχη πρεπει να βαλεις sitemap στα webmasters tools.Μετα πηγαινε ρυθμισεις - προτιμισεις αναζητησης - προσαρμογη robots txt και κανε επικοληση αυτο
User-agent: Mediapartners-Google
Disallow:
User-agent: *
Disallow: /search
Allow: /
Sitemap: http://uniquecreationsbykm.blogspot.gr//feeds/posts/default?orderby=UPDATED
στη τελευταια γραμη βαλε το δικο σου blog
οταν κανεις αυτα τα 2 πραγματακια ασε μου ενα σχολιο να σου πω και κατι αλλο
Παιδία please μπείτε στο blog μου!!!!!!!!!!!!!!!!!!!!!!!!!!!! girls-are-super.blogspot.com
kalispera.. eimai ki ego bloggakias.. polu xrisima ola auta pou grafeis..http://100apisteuta.blogspot.gr/
kalispera.. eimai ki ego bloggakias.. polu xrisima ola auta pou grafeis..http://100apisteuta.blogspot.gr/
Σε ευχαριστώ πολύ για αυτό το άρθρο, όπως πάντα άλλο ενα χρησιμο άρθρο που μας βοηθάει πολύ!!
http://mazimetinxristina.blogspot.gr/
Γεια σου, είδα πως να βάζεις το robots.txt και κατάλαβα πως να το κάνω είσαι σωστός ...Όμως είδα εδώ στης ενημερώσεις της Adsense ότι πρέπει να βγάλω αυτό από τον κώδικα Για να με διαβάζει η Adsense
User-agent: Mediapartners-Google
Disallow: /
Το είδα εδώ..URL https://support.google.com/adsense/answer/10532
Τι πρέπει να κάνω; σε παρακαλώ πες μου Ευχαριστώ..
Στο κώδικα που δίνω εγώ δεν υπάρχει αυτό για να το αφαιρεσεις