← Όλα τα άρθρα

Noindex, robots.txt και canonical: πότε κρύβετε σελίδες από τη Google και πότε όχι

Δεν πρέπει να εμφανίζονται όλες οι σελίδες στη Google. Δείτε πότε χρησιμοποιείται noindex, πότε robots.txt και πότε canonical χωρίς να χαθεί SEO αξία.

Noindex, robots.txt και canonical: πότε κρύβετε σελίδες από τη Google και πότε όχι

Δεν πρέπει κάθε URL μιας ιστοσελίδας να εμφανίζεται στη Google. Υπάρχουν σελίδες φίλτρων, εσωτερικές αναζητήσεις, thank-you pages, login screens, staging URLs και τεχνικές παραλλαγές που δεν έχουν SEO αξία.

Το πρόβλημα είναι ότι πολλοί χρησιμοποιούν noindex, robots.txt και canonical σαν να είναι το ίδιο εργαλείο. Δεν είναι. Κάθε ένα λύνει διαφορετικό πρόβλημα.

Τι κάνει το noindex

Το noindex λέει στις μηχανές αναζήτησης να μη δείχνουν μια σελίδα στα αποτελέσματα. Η Google τεκμηριώνει ότι μπορεί να εφαρμοστεί με robots meta tag σε HTML ή με X-Robots-Tag σε HTTP header για μη HTML αρχεία όπως PDFs.

Χρήσιμες περιπτώσεις:

  • thank-you pages μετά από φόρμα
  • internal search results
  • admin ή account pages που δεν πρέπει να εμφανίζονται
  • προσωρινές landing pages χωρίς οργανική αξία
  • duplicate σελίδες που πρέπει να παραμείνουν προσβάσιμες στον χρήστη

Σημαντικό: για να δει η Google το noindex, πρέπει να μπορεί να ανιχνεύσει τη σελίδα. Αν την μπλοκάρετε πρώτα με robots.txt, μπορεί να μην δει ποτέ το meta tag.

Τι κάνει το robots.txt

Το robots.txt ελέγχει crawling, όχι απαραίτητα indexing. Λέει σε crawlers ποιες περιοχές δεν πρέπει να ανιχνεύσουν.

Χρήσιμες περιπτώσεις:

  • περιορισμός crawling σε τεχνικές περιοχές
  • αποφυγή crawl waste σε άπειρες παραμέτρους
  • blocking σε scripts ή paths που δεν χρειάζεται να διαβαστούν

Δεν είναι μηχανισμός ασφαλείας. Αν μια σελίδα περιέχει ευαίσθητα δεδομένα, δεν προστατεύεται με robots.txt. Χρειάζεται authentication και authorization.

Τι κάνει το canonical

Το canonical δεν κρύβει σελίδα. Δείχνει ποια έκδοση θεωρείτε βασική όταν υπάρχουν παρόμοιες ή duplicate εκδόσεις.

Παραδείγματα:

  • ίδια προϊόντα με tracking parameters
  • ταξινομήσεις προϊόντων
  • print-friendly versions
  • URLs με μικρές παραλλαγές

Το canonical είναι ένδειξη, όχι απόλυτη εντολή. Αν η Google δει αντιφάσεις, μπορεί να επιλέξει διαφορετικό canonical.

Πού γίνονται λάθη

Συνηθισμένα λάθη:

  • χρήση robots.txt για να αφαιρεθεί σελίδα από το index
  • noindex σε σελίδες που έχουν οργανική αξία
  • canonical όλων των filtered pages προς την κύρια κατηγορία χωρίς στρατηγική
  • noindex σε paginated σελίδες που περιέχουν χρήσιμα προϊόντα
  • staging site που γίνεται indexable
  • thank-you pages που εμφανίζονται στη Google
  • PDF αρχεία χωρίς X-Robots-Tag όπου χρειάζεται

Τα λάθη αυτά συχνά δεν φαίνονται άμεσα. Φαίνονται όταν πέφτει η οργανική κίνηση ή όταν εμφανίζονται λάθος URLs στα αποτελέσματα.

Παραδείγματα αποφάσεων

Σελίδα «ευχαριστούμε για την επικοινωνία»: noindex.

Login page σε portal: noindex και πρόσβαση μόνο όπου χρειάζεται. Δεν αρκεί robots.txt για ασφάλεια.

Κατηγορία e-shop με υψηλή ζήτηση: indexable, με σωστό title, περιγραφή και προϊόντα.

Παράμετρος ταξινόμησης ?sort=price: συνήθως canonical προς τη βασική κατηγορία ή διαχείριση παραμέτρων ανά setup.

PDF με εσωτερική χρήση: καλύτερα να μην είναι δημόσιο. Αν είναι δημόσιο αλλά δεν πρέπει να εμφανιστεί στη Google, χρειάζεται X-Robots-Tag.

Πώς το κάνει η Ai Foundry

Στην Ai Foundry αντιμετωπίζουμε το indexing ως μέρος της τεχνικής αρχιτεκτονικής. Σε ιστοσελίδες, e-shop και web applications ορίζουμε από την αρχή ποιες σελίδες έχουν SEO αξία, ποιες είναι λειτουργικές αλλά όχι οργανικές, και ποιες πρέπει να προστατεύονται πραγματικά με authentication.

Αυτό αποτρέπει δύο αντίθετα προβλήματα: να μπαίνουν στη Google σελίδες που δεν πρέπει, ή να κρύβονται σελίδες που θα μπορούσαν να φέρνουν leads και πωλήσεις. Η σωστή χρήση noindex, robots.txt και canonical είναι μικρή τεχνική λεπτομέρεια με μεγάλο εμπορικό αντίκτυπο.

Checklist

Ελέγξτε:

  • αν οι σημαντικές SEO σελίδες είναι indexable
  • αν thank-you και internal search pages έχουν noindex
  • αν staging ή test περιβάλλοντα δεν είναι δημόσια indexable
  • αν robots.txt δεν μπλοκάρει σελίδες που χρειάζεται να δει η Google
  • αν canonical tags δείχνουν λογικές βασικές εκδόσεις
  • αν PDF ή άλλα αρχεία έχουν σωστό X-Robots-Tag όπου χρειάζεται
  • αν το Search Console δείχνει απροσδόκητα excluded URLs

Η σωστή ερώτηση δεν είναι «να το κρύψουμε από τη Google;». Είναι «τι ρόλο έχει αυτό το URL στην επιχείρηση και στο SEO;».