במסגרת קידום אתרים טכני, יש שלל פעולות שצריך לבצע כדי לשפר את ביצועי האתר. אחת מהן היא להשתמש בצורה נכונה בקובץ robots.txt – שמנחה את מנועי החיפוש בנוגע למה מותר ואסור להם לעשות.

מה זה קובץ רובוטס?

כשמו כן הוא, מדובר בקובץ טקסט פשוט המכיל הוראות והנחיות לרובוטים / זחלנים של מנועי חיפוש, שנקראים User Agents.

הקובץ נמצא בתיקייה הראשית של הדומיין, וכולל הנחיות עשה ואל תעשה בנושא זחילה של עמודי האתר, שמשפיעה גם על האינדוקס שלהם. בצורה כזו ניתן לשלוט בתקציב הזחילה באתר, ולא לבזבז אותו על עמודים חסרי תועלת (כגון עמוד רישום או כניסת login, עמוד עגלת קניות וכן הלאה).

כך נראה נתיב הקובץ באתר: website.com/robots.txt

קובץ robots.txt הוא למעשה חלק מסדרת כללים שלמה שנקראת REP – קיצור של Robots Exclusion Protocol. סדרת כללים זו כוללת גם את תגי Meta Robots שניתן להציב בעמודים ספציפיים באתר, זאת לעומת קובץ רובוטס שתקף לכל האתר כולו (וגם לכך יש סייגים כפי שנראה בהמשך). מפות אתר אינן חלק מהפרוטוקול, אבל אפשר לציין את הכתובת שלהן בקובץ בשורת Sitemap.

כאן המקום לציין שקובץ רובוטס הוא פורמט פקודות "חלש" יותר בהשוואה לתגית מטא רובוטס. קובץ רובוטס שולט רק בסריקה, ואילו תגית מטא רובוטס שולטת בהוספה לאינדקס. זו הסיבה שקובץ רובוטס אומנם יכול להגיד למנועי חיפוש לאן מותר ואסור להם להיכנס, אבל הוא לא יכול למנוע אינדוקס מוחלט של עמודים ותכנים.

אם העמוד חסום בקובץ רובוטס אבל מקור אחר מקשר אליו, הוא עדיין יכול להופיע בתוצאות החיפוש, בדרך כלל בלי תיאור. רק תגית מטא רובוטס (או כותרת x-robots) מסוגלת להסיר לחלוטין עמודים מתוך האינדקס, כאשר מוצבת בה פקודת noindex.

כללי הכתיבה בקובץ רובוטס

הסינטקס בקובץ robots פועל על בסיס כמה כללים פשוטים:

  • Disallow – לא לאפשר פעולה מסוימת.
  • Allow – כן לאפשר פעולה מסוימת.
  • User-agent – הזחלן / הבוט שאליו מכוונים את ההנחיה (הבוט של גוגל, של בינג וכן הלאה).
  • סימן כוכבית * – מתייחס להכול / לכולם (כל מנועי החיפוש, כל עמודי האתר, כל התיקיות וכו').
  • סימן סולמית # – מאפשר להכניס הערות למשתמש אנושי בלי להשפיע על מנועי חיפוש.
  • סימן דולר $ – מסמן את סוף הכתובת. למשל, הכלל Disallow: /*.pdf$ יחסום רק כתובות שמסתיימות ב-.pdf.
  • וכן סימנים נוספים.

כמו כן חשוב לזכור שהקובץ רגיש לאותיות קטנות או גדולות. אם נבקש לחסום תיקייה שנקראת Admin, זה לא יחסום גם תיקיות שנקראות admin במקביל. כדי לוודא חסימה במקרה הזה, נצטרך לתת שתי פקודות נפרדות בקובץ – אחת לכל גרסה. זו עוד סיבה טובה לוודא שכתובות ה-url באתר הן באותיות קטנות. בנוסף גם שם הקובץ עצמו חייב להיות באותיות קטנות בלבד.

דוגמאות שימוש בקובץ robots

כך נחסום את כל האתר לחלוטין, עבור כל מנועי החיפוש וכל סוגי הזחלנים והבוטים:

User-agent: *
Disallow: /

הלוכסן בסוף מייצג את כל מה שבא אחרי הדומיין, כלומר כל העמודים. אם נוריד רק את הלוכסן בסוף השורה השנייה, הפקודה תתהפך – ותאשר סריקה של כל האתר. הרגישות הגבוהה הזו לכל שינוי הכי קטן, מחייבת הבנה טובה בתחביר הקובץ לפני שמעלים אחד לאתר או משנים אחד קיים.

כך נחסום עמוד ספציפי לסריקה של מנוע חיפוש ספציפי:

User-agent: googlebot
Disallow: /login-page

כך נחסום תיקייה ספציפית וכל מה שנמצא בתוכה (הלוכסן השני משמעו כל מה שבא אחרי התיקייה, כולל התיקייה עצמה):

User-agent: *
Disallow: /admin/

בנוסף לכללים עצמם, יש חשיבות גם לחלוקת ההנחיות לקבוצות. כאשר יש מספר הנחיות disallow ו-allow תחת אותו יוזר אייג'נט – כולן מתייחסות אך ורק ליוזר הזה (גם אם הוא מתייחס לכל מנועי החיפוש באמצעות כוכבית). הסדר שלהן בתוך הקבוצה לא משנה: גוגל מפעילה את הכלל הספציפי ביותר, כלומר את הכלל שהנתיב שלו הכי ארוך.

אם יש כמה יוזר אייג'נטס בקובץ, נהוג להפריד ביניהם בשורת רווח. הנה דוגמה לסט הנחיות:

User-agent: Googlebot
Disallow: /search/

User-agent: *
Disallow: /wp-admin/

כל "קבוצת הנחיות" מופרדת ברווח ומתייחסת ליוזר אייג'נט אחר. זחלן פועל רק לפי הקבוצה שמתאימה לו באופן הספציפי ביותר, ולכן גוגלבוט יפעל לפי הקבוצה הראשונה בלבד: הוא לא יסרוק את /search/, אבל כן יסרוק את /wp-admin/. כל שאר הזחלנים יפעלו לפי הקבוצה של הכוכבית.

איך יוצרים ועורכים קובץ robots באתר?

ראשית יש לזכור שקובצי רובוטס גלויים גם למנועי חיפוש וגם לבני אדם, כל עוד הם נמצאים בתיקייה הראשית של הדומיין (כפי שצוין קודם לכן).

שנית, בדרך כלל באתרי וורדפרס יש קובץ רובוטס שנוצר אוטומטית בתצורת ברירת מחדל. כדי ליצור קובץ רובוטס מאפס או לערוך אחד קיים, מומלץ להשתמש בתוספים ייעודיים כגון יוסט או Rankmath. אפשרות נוספת היא עריכה ישירות באמצעות FTP או סי-פאנל בשרת האחסון של האתר.

איך בודקים מה חסום ומה לא?

  • אפשרות אחת היא לבדוק את הקובץ בעצמכם, בהתאם לכללים שלמדנו כאן. בצורה כזו תוכלו לראות מה חסום בצורה רוחבית עבור כל האתר (למשל, כל מה שנכלל בתיקייה wp-admin באתר וורדפרס).
  • אפשרות נוספת, מצומצמת יותר, היא לבדוק כתובת URL ספציפית בקונסולת גוגל. אם הכתובת חסומה בקובץ רובוטס (או מכל סיבה אחרת למעשה), אתם תקבלו על כך התראה לאחר הבדיקה.
  • עוד אופציה שקיימת בקונסולת גוגל, היא דרך דוח ה-robots.txt בגוגל סרץ׳ קונסול (תחת ההגדרות), שהחליף את כלי הבדיקה הישן שגוגל סגרה מאז. בתוך הדוח רואים איזו גרסה של הקובץ גוגל קראה מהאתר, ומתי בדיוק היא עשתה זאת לאחרונה. הדוח מציג גם אזהרות ושגיאות שגוגל מצאה בקובץ, ואחרי שינוי חשוב אפשר לבקש מגוגל לסרוק את הקובץ מחדש. בדיקה של נתיב ספציפי נעשית בכלי לבדיקת כתובות URL, כמו באפשרות הקודמת.

מה ההבדל בין קובץ robots.txt מול meta robots או x-robots?

כפי שכבר צוין בהתחלה, מדובר בסט כללים עבור בוטים – שמיועד לשימוש באתרי אינטרנט. הבדל אחד בין הסוגים השונים הוא שרובוטס טקסט הוא קובץ אמיתי שיושב באתר, ואילו meta robots היא תגית שיושבת בקוד העמוד, ו-x-robots היא כותרת (header) שהשרת שולח יחד עם העמוד או הקובץ.

מעבר לכך, לכל אחד תפקידים שונים. קובץ רובוטס מכתיב התנהלות זחילה באתר כולו, בעוד שתגית meta robots וכותרת x-robots מכתיבות התנהלות עבור עמודים ספציפיים. לדוגמה: חסימת עמוד מלאה, כולל חסימת הקישורים בעמוד, תיראה כך בתגית מטא רובוטס:

<meta name="robots" content="noindex, nofollow">

איך חוסמים זחלני AI בקובץ robots.txt?

לחברות ה-AI יש זחלנים משלהן, ולכל אחד מהם שם User-agent נפרד. OpenAI מפעילה את GPTBot, שאוסף תוכן שעשוי לשמש לאימון המודלים שלה, ואת OAI-SearchBot, שבזכותו אתרים מופיעים בתוצאות החיפוש של ChatGPT. ClaudeBot של Anthropic אוסף תוכן לאימון המודלים של Claude. אצל גוגל, Google-Extended הוא שם שקובע אם גוגל רשאית להשתמש בתוכן שהיא סורקת מהאתר לאימון מודלי Gemini ולתשובות באפליקציית Gemini. אין לו זחלן משלו: את הסריקה עושים הזחלנים הרגילים של גוגל.

כל חסימה כזו עומדת בפני עצמה. לפי OpenAI, אפשר לחסום את GPTBot ועדיין להופיע בחיפוש של ChatGPT. לפי גוגל, Google-Extended לא משפיע על ההופעה בחיפוש של גוגל ולא על הדירוג בו. כך נראה קובץ שחוסם את השימוש בתוכן האתר לאימון מודלים ומשאיר אותו פתוח לחיפוש:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

חסימה של OAI-SearchBot, לעומת זאת, מוציאה את האתר מתשובות החיפוש של ChatGPT.

רגע לפני סיום

קובץ robots.txt הוא רכיב רגיש מאוד בכל אתר. אם אינכם יודעים כיצד להתעסק בו ומהם הכללים וחוקי הכתיבה, מוטב לא לגעת בקובץ. בטעות אתם עלולים לחסום לעצמכם חלקים שלמים מהאתר, שלא ייסרקו יותר על ידי מנועי חיפוש.

מצד שני, מי שמבין מספיק יכול לעשות הרבה דברים עם הקובץ הזה. למשל, אם אנו רוצים למנוע מהבוטים של ahrefs או semrush לסרוק את האתר שלנו, אפשר לחסום אותם באמצעות קובץ רובוטס:

User-agent: AhrefsBot
Disallow: /

User-agent: SemrushBot
Disallow: /

החסימה עוצרת רק את הסריקה של האתר עצמו. הקישורים שמובילים אליו נמצאים באתרים אחרים, שהבוטים ממשיכים לסרוק, ולכן הקישורים ימשיכו להופיע בכלים האלה.

חובה לזכור – חסימה בקובץ רובוטס מונעת מהבוטים להיכנס לעמוד, ולכן הם גם לא יראו בו תגית noindex. אם אתם רוצים להוציא עמוד מהאינדקס של גוגל באמצעות noindex, אל תחסמו אותו גם בקובץ רובוטס.

עד כמה הפוסט הזה עזר לכם?
דירוג ממוצע 5 מתוך 5 · 3 דירוגים