Fungsi Robots.txt pada Website

Apa itu Robots.txt? Pengertian, Fungsi, dan Cara Settingnya

Robots.txt adalah file yang membantu mengatur struktur website yang boleh atau tidak boleh dirayapi crawler mesin pencari. Meski sederhana, file ini berperan penting dalam Technical SEO, terutama pada website dengan banyak URL atau struktur kompleks. Pasalnya, konfigurasi yang keliru dapat menghambat proses crawling. 

Oleh sebab itu, pemilik website perlu memahami fungsi, struktur, serta cara setting robots.txt dengan benar. Artikel ini membahas pengertian, fungsi, directive penting, contoh konfigurasi, hingga kesalahan yang perlu kamu hindari. Tak perlu panjang lebar lagi, langsung saja mari kita simak artikel ini selengkapnya!

Apa itu Robots.txt?

Robots.txt adalah file teks yang memberikan instruksi kepada crawler dari search engine mengenai bagian website yang boleh atau tidak boleh dirayapi. File ini mengikuti standar Robots Exclusion Protocol dan biasanya ditempatkan pada root domain. Misalnya, website example.com dapat menyediakan file melalui URL berikut:

https://example.com/robots.txt

Crawler seperti Googlebot akan membaca file tersebut sebelum melakukan crawling. Aturan di dalamnya dapat menentukan path tertentu yang tidak boleh diakses crawler. Namun, robots.txt tidak sama dengan mekanisme indexing. 

Crawling merupakan proses ketika crawler mengakses URL, sedangkan indexing berkaitan dengan pemrosesan dan penyimpanan halaman dalam indeks mesin pencari. Karena itu, jangan menggunakan robots.txt sebagai cara utama untuk menghapus halaman dari Google. Google menyarankan penggunaan mekanisme lain untuk mengontrol indexing.

Apa Bedanya Crawling dan Indexing?

Crawling adalah proses dimana robot mesin pencari (crawler) mengunjungi URL untuk mengambil informasi dari halaman tersebut. Setelah itu, mesin pencari dapat memproses konten tersebut untuk menentukan apakah halaman layak diindeks.

Sementara itu, indexing adalah proses memasukkan informasi halaman ke database mesin pencari. Perbedaan ini penting karena memblokir crawling tidak otomatis menghapus URL dari hasil pencarian. Google masih dapat mengetahui keberadaan URL melalui sumber lain.

Baca Juga :   Apa itu Cash Flow? Pengertian, Fungsi, Jenis, & Contohnya

Fungsi Robots.txt untuk Website dan SEO

Robots.txt memiliki fungsi utama untuk mengatur akses crawler terhadap bagian tertentu dari website. Penggunaannya paling relevan ketika website memiliki struktur besar atau banyak URL yang tidak perlu dirayapi. Berikut fungsi robots.txt yang perlu kamu pahami:

1. Mengatur Akses Crawler

Fungsi utama robots.txt adalah memberikan aturan kepada crawler mengenai path tertentu yang dapat atau tidak dapat diakses. Misalnya, kamu dapat membatasi crawling terhadap direktori administrasi yang tidak perlu dijelajahi crawler mesin pencari.

Contohnya:

Disallow: /admin/

Aturan tersebut meminta crawler yang ditargetkan untuk tidak merayapi URL dalam direktori /admin/.

2. Membantu Mengelola Crawl Budget

Pada website besar, crawler perlu menentukan sumber daya yang digunakan untuk bisa merayapi berbagai URL. Pengelolaan crawling dapat membantu mengurangi permintaan terhadap URL yang tidak penting.

Robots.txt dapat menjadi salah satu bagian dari strategi tersebut. Namun, jangan anggap konfigurasi robots.txt otomatis meningkatkan ranking website. Dampaknya lebih berkaitan dengan pengelolaan crawling dan efisiensi akses crawler terhadap website.

3. Membatasi Crawling URL yang Tidak Diperlukan

Pada jenis website tertentu, ada banyak URL teknis yang tidak memberikan nilai bagi hasil pencarian. Contohnya adalah beberapa area administrasi, URL hasil pencarian internal, atau struktur tertentu yang memang tidak perlu dirayapi.

Robots.txt adalah file yang digunakan untuk membatasi area tersebut jika memang sesuai dengan kebutuhan website. Namun, setiap aturan harus dibuat berdasarkan audit. Memblokir URL secara sembarangan justru dapat menghambat crawling halaman penting.

4. Menunjukkan Lokasi Sitemap

Robots.txt juga dapat mencantumkan lokasi XML sitemap menggunakan directive Sitemap. Sebagai contoh misalnya, Sitemap: https://example.com/sitemap.xml Google mendukung directive sitemap dalam robots.txt. URL sitemap harus ditulis menggunakan alamat lengkap, termasuk protokol dan hostname.

Struktur dan Directive dalam Robots.txt

Robots.txt menggunakan sebuah struktur sederhana yang terdiri dari beberapa field. Untuk SEO, ada empat directive utama yang wajib kamu ketahui. Berikut penjelasannya:

1. User-agent

User-agent menentukan crawler yang menjadi target aturan berikutnya. Contohnya:

User-agent: *

Tanda * berarti aturan tersebut berlaku untuk semua crawler yang mengikuti standar robots.txt. Selain itu, kamu juga dapat menargetkan crawler tertentu menggunakan user-agent spesifik.

2. Disallow

Disallow adalah struktur robots.txt yang digunakan untuk menentukan path yang tidak boleh dirayapi crawler. Berikut contoh spesifiknya:

User-agent: *

Disallow: /admin/

Konfigurasi tersebut membatasi crawling terhadap path /admin/. Perlu diperhatikan bahwa nilai path bersifat case-sensitive. Jadi, /Admin/ dan /admin/ dapat diperlakukan berbeda.

3. Allow

Allow memberikan izin crawling terhadap path tertentu yang sebelumnya terkena aturan pembatasan. Contohnya sebagai berikut:

User-agent: *

Baca Juga :   Manfaat Email Bisnis untuk Meningkatkan Branding Perusahaan

Disallow: /private/

Allow: /private/public/

Directive ini berguna ketika kamu membutuhkan pengecualian terhadap aturan Disallow.

4. Sitemap

Sitemap menunjukkan lokasi XML sitemap kepada crawler. Contohnya:

Sitemap: https://example.com/sitemap.xml

Sitemap tidak harus berada pada hostname yang sama dengan robots.txt. Google juga mendukung lebih dari satu directive sitemap dalam satu file.

Contoh Robots.txt untuk Website

Tidak ada satu konfigurasi robots.txt yang cocok untuk semua website. Aturan sebaiknya disesuaikan dengan struktur, CMS, dan kebutuhan crawling masing-masing website. Berikut adalah beberapa contoh robots.txt yang umum digunakan untuk website:

1. Contoh Robots.txt Website Umum

Konfigurasi sederhana dapat terlihat seperti berikut:

User-agent: *

Disallow:

 

Sitemap: https://example.com/sitemap.xml

Disallow yang kosong berarti tidak ada path yang diblokir oleh aturan tersebut. Konfigurasi seperti ini memungkinkan crawler merayapi website tanpa pembatasan khusus.

2. Contoh Robots.txt untuk Memblokir Direktori Tertentu

Jika terdapat direktori yang tidak perlu dirayapi, kamu dapat membuat aturan seperti berikut:

User-agent: *

Disallow: /admin/

Disallow: /private/

 

Sitemap: https://example.com/sitemap.xml

Pastikan direktori tersebut memang tidak diperlukan crawler untuk memahami atau menemukan konten penting.

3. Contoh Robots.txt WordPress

Website WordPress biasanya memiliki area administrasi seperti /wp-admin/. Salah satu konfigurasi yang umum digunakan adalah:

User-agent: *

Disallow: /wp-admin/

Allow: /wp-admin/admin-ajax.php

 

Sitemap: https://example.com/sitemap_index.xml

Namun, jangan langsung menyalin konfigurasi tersebut ke semua website WordPress. Struktur sitemap dan kebutuhan crawling setiap website bisa berbeda. Google sendiri menyarankan pemilik website memastikan aturan robots.txt mencerminkan bagian website yang memang ingin dibatasi.

Cara Setting Robots.txt dengan Benar

Sebelum mengubah robots.txt, kamu perlu memahami struktur website dan menentukan URL yang memang perlu dibatasi. Berikut adalah cara untuk setting robots.txt yang sesuai dengan panduan resmi Google:

1. Identifikasi URL yang Perlu Dikontrol

Mulai dengan mengaudit struktur website. Cari direktori atau URL yang tidak memiliki nilai untuk crawling mesin pencari. Jangan langsung memblokir halaman hanya karena halaman tersebut terlihat teknis. Beberapa resource justru dapat dibutuhkan Google untuk memahami dan merender halaman dengan benar.

2. Buat atau Edit File Robots.txt

Robots.txt harus berupa file teks biasa dengan encoding UTF-8. Google menetapkan batas ukuran file sebesar 500 KiB. Gunakan editor teks untuk membuat atau mengubah file tersebut. Pastikan nama file ditulis dengan benar sebagai robots.txt.

3. Upload ke Root Domain

File harus berada pada direktori teratas host yang ingin kamu atur. Contohnya:

https://example.com/robots.txt

Aturan tersebut hanya berlaku untuk host, protokol, dan port tempat robots.txt berada. Karena itu, robots.txt pada https://example.com/ tidak otomatis mengatur host atau subdomain lain.

4. Periksa Konfigurasi Setelah Dipublikasikan

Setelah file diperbarui, buka URL robots.txt melalui browser. Pastikan seluruh directive sudah sesuai dengan kebutuhan. Kemudian, periksa halaman penting website dengan menggunakan Google Search Console. Langkah ini akan membantu menemukan potensi masalah crawling setelah perubahan.

Baca Juga :   Cara Membuat Blog Bisnis yang Mendatangkan Trafik dan Leads

Kesalahan Robots.txt yang Bisa Mengganggu SEO

Kesalahan konfigurasi dapat memberikan dampak serius terhadap crawling. Karena itu, jangan memperlakukan robots.txt sebagai file yang cukup dibuat sekali lalu dilupakan.

1. Memblokir Seluruh Website

Salah satu kesalahan paling fatal dari konfigurasi robots.txt adalah menggunakan:

User-agent: *

Disallow: /

Aturan tersebut meminta crawler untuk tidak merayapi seluruh website. Konfigurasi seperti ini mungkin digunakan sementara pada lingkungan tertentu, misalnya staging. Namun, jangan sampai aturan tersebut terbawa ke website production.

2. Menggunakan Robots.txt untuk Menghapus Halaman dari Google

Robots.txt bukan alat utama untuk menghapus halaman dari hasil pencarian. Jika URL diblokir, Google masih dapat mengetahui URL tersebut melalui link atau sumber lain. Bahkan, URL dapat tetap muncul tanpa konten yang berhasil dirayapi. Untuk indexing, gunakan metode yang sesuai seperti noindex ketika kondisinya memang membutuhkan.

3. Memblokir Halaman Penting

Kesalahan lain adalah memblokir direktori yang ternyata berisi halaman penting website atau resource yang dibutuhkan Google. Sebelum membuat aturan Disallow, pastikan path tersebut tidak menghalangi crawling halaman yang ingin kamu tampilkan di Google.

4. Menganggap Robots.txt sebagai Fitur Keamanan

Robots.txt bukan mekanisme keamanan website. File tersebut bersifat publik dan crawler yang tidak mematuhi standar dapat mengabaikan instruksinya. Karena itu, jangan pernah menggunakan robots.txt untuk melindungi password, data pribadi, atau informasi rahasia.

Cara Mengecek Robots.txt di Website

Pengecekan robots.txt dapat dimulai dengan membuka URL file secara langsung. Dalam hal ini, kamu bisa gunakan format:

https://domain.com/robots.txt

Periksa apakah file dapat diakses dan seluruh directive terlihat sesuai kebutuhan. Untuk audit lebih lanjut, gunakan Google Search Console dan URL Inspection untuk mengevaluasi masalah pada halaman tertentu. 

Google juga menyarankan pemeriksaan robots.txt ketika halaman baru tidak dapat ditemukan setelah migrasi website. Saat struktur website berubah besar, lakukan audit ulang. Contohnya saat migrasi CMS, perubahan URL, redesign, atau redirect domain.

Robots.txt vs Noindex, Apa Bedanya?

Robots.txt dan noindex adalah dua hal yang memiliki fungsi berbeda sehingga tidak boleh dianggap sebagai pengganti satu sama lain. Berikut perbedaannya:

Robots.txt Noindex
Mengatur crawling Mengatur indexing
Berada dalam file robots.txt Biasanya berupa meta tag atau HTTP header
Membatasi akses crawler ke path tertentu Meminta mesin pencari tidak memasukkan halaman ke indeks
Tidak dirancang untuk menghapus URL dari Google Digunakan untuk mengontrol indexing

Perbedaan ini penting dalam Technical SEO. Jika halaman tidak boleh masuk indeks, jangan hanya memblokirnya melalui robots.txt. Google perlu dapat mengakses halaman tersebut agar dapat membaca directive noindex. Memblokir crawling dapat membuat Google tidak dapat melihat instruksi tersebut.

Kesimpulan

Robots.txt adalah file yang digunakan untuk memberikan instruksi crawling kepada crawler mesin pencari. File ini dapat membantu mengelola akses terhadap direktori tertentu dan menunjukkan lokasi sitemap website. Directive penting yang perlu dipahami meliputi User-agent, Disallow, Allow, dan Sitemap. Meski sederhana, konfigurasi robots.txt membutuhkan kehati-hatian. Kesalahan aturan dapat menghambat crawling halaman penting atau membuat proses optimasi teknis menjadi lebih rumit. Karena itu, audit harus dilakukan sebelum dan setelah perubahan. Jika kamu ingin membangun website dengan struktur teknis yang lebih siap untuk SEO, kamu bisa pertimbangkan menggunakan jasa pembuatan website dari Nevaweb. Struktur website yang baik sejak awal akan memudahkan proses optimasi dan pengelolaan Technical SEO berikutnya. Yuk, bangun website mu bersama Nevaweb!