作為一個網(wǎng)站建設(shè)加優(yōu)化的公司,是必須要回的就是robots.txt文件,所以我們就來看看這個文件的意思
robots.txt是一個純文本文件,用于聲明該網(wǎng)站中不想被蜘蛛訪問的部分,或者指定蜘蛛抓取的部分。不是規(guī)定,而是一種約定,需要蜘蛛自覺遵守的一種習(xí)俗
當(dāng)蜘蛛訪問一個站點時,它會首先檢查該站點是否存在robots.txt
如果找到,蜘蛛就會按照該文件中的內(nèi)容來確定抓取的范圍
如果該文件不存在,那么蜘蛛就沿著鏈接直接抓取
robots.txt的作用
1、防止私密或重要內(nèi)容被搜索引擎抓取
2、節(jié)省服務(wù)器資源,從而提高服務(wù)質(zhì)量
3、減少重復(fù)抓取,提高網(wǎng)站質(zhì)量
4、指定sitemap文件位置
User-agent: *
針對哪個搜索引擎蜘蛛
這里的*代表搜索引擎種類,*是通配符
Allow
定義的是允許蜘蛛抓取某個欄目或文件
Allow: /cgi-bin/
這里定義是允許訪問cgi-bin目錄
Allow:/* .htm$
允許訪問以".htm"為后綴的URL
$指的是匹配行結(jié)束符
*指的是匹配任何字符
Disallow
定義的是禁止蜘蛛抓取某個欄目或文件
Disallow: /admin/
這里定義是禁止抓取admin目錄
Disallow: /cgi-bin/*.htm
禁止抓取/cgi-bin/目錄下的所有以".htm"為后綴的URL
Disallow: /*?*
禁止抓取網(wǎng)站中所有包含問號 “?”的網(wǎng)址
用法:sitemap: http://www.google.com/sitemap.xml
sitemap:URL全稱(包含http://部分)
告訴搜索引擎蜘蛛這個頁面是網(wǎng)站地圖
robots.txt文件主要是限制整個站點或者目錄的蜘蛛訪問情況,而robots meta標(biāo)簽則主要是針對某個具體的頁面