日本毛茸茸bbbbb**-精品网站入口-好男人蜜桃av久久久久久蜜桃-欧美v日韩|www.vvsas.com

專業(yè)加工中心
電子商務服務平臺
  • 采購
  • 企業(yè)
  • 產品
  • 資訊
搜 索

搜索引擎工作原理簡介
搜索引擎工作過程非常復雜,接下來的幾節(jié)我們簡單介紹搜索引擎是怎么樣實現網頁排名的,這里介紹相對于真正的搜索引擎技術來說只是皮毛,不過對SEO人員已經足夠用了。
搜索引擎的工作過程大體上可以分為成三個階段。
1、 爬行和抓取:搜索引擎蜘蛛通過跟蹤連接訪問網頁,獲得頁面HTML代碼存入數據庫。
2、 預處理:索引程序對抓取來的頁面數據進行文字提取、中文分詞、索引等處理,以備排名程序調用。
3、 排名:用戶輸入關健詞后,排名程序調用索引庫數據,計算相關性,然后按一定格式生成搜索結果頁面。


爬行和抓取
爬行和抓取是搜索引擎工作的第一步,完成數據收集的任務。
蜘蛛
搜索引擎用來爬行和訪問頁面的程序稱為蜘蛛,也稱為機器人。
搜索引擎蜘蛛訪問網站頁面時類似于普通用戶使用的瀏覽器。蜘蛛程序發(fā)出頁面訪問請求后,服務器返回HTML代碼,蜘蛛程序把收到的代碼存入原始數據庫。搜索引擎為了提高爬行和抓取速度,都使用多個蜘蛛并發(fā)分面爬行。
蜘蛛訪問一個網站時,都會先訪問網站根目錄下的文件。如果文件禁止搜索引擎抓取某些文件或目錄,蜘蛛將遵守協(xié)議,不抓取被禁止的網址。
和瀏覽器一樣,搜索引擎蜘蛛也有標明自己身份的代理名稱,站長可能在日志文件中看到引擎的特定代理名稱,從而辨識搜索引擎蜘蛛。下面列了常見的搜索引擎蜘蛛名稱:
百度蜘蛛  雅虎中國蜘蛛  英文雅虎蜘蛛  GOOGLE蜘蛛  微軟蜘蛛  搜狐蜘蛛  搜搜蜘蛛  有道蜘蛛   
 跟蹤鏈接
為了抓取網上盡量多的頁面,搜索引擎蜘蛛會跟蹤頁面上的鏈接,從一個頁面爬到下一個頁面,就好像蜘蛛在蜘蛛網上爬行那樣,這也就是搜索引擎蜘蛛這個名稱的由來。整個互聯(lián)網是由相互鏈接的網站及頁面組成的。從理論上說,蜘蛛從任何一個頁面出發(fā),順著鏈接都可以爬行到網上的所有頁面。當然,由于網站及頁面鏈接結構異常復雜,蜘蛛需要采取一定的爬行策略才能遍歷網上所有頁面 。
最簡單的爬行遍歷策略分為兩種,一種是深度優(yōu)先,另一種是廣度優(yōu)先。所謂深度優(yōu)先,指的是蜘蛛沿著發(fā)現的鏈接一直向前爬行,直到前面再也沒有其他鏈接,然后返回到第一個頁面,沿著另一個鏈接再一直往前爬行。
吸引蜘蛛
由引可見,雖然理論上蜘蛛能爬行和抓取所有頁面,但實際上不能、也不會這么做。SEO人員要想讓自己的更多頁面被收錄,以上想方設法吸引蜘蛛來抓取。既然不能抓取所有頁面,蜘蛛所要做是就是盡量抓取重要頁面。哪些頁面被認為比較重要呢?有幾方面影響因素。
網站和頁面權重。質量高、資格老的網站被認為權重比較高,這種網站上面頁面被爬行的深度也會比較高,所以會有更多內頁被收錄。
頁面更新度。蜘蛛每次爬行都會把頁面數據存儲起來。如果第二次爬行發(fā)現頁面與第一次收錄的完全一樣,說明頁面沒有更新,蜘蛛也就沒有必要抓取。如果頁面內容經常更新,蜘蛛就會更加頻繁地訪問這種頁面,頁面上出現的新鏈接,也自然會被蜘蛛更快地跟蹤,抓取新頁面。
導入鏈接  無論是外部鏈接還是同一個網站的內部鏈接,要被蜘蛛抓取,就必須有導入鏈接進入頁面,否則蜘蛛根本沒有機會知道頁面的存在。高質量的導入鏈接也經常使頁面上的導出鏈接被爬行深度有增加。
與首頁點擊距離。一般來說網站上權重最高的是首頁,大部分外部鏈接是指向首頁的,蜘蛛訪問最頻繁的也是首頁。離首頁點距離越近,頁面權重越高,被蜘蛛爬行的機會也越大。
地址庫
為了避免重復爬行和抓取網址,搜索引擎會建立一個地址庫,記錄已經被發(fā)現還沒有抓取的頁面,以及已經被抓取的頁面。
地址庫中的URL有幾個來源:
人工錄入的種子網站
蜘蛛抓取頁面后,從HTML中解析出新的鏈接URL,與地址庫中的數據進行對比,如果是地址庫中沒有網址,就存入待訪問地址庫
站長通過搜索引擎網頁提交表格提交進來的網址
蜘蛛按重要性從待訪問地址庫中提取URL,訪問并抓取頁面,然后把這個URL從待訪問地址庫中刪除,放進已訪問地址庫中。
大部分主流搜索引擎都提供一個表格,讓站長提交網址。不過這些提交來的網址都只是存入地址庫而已,是否收錄琮要看頁面重要性如何。搜索引擎所收錄的絕大部分頁面是蜘蛛自己跟蹤鏈接得到的。可以說提交頁面基本上是毫無用處的,搜索引擎更喜歡自己沿著鏈接發(fā)現新頁面。
文件存儲
搜索引擎蜘蛛抓取的數據存入原始頁面數據庫。其中的頁面數據與用戶瀏覽器得到的HTML是完全一樣的。每個URL都有一個獨特的文件編號。
爬行時的復制內容檢測
檢測并刪除復制內容通常是在下面介紹的預處理過程中進行的,但現在的蜘蛛在爬行和抓取文件時也會進行一定程度的復制內容檢測。遇到權重很低的網站上大量轉載或抄襲內容時,很可能不再繼續(xù)爬行。這也就是的站長在日志文件中發(fā)現了蜘蛛,但頁面從來沒有被真正收錄過后原因。

查看更多本類信息  加入收藏  返回上一頁
聯(lián)系方式
發(fā)布企業(yè):山東省誠輝數控機械有限公司
聯(lián)系人:張輝(經理)
聯(lián)系電話:0632-5856893
移動電話:13156829087
傳真
地址:滕州市經濟開發(fā)區(qū)
企業(yè)網址:http://www.sdchsk.com
留言咨詢
最新消息
·2020中國(廣州)國際機器人及智能裝.
·2020深圳國際電子智能制造展覽會
·2020深圳11月國際自動化及機器人技.
·2020中國未來工業(yè)機械展
·2020第22屆上海工業(yè)博覽會
·2020廣州汽車輕量化展覽會
·2020廣州國際空壓機及氣動技術展覽.
·2020廣州數據中心技術與設備展覽會
·2020上海低碳科技博覽會
·2020上?;ば虏牧险褂[會
圖片新聞