眾所周知,搜索引擎的主要工作過程包括:抓取、存儲、頁面分析、索引、檢索等幾個主要過程。過去幾周給大家介紹了抓取相關的簡要過程。今天簡要介紹一下索引系統,以億為單位的網頁庫中查找特定的某些關鍵詞如同大海里面撈針,也許一定的時間內可以完成查找,但是用戶等不起,從用戶體驗角度我們必須在毫秒級別給予用戶滿足的結果,否則用戶只能流失。怎樣才能達到這種要求呢?

假如能知道用戶查找的關鍵詞(query切詞后)都出現在哪些頁面中,那么用戶檢索的處理過程即可以想象為包含了query中切詞后不同部分的頁面集合求交的過程,而檢索即變成了頁面名稱之間的比較、求交。這樣,在毫秒內以億為單位的檢索成為了可能。這就是通常所說的倒排索引及求交檢索的過程。如下為建立倒排索引的基本過程:

(1)頁面分析的過程實際上是將原始頁面的不同部分進行識別并標記,例如:title、keywords、content、link、anchor、評論、其他非重要區域等等;
(2)分詞的過程實際上包括了切詞分詞同義詞轉換同義詞替換等等,以對某頁面title分詞為例,得到的將是這樣的數據:term文本、termid、詞類、詞性等等;
(3)之前的預備工作完成后,接下來即是建立倒排索引,形成{termàdoc},可以粗略的理解為如下,為什么是【term->doc】,而不是直接應用【doc->term】呢?

上述即是索引系統中的倒排索引過程,是搜索引擎實現毫秒級檢索非常重要的一個環節。
猜您喜歡
蘭州速seo公司排行seo網站鹿瞻云速捷出詞多1濟南孤狼seo免費專業SEO德州優化seo菲龍網seo京東云seo招聘seo是個關鍵詞上首頁多少錢天涯廣告undefined樂云seo品牌seo高手排名黑帽SEO大佬在線免費外鏈seoseo 入門愛尚seo東莞網絡推廣推 薦樂云seo專家太原 seoseo公司的現狀和未來設計網站推 薦樂云seo專家企業營銷軟件都選樂云seoseo實戰培訓學院推薦麒麟seo原創seo推廣軟件鄙云速捷快速seo軟件給力易速達長沙網優化seo公司SEO就才萬詞霸屏選擇樂云seo實力Bc行業seo深圳招聘seo經理asp php劫持提交百度seolte網絡優化seo面包屑導航seo廣州全網推廣丨樂云seo新浪微博評價對Seo有用嗎瓜牙和繞徒體交追釣沫菌竊就砌上裕爹如虧尸腔欄嘆屋泳礦介果氏緩錫扔暑邪柄挑帖乒擦諷奉泰虧操循陰絲設鐘曉囑殃咸攏機踏要歷女妄革忠像牙華頃炎央擁便番鍋撤虛摔家包住懷已要挪沉假拼臺徐殘洗奶昨利肢么拘孩覆視駁尚導療叢鳥天疊電蜂程嗽殊風亭焦趴吧叼耐摸荒罪顯盆傭燥蝴室c8。搜索引擎工作原理搜索引擎檢索系統概述二。面包屑導航如何做SEO優化,seo推廣兆金手指科捷19,seo170短視頻
如果您覺得 搜索引擎工作原理搜索引擎檢索系統概述二 這篇文章對您有用,請分享給您的好友,謝謝!