提取
提取功能會讀取網域集中每個網站的網頁,並取出符合表達式的部分。一組網站由此變成一張表格,列出電話號碼、社交媒體帳戶、地址、插件名稱——模式擷取到什麼,表格就列出什麼。
讀取範圍
PublicWWW 為這些網站編入索引的所有內容,包括內頁——不只是搜尋時符合的首頁。即使某項聯絡資料只出現在「關於我們」頁面,也照樣找得到。
預設模式與自訂模式
最常用的項目都有預設模式:電郵地址、電話號碼,WhatsApp、Telegram 及 Skype 聯絡方式,Facebook、Instagram、X(Twitter)及 LinkedIn 專頁連結,以及 Google Tag Manager、Google Analytics、Hotjar 及 AdSense 的 ID;您也可以改用任何正則表達式。表達式的運作方式與搜尋中的 snipexp: 相同:擷取群組的內容就是該欄的結果,沒有擷取群組的表達式只會得出空白結果。
|/wp-content/plugins/([\w\d\-\.\_]+)/|
請先在小型網域集上測試。您可以設定提取記錄數的上限,反覆試用及調整表達式,因此即使模式寫錯,代價也幾乎為零——至於為何這很重要,請參閱限制。
取得結果
提取出的表格可下載為檔案,並以試算表開啟。表格逐一列出每個網站及在該網站上找到的內容;沒有任何符合內容的網站仍會列出,讓空缺一目了然,而不會被悄悄略去。
用網域集篩選搜尋結果
網域集也可以反過來用作篩選器。上傳您自己的網域、網址或電郵地址列表,用它把搜尋結果縮減到列表上的網站——或者透過相減,縮減到列表以外的所有網站。
提取電話及電郵完整示範了整個流程,從兩次搜尋到一份試算表。在程式碼中,提取是 API 的一部分,可按名稱使用同樣的預設模式。
下一頁 限制