文章詳情頁

python - Scrapy ItemLoader數據清洗疑問

瀏覽：138日期：2022-06-30 08:28:51

問題描述

在使用scrapy抓取數據時，利用itemloader這個類，使用selector取出的值為空時，進入scrapy.Field()里調用filter()，selector取值不為空的確返回'有值'，如果selector取出[]或'',那么value進入filter()之后，并不會返回'無值'

def filter(value): if value:return '有值' else:return '無值' # 下面就簡寫了，熟悉的應該能看的懂 scrapy.Field(filter())

有什么辦法將抓取為空的值，經過filyer()之后變成'無值'

問題解答

回答1：

謝邀~不太了解Scrapy，所以題主這個我不太好說我用PHP自己寫的爬蟲大體思路是：1.先是根據正則和一些循環，把要收集的頁面放到隊列里，按類別分類，例如分頁的列表頁一個隊列，列表里的數據內容頁一個隊列。2.然后利用xpath來爬取相關內容頁的數據，爬取的過程中對一些爬取到的數據進行如題主所需的那樣進行處理。3.組裝數據，按照自己所需的標準保存數據。

大體就是這樣，我絕對大部分爬蟲框架也大概都是這種思路吧，無非是在此基礎上增加了，反爬機制，多線程，多進程，增量爬取等等功能。所以，題主找到你這個框架的爬取數據那里進行處理或組裝數據的地方進行處理都行。

Python 編程

上一條：python - 面對一串含有亂碼的字符串，如何取下需要的信息下一條：python - 編碼問題求助

相關文章：

1. php - 淘寶訂單拆單表設計2. 實現bing搜索工具urlAPI提交3. 如何用筆記本上的apache做微信開發的服務器4. mysql優化 - MySQL如何為配置表建立索引？5. 冒昧問一下，我這php代碼哪里出錯了？？？6. MySQL主鍵沖突時的更新操作和替換操作在功能上有什么差別(如圖)7. 關于mysql聯合查詢一對多的顯示結果問題8. 數據庫 - Mysql的存儲過程真的是個坑！求助下面的存儲過程哪里錯啦，實在是找不到哪里的問題了。9. 我在網址中輸入localhost/abc.php顯示的是not found是為什么呢？10. windows誤人子弟啊

排行榜

					
					javascript - 用on方法,綁定ui,下面的li 事件,ui,li是由ajax生成的,新手求教
javascript - ajax請求nodejs后臺，開啟服務器后，localhost:3000/index.html頁面既沒有報錯，也沒有文字。。。
windows誤人子弟啊
html5和Flash對抗是什么情況？
android-studio - android studio 結巴了，有什么辦法可以治好它嗎？
javascript - Java selenium 中使用click()方法點擊超鏈接無效  用window.open() 也打不開頁面
冒昧問一下，我這php代碼哪里出錯了？？？
android - 安卓使用webview播放騰訊、優酷視頻的方法
javascript - jquery  ajax 用jsonp的方式跨域訪問，為什么報錯
angular.js - angular.ui：dropdown的下拉菜單關閉的偶爾失常問題
javascript - DOM中，獲取屬性
				

熱門標簽

国产成人精品久久免费动漫-国产成人精品天堂-国产成人精品区在线观看-国产成人精品日本-a级毛片无码免费真人-a级毛片毛片免费观看久潮喷

python - Scrapy ItemLoader數據清洗疑問