文章詳情頁

python - 請教這個頁面中的這兩個信息能否不用無頭瀏覽器爬取到?

瀏覽：106日期：2022-09-22 16:46:47

問題描述

在爬取'http://www.haodf.com/doctor/DE4r08xQdKSLBVM8i9sHYQ8uQGIO.htm'這個頁面的時候, 發現'擅長'和'執業經歷'這兩個信息通過beautifulsoup是取不到的, 我選取這兩個信息的代碼如下:

soup.select(’#full_DoctorSpecialize’).get_text(strip=True)soup.select(’#full’).get_text(strip=True)

查詢頁面發現這兩個信息好像是通過JS查詢的結果, 除了把網頁全部正則表達式匹配的方法, 請教各位: 1, 這兩個信息能否直接取到? 2, 除了類似'Selenium'這樣的工具, 是否還有其他方式能夠取到這兩個信息?3, 能否通過分析查詢接口的方式解決?

謝謝

問題解答

回答1：

可能這個頁面，你要抓的這個數據，是頁面加載后，使用js渲染出來的。也就是說，這個#full_DoctorSpecialize里面的數據是ajax，從服務器上拿回來的。具體要如何拿這樣的數據，你可以百度下 phantomjs ，你一定會有收獲的。

回答2：

這2個信息可以直接獲取，只是信息包含在JS塊中BigPipe.onPageletArrive({這個里面}) , 可以通過正則表達式獲取。這個里面是一段JSON格式的字符串。匹配之后轉換為json還是很容易處理的。想要通過查詢接口獲取的話，應該是可以的，不過得分析JS代碼，這個太麻煩，可以通過抓包工具來抓它的http請求。然后看看是那個請求返回的數據。相比較而言還是寫正則匹配比較快。

回答3：

這個就像樓上說的是js渲染的，內容在js代碼里面，可以正則匹配js代碼里面的元素，得到你想要的信息

Python 編程

上一條：python3 snmp大家都用什么擴展模塊下一條：PYTHON 根目錄主程序導入子目錄下的所有模塊，提示模塊找不到

相關文章：

1. 關于mysql聯合查詢一對多的顯示結果問題2. 冒昧問一下，我這php代碼哪里出錯了？？？3. php - 淘寶訂單拆單表設計4. 如何用筆記本上的apache做微信開發的服務器5. mysql優化 - MySQL如何為配置表建立索引？6. MySQL主鍵沖突時的更新操作和替換操作在功能上有什么差別(如圖)7. windows誤人子弟啊8. 實現bing搜索工具urlAPI提交9. 數據庫 - Mysql的存儲過程真的是個坑！求助下面的存儲過程哪里錯啦，實在是找不到哪里的問題了。10. 我在網址中輸入localhost/abc.php顯示的是not found是為什么呢？

排行榜

					
					javascript - 用on方法,綁定ui,下面的li 事件,ui,li是由ajax生成的,新手求教
javascript - ajax請求nodejs后臺，開啟服務器后，localhost:3000/index.html頁面既沒有報錯，也沒有文字。。。
windows誤人子弟啊
html5和Flash對抗是什么情況？
android-studio - android studio 結巴了，有什么辦法可以治好它嗎？
javascript - Java selenium 中使用click()方法點擊超鏈接無效  用window.open() 也打不開頁面
冒昧問一下，我這php代碼哪里出錯了？？？
android - 安卓使用webview播放騰訊、優酷視頻的方法
javascript - jquery  ajax 用jsonp的方式跨域訪問，為什么報錯
angular.js - angular.ui：dropdown的下拉菜單關閉的偶爾失常問題
javascript - DOM中，獲取屬性
				

熱門標簽

国产成人精品久久免费动漫-国产成人精品天堂-国产成人精品区在线观看-国产成人精品日本-a级毛片无码免费真人-a级毛片毛片免费观看久潮喷

python - 請教這個頁面中的這兩個信息能否不用無頭瀏覽器爬取到?