WebMagic0.7.3更新内容
本次更新增加了Downloader模块的一些功能。
#609修复HttpRequestBody没有默认构造函数导致无法反序列化的bug。
#631HttpRequestBody的静态构造函数不再抛出UnsupportedEncodingException受检异常。
#571Page对象增加bytes属性,用于获取二进制数据。下载纯二进制页面时,请设置request.setBinarayContent(true),这样对于二进制内容不会尝试转换为String,减小开销。
#629在HttpUriRequestConverter中会自动对一些导致URI异常的字符进行转移或过滤。
#610自动识别编码时,可以识别Content-Type中charset为大写的情况。
#627支持为Request单独设置页面编码,兼容同一站点多种编码方式的情况。
#613Page对象增加charset属性,其值为request/site中设置的charset,或者为自动检测的charset(未定义时)。
#606升级jsonpath到2.4.0
#608升级jsoup到1.10.3
WebMagic常见问题
(1)由于我这个爬虫的抓取有分页,而且它的分页通过js跳转的,抽取出来感觉有点麻烦,我想直接得到所有的信息,发现可以通过输入url地址请求得到所有的信息(这是网站的一个小问题,它没有设置每页数据记录条数的范围),但是需要登录才可以进行url地址的访问,就要使用cookie模拟登录。
(2)下面分析有关登录信息的cookie,我使用的是chrome,点击如图位置,会看到此网站的cookie,(如果已经访问了一段时间了,可以清除所有cookie然后重新登录再访问,否则可能会有很多的cookie,分析起来不方便),由于只有5个cookie,直接加上就可以访问了
WebMagic是java上面经常的需要的一款爬虫类型的工具了,现在就可以试试最新的0.7.3版本,功能以及使用上面都是完全的免费的,欢迎大家试试!
WebMagic中文版功能
WebMagic是一个简单灵活的Java爬虫框架。基于WebMagic,你可以快速开发出一个高效、易维护的爬虫。webmagic采用完全模块化的设计,功能覆盖整个爬虫的生命周期(链接提取、页面下载、内容抽取、持久化),支持多线程抓取,分布式抓取,并支持自动重试、自定义UA/cookie等功能。
万博lol官网 下载万博至尊 芝宝九游会 众博注单不结算 众博现金网注册 bet365充值没支付宝选项 dafabet最新平台网站链接 万博娱乐场官网彩 彩票霸主手机版七乐彩 众博棋牌电脑版官网 裸体彩绘上街外国图吧 体育广东频道 健飞体育 大连体育场搬家 谷歌分分彩数据咋来的展开


深圳夏拉杜-夏拉杜app(旅行服务)1.3.6 安卓版
肥皂大乱斗游戏下载-肥皂大作战游戏1.1.9兑换码版
易米购app下载-易米购app1.0.0官方安卓版
大电竞app-电竞游戏资讯软件(大电竞)4.6.0 官方最新版
小学语文识字下载-小学语文识字app部编版3.6.170官方最新版
共享乐购下载-共享乐购外卖来app9_1_1602292376 最新版
掌门1对1客户端-掌门1对1电脑版0.1.1 官方最新版
电影管家下载-电影管家app2.0.4安卓最新版
UCC免费小说官方APP下载-UCC免费小说1.0.1 最新版
U代账APP安卓下载-U代账APP手机版1.1.7安卓版
橘子说淘宝天猫宝贝主图视频下载器-橘子说淘宝天猫宝贝主图视频下载器绿色免费版
梦幻过山车游戏下载-梦幻过山车手游1.0安卓版
百度超级链数字藏品小程序下载-百度超级链数字藏品平台1.2.6 最新版
百科小学堂app下载-百科小学堂app1.28安卓版
郎圣语音文字互转大师下载-郎圣语音文字互转大师appv1.1.8 安卓版
Proteus7.6 Sp4汉化破解版
上海沃受理最新版本下载-上海沃受理app2.71 安卓版
死亡之影黑暗骑士国际服下载-死亡之影黑暗骑士官方最新版(Shadow Of Death)1.101.2.8 安卓版
源水缘app下载-源水缘社交平台2.0.9 安卓最新版
小米通话安卓版下载-小米通话(音视频通话)app1.2.30手机版