公司让写爬去,抓取网页的js文件,结果用了HtmlParser 却老是乱码,追究其原因是多方面的,其中最主要的原因是,web上的编码是多种多样,在抓取时手动设置编码解决不了各种编码问题,会报HtmlParser org.htmlparser.util.EncodingChangeException 异常,查了很多资料终于解决,不过在网页中的中文仍然会乱码,但是不会报这个异常! 公司让写爬去,抓取网页的js文件,结果用了HtmlParser 却老是乱码,追究其原
公司让写爬去,抓取网页的js文件,结果用了HtmlParser 却老是乱码,追究其原因是多方面的,其中最主要的原因是,web上的编码是多种多样,在抓取时手动设置编码解决不了各种编码问题,会报HtmlParser org.htmlparser.util.EncodingChangeException 异常,查了很多资料终于解决,不过在网页中的中文仍然会乱码,但是不会报这个异常! 公司让写爬去,抓取网页的js文件,结果用了HtmlParser 却老是乱码,追究其原