最近在写一个校园网络的搜索引擎,在处理页面中的链接时遇到点小问题,对于完整链接的获取用正则匹配可以很好的解决,但是网页中有很多相对的路径必须将它的前缀加上后才是一个完整的链接. 我是尝试过这样处理:因为蜘蛛在不断地循环抓取页面和分析页面中的链接,然后根据获得的新的链接再去抓取页面,当它在抓取某个页面时(如:https://www.123.com),分析页面中的链接,当找到如(web/index.jsp)这样的相对路径时我会将这个相对路径加到主页路径后(https://www.123.com/web/index.jsp)组成新的完整路径,这是问题来了,当抓取这个新的页面时,页面中的相对路径(如:web/other.jsp)如果还这样处理那么新生成的链接可能就成了这样:(https://www.123.com/web/index.jsp/web/other.jsp)显然这不是一个有效的链接,必须将(web/index.jsp)截掉后再加到主页链接后面.这样处理起来很麻烦,不知道有没有做过蜘蛛程序的大神能给出一个更可行的方法,作为新手会十分感激的!
最近在写一个校园网络的搜索引擎,在处理页面中的链接时遇到点小问题,对于完整链接的获取用