2、设置或获取整个URL为字符串。
3、设置或获取与URL关联的端口号码。
4,设置或获取URL的协议部分。
5,设置或获取href属性中在井号“#”后面的分段。
6,设置或获取location或URL的hostname和port号码。
7,设置或获取href属性中跟在问号后面的部分。
8、获取变量的值(截取等号后面的部分)。
9、用来得到当前网页的域名。
Python用做数据处理还是相当不错的,如果你想要做爬虫,Python是很好的选择,它有很多已经写好的类包,只要调用,即可完成很多复杂的功能,此文中所有的功能都是基于BeautifulSoup这个包。1 Pyhton获取网页的内容(也就是源代码)
page = urllib2.urlopen(url)
contents = page.read()
#获得了整个网页的内容也就是源代码 print(contents)
url代表网址,contents代表网址所对应的源代码,urllib2是需要用到的包,以上三句代码就能获得网页的整个源代码
2 获取网页中想要的内容(先要获得网页源代码,再分析网页源代码,找所对应的标签,然后提取出标签中的内容)