python HTMLParser模块解析html文件内容_Python模块

python HTMLParser模块解析html文件内容: 发布时间：2020-04-10编辑：脚本学堂

python HTMLParser模块解析html文件的方法，使用urllib模块抓取网页内容，交由HTMLParser解析，效果不错。

需求描述：
把网页中的一部分内容挑出来，使用python/urllib/ target=_blank class=infotextkey>python urllib模块与hTMLParser库。
使用urllib模块抓取网页内容，交由HTMLParser解析

例子：

from HTMLParser import HTMLParser
class MyHTMLParser(HTMLParser):
def handle_starttag(self, tag, attrs):
print "a start tag:",tag,self.getpos()
parser=MyHTMLParser()
parser.feed('<div><p>"hello"</p></div>')

这个例子中HTMLParser是基类,重载了他的handle_starttag方法,输出了一些信息。
parser是MyHTMLParser的实例,调用feed方法开始解析函数。

注意，不需要显示调用handle_starttag方法就会执行。

HTMLParser方法的调用方式困惑了我很长时间,看了很多博文才恍然大悟,HTMLParser含有的方法分为两类,一类是需要显式调用的,而另一类不需显示调用.

不需显式调用的方法
下面的这些函数在解析的过程中会触发,但是默认情况下不会产生任何副作用,因而我们要根据自己的需求重载.

HTMLParser.handle_starttag(tag,attrs): 解析时遇到开始标签调用,如<p class='para'>,参数tag是标签名,这里是'p',attrs为标签所有属性(name,value)列表,这里是[('class','para')]

HTMLParser.handle_endtag(tag): 遇到结束标签时调用,tag是标签名

HTMLPars.handle_data(data): 遇到标签中间的内容时调用,如<style> p {color: blue; }</style>,参数data为开闭标签间的内容.值得注意的是在形如<div><p>...</p></div>的位置,并不会在div处调用,而是只在p处调用

当然还有其他函数,这里不做介绍

显式调用的方法
HTMLParser.feed(data): 参数为需要解析的html字符串,调用后字符串开始被解析

HTMLParser.getpos(): 返回当前的行号和偏移位置,如(23,5)

HTMLParser.get_starttag_text(): 返回当前位置最近的开始标签的内容
...

所有的内容写完了,最后还有一点注意事项,HTMLParser只是一个简单的模块,解析html的功能并不完善,例如不能准确的分别开标签和"自闭标签"。

例子：

from HTMLParser import HTMLParser
class MyHTMLParser(HTMLParser):
def handle_starttag(self,tag,attrs):
print 'begin tag',tag
def handle_startendtag(self,tag,attrs):
print 'begin end tag',tag

str1='<br>'
str2='<br/>'
parser=MyHTMLParser()

parser.feed(str1) # 输出 "begin tag br"
parser.feed(str2) # 输出 "begin end br"

上一篇：python urllib模块用于显示下载进度的例子
下一篇：python smtplib模块发送Email邮件的例子

与 python HTMLParser模块解析html文件内容有关的文章

本文标题：python HTMLParser模块解析html文件内容
本页链接：http://www.jb200.com/python/30568.htm

浏览排行

栏目分类

热点文章

python HTMLParser模块解析html文件内容