《计算机学报》文章摘要 全文下载 | |
文章题目 | 基于DOM的Web信息提取 |
作者 | 李效东 顾毓清 |
作者单位 | (中国科学院软件研究所 北京 100080) |
发表年份 | 2002 |
发表月份 | 5期 (页码:526—533) |
文章摘要 | 当前,Web已经成为人们获取信息的主要渠道之一.然而,用于表达Web页面信息的HTML语言存在着与生俱来的缺点.HTML的“标记”只是告诉浏览器软件如何显示所定义的信息,却不包含任何语义.因此由HTML语言所表述的Web页面经过浏览器分析后只适合人们浏览,不适合作为一种数据交换的方式由机器处理.该文以文档对象模型DOM为基础,把所要提取的信息在DOM层次结构中的路径作为信息抽取的“坐标”,并以这个基本原理为基础设计了一种归纳学习算法来半自动地生成提取规则,然后根据提取规则生成Java类.生成的Java类可以作为Web数据源包装器组成的重要构件. 关键词 归纳学习,文档对象模型,路径表达式,XML 中图法分类号:TP311 |