您的位置:首页>世界杯 >内容

荷兰对阵厄瓜多尔看点 (关于荷兰对阵厄瓜多尔看点 玩法)

2022-11-19 21:15:15来源:世界杯
导读荷兰对阵厄瓜多尔看点 是一个非常实用的新闻网页正文通用抽取器,软件并非是通过爬虫的原理,而是基于论文《基于文本及符号密度的网页正文提...

荷兰对阵厄瓜多尔看点 是一个非常实用的新闻网页正文通用抽取器,软件并非是通过爬虫的原理,而是基于论文《基于文本及符号密度的网页正文提取方法》来实现的正文抽取器。可以帮助用户快速提取网页文章的内容,标题和作者。适用于多个主流的新闻资讯平台,目前测试下来准确率是100%,非常可观。

项目起源

开发这个项目,源自于我在知网发现了一篇关于自动化抽取新闻类网站正文的算文——《基于文本及符号密度的网页正文提取方法》)

这篇论文中描述的算法看起来简洁清晰,并且符合逻辑。但由于论文中只讲了算法原理,并没有具体的语言实现,所以我使用 Python 根据论文实现了这个抽取器。并分别使用今日头条、网易新闻、游民星空、观察者网、凤凰网、腾讯新闻、ReadHub、新浪新闻做了测试,发现提取效果非常出色,几乎能够达到100%的准确率。

项目现状

在论文中描述的正文提取基础上,我增加了标题、发布时间和文章作者的自动化探测与提取功能。

目前这个项目是一个非常非常早期的 Demo,发布出来是希望能够尽快得到大家的使用反馈,从而能够更好地有针对性地进行开发。

本项目取名为抽取器,而不是爬虫,是为了规避不必要的风险,因此,本项目的输入是 HTML,输出是一个字典。请自行使用恰当的方法获取目标网站的 HTML。

本项目现在不会,将来也不会提供主动请求网站 HTML 的功能。

一般情况下,你只需要把网页粘贴到最上面的多行文本框中,然后点提取按钮即可。通过附加更多的参数,可以让提取更精确。

免责声明:本文由用户上传,如有侵权请联系删除!

猜你喜欢

最新文章