Win7旗舰版 - 专业分享最新系统之家win7旗舰版下载是电脑重装系统的理想系统家园。

最新更新 | 如何安装系统? | 软件导航 | 品牌系统 | 专题库 | 网站地图
GeneralNewsExtractor(新闻网页正文通用抽取器)

GeneralNewsExtractor(新闻网页正文通用抽取器)v0.2.6版免费下载

发布软件
软件大小:15KB 更新时间:2023-02-23
软件语言:中文 软件栏目:网络辅助
适用平台:Android

  GeneralNewsExtractor(新闻网页正文通用抽取器)是一个基于《基于文本及符号密度的网页正文提取方法》论文用Python实现的正文抽取器,可以用来提取 HTML 中正文的内容、作者、标题。

GeneralNewsExtractor(新闻网页正文通用抽取器)

开发介绍

  项目起源

  开发这个项目,源自于我在知网发现了一篇关于自动化抽取新闻类网站正文的算法论文――《基于文本及符号密度的网页正文提取方法》)

  这篇论文中描述的算法看起来简洁清晰,并且符合逻辑。但由于论文中只讲了算法原理,并没有具体的语言实现,所以我使用 Python 根据论文实现了这个抽取器。并分别使用今日头条、网易新闻、游民星空、观察者网、凤凰网、腾讯新闻、ReadHub、新浪新闻做了测试,发现提取效果非常出色,几乎能够达到100%的准确率。

  项目现状

  在论文中描述的正文提取基础上,我增加了标题、发布时间和文章作者的自动化探测与提取功能。

  目前这个项目是一个非常非常早期的 Demo,发布出来是希望能够尽快得到大家的使用反馈,从而能够更好地有针对性地进行开发。

  本项目取名为抽取器,而不是爬虫,是为了规避不必要的风险,因此,本项目的输入是 HTML,输出是一个字典。请自行使用恰当的方法获取目标网站的 HTML。

  本项目现在不会,将来也不会提供主动请求网站 HTML 的功能。

查看更多内容
软件截图
GeneralNewsExtractor(新闻网页正文通用抽取器)
软件下载地址
GeneralNewsExtractor(新闻网页正文通用抽取器)软件下载地址
云骑士一键重装系统
网友评论
网名
(您的评论需要经过审核才能显示)
发布评论
1楼 网友 25-06-13 02:04:17

怎么下载????

2楼 网友 25-06-01 13:52:19

window8兼容不?

3楼 网友 25-03-14 01:15:24

楼主你真好!太谢谢你了

4楼 网友 25-03-02 00:51:16

这款GeneralNewsExtractor(新闻网页正文通用抽取器)软件很不错啊,最新版本新增的功能简直不要太厉害,以后会不会有更惊喜的功能。

5楼 网友 24-11-22 02:32:27

既然这个GeneralNewsExtractor(新闻网页正文通用抽取器)是国产软件,那我就会一直支持下去的

6楼 网友 24-11-11 01:59:52

GeneralNewsExtractor(新闻网页正文通用抽取器)非常的好 谁用谁知道 建议下载

7楼 网友 24-11-07 19:51:46

QQ多少 我给你传一个

8楼 网友 24-10-05 13:08:49

GeneralNewsExtractor(新闻网页正文通用抽取器)我用了很久都没问题,大家就放心的使用吧

9楼 网友 24-10-03 10:49:22

以前这个GeneralNewsExtractor(新闻网页正文通用抽取器)大小很小,现在居然都已经2.8MB了

10楼 网友 24-09-03 16:03:12

GeneralNewsExtractor(新闻网页正文通用抽取器)挺好用的一款炒股软件软件,挺!!!就是下载好慢啊,赶脚那网速走的好无力