|
/ R+ J! ?+ n, u/ o. Z7 {
作者:kingnameGne[1]虽然在提取新闻正文的时候,准确率比较高,但由于提取新闻发布时间使用的是正则表达式,因此提取效果有时候不那么让人满意最近我发现Python的一个第三方库,叫做htmldate,经过测试,它提取新闻的发布时间比较准确。 1 t! C. m( e2 p$ z/ _% Y1 c
我们来看看这个库怎么使用首先使用pip安装:python3 -m pip install htmldate1.然后,我们使用Requests或者Selenium获得网站的源代码:import requests
- `9 @- n" c0 A. H8 F. i1 C8 `( m from htmldate
8 d& r( Z) r/ o$ \2 W3 w3 H import find_date
' @% _5 }6 H+ a+ k" M html = requests.get(https://www.kingname.info/2022/03/09/this-is-gnelist/).content.decode(utf-8) . E$ n7 Q& S8 v6 k
& y) `/ L' X. p
date = find_date(html)
- S7 m* p1 z$ A0 K Q1 W print(date)1.2.3.4.5.运行效果如下图所示: / a8 K! _; g* I1 a3 Z5 a
而这篇文章的发布时间,确实是3月9号: ( z0 y8 X; p! O. ^. G% i
我们再用网易新闻来看一下,相互激励 增进友谊(精彩绽放) |残奥|中国代表团|单板滑雪|夺金_网易政务[2] 这篇新闻对应的发布时间如下图所示:
1 K5 e; _& \8 I/ w; X6 ^- z. v {/ a3 ^ 现在我们用Requests获得它的源代码,然后再提取发布时间: 9 {8 Y* [/ h- l, v" v
发布日期确实对了,但是后面的时间怎么丢失了呢?如果想把时分秒保留下来,可以增加一个参数outputformat,它的值就是你在datetime.strftime里面输入的值:find_date(html, outputformat=
7 ]" ?1 |% }" V; [- R: {! ^6 \ N %Y-%m-%d %H:%M:%S)1.运行效果如下图所示:
* Q# S4 j$ `# w. b/ M+ h find_date的参数,除了网页源代码外,还可以传入URL,或者是lxml里面的Dom对象,例如:fromlxml.html import fromstringselector = fromstring(html)
5 ^& E }# X! V( o date = find_date(selector)1.2.3.4.参考文献[1] Gne: https://github.com/GeneralNewsExtractor/GeneralNewsExtractor + [6 F, @0 d7 X
[2] 相互激励 增进友谊(精彩绽放) |残奥|中国代表团|单板滑雪|夺金_网易政务: https://www.163.com/news/article/H28Q6NQ1000189FH.html来源: 未闻Code 0 I; R0 w: }" @( `
" b' ], G/ a; S3 W
, c2 n( o+ y: `# J
# I1 l+ f+ f9 X1 J
3 k: T$ _4 U* v/ b* w
|