|
5 q+ v9 l8 h$ C+ D+ T5 C
作者:kingnameGne[1]虽然在提取新闻正文的时候,准确率比较高,但由于提取新闻发布时间使用的是正则表达式,因此提取效果有时候不那么让人满意最近我发现Python的一个第三方库,叫做htmldate,经过测试,它提取新闻的发布时间比较准确。 4 B% H; I, @+ J m6 ^, w% C" x
我们来看看这个库怎么使用首先使用pip安装:python3 -m pip install htmldate1.然后,我们使用Requests或者Selenium获得网站的源代码:import requests: v/ @, O& j2 v% S; {
from htmldate 8 q g$ v3 D1 e
import find_date
" d' V9 e) X4 H6 n' r1 k html = requests.get(https://www.kingname.info/2022/03/09/this-is-gnelist/).content.decode(utf-8) * d3 q* e, H% D! a K. B
0 G" K V5 ?# A4 M: }7 z date = find_date(html)& f6 k4 _! P% K+ Y4 y9 g8 _& C
print(date)1.2.3.4.5.运行效果如下图所示: 8 V w" |; m$ Y! n4 W' u' T5 w
而这篇文章的发布时间,确实是3月9号: ' C9 r0 a* |3 S: q5 q& q" m1 B1 A; f
我们再用网易新闻来看一下,相互激励 增进友谊(精彩绽放) |残奥|中国代表团|单板滑雪|夺金_网易政务[2] 这篇新闻对应的发布时间如下图所示: 8 ~! w3 J7 T; Q( Q
现在我们用Requests获得它的源代码,然后再提取发布时间: ) T. q3 H4 y+ e G& w- z1 y+ \
发布日期确实对了,但是后面的时间怎么丢失了呢?如果想把时分秒保留下来,可以增加一个参数outputformat,它的值就是你在datetime.strftime里面输入的值:find_date(html, outputformat=
* q. R3 Z. C7 _ %Y-%m-%d %H:%M:%S)1.运行效果如下图所示:
3 O8 _$ N& ]" P ] find_date的参数,除了网页源代码外,还可以传入URL,或者是lxml里面的Dom对象,例如:fromlxml.html import fromstringselector = fromstring(html)
2 G$ T" ~" z9 h! v% O date = find_date(selector)1.2.3.4.参考文献[1] Gne: https://github.com/GeneralNewsExtractor/GeneralNewsExtractor : S: s9 m* j% J7 b% l
[2] 相互激励 增进友谊(精彩绽放) |残奥|中国代表团|单板滑雪|夺金_网易政务: https://www.163.com/news/article/H28Q6NQ1000189FH.html来源: 未闻Code . S7 V6 b' T- Z5 G
5 o' j5 Y& l' {" ~( o
7 A9 l' W$ }- n1 t/ H9 P9 h
6 l# D+ g7 @. H6 q$ f* W; v
2 W9 o- j" Y; P# f |