|
0 w; \% T: `: y) x( g
作者:kingnameGne[1]虽然在提取新闻正文的时候,准确率比较高,但由于提取新闻发布时间使用的是正则表达式,因此提取效果有时候不那么让人满意最近我发现Python的一个第三方库,叫做htmldate,经过测试,它提取新闻的发布时间比较准确。 9 e* v) |% J3 q% w5 o
我们来看看这个库怎么使用首先使用pip安装:python3 -m pip install htmldate1.然后,我们使用Requests或者Selenium获得网站的源代码:import requests
" o1 Q$ u$ A2 o from htmldate
3 o8 z- S5 [6 P; Z import find_date8 t g$ S9 @% F0 J3 t$ ?; f
html = requests.get(https://www.kingname.info/2022/03/09/this-is-gnelist/).content.decode(utf-8) 4 h2 m" {1 F1 k0 F6 C/ u0 |3 S: }
2 r' e C, `/ b date = find_date(html)1 v3 b; V* x! S
print(date)1.2.3.4.5.运行效果如下图所示: $ O+ I# E0 F3 |" N& D* z
而这篇文章的发布时间,确实是3月9号:
5 K, }. x" G) Y) I4 L2 T 我们再用网易新闻来看一下,相互激励 增进友谊(精彩绽放) |残奥|中国代表团|单板滑雪|夺金_网易政务[2] 这篇新闻对应的发布时间如下图所示:
6 h2 @3 s6 p( u) ` 现在我们用Requests获得它的源代码,然后再提取发布时间: ) M3 f. Z/ a3 E A1 U
发布日期确实对了,但是后面的时间怎么丢失了呢?如果想把时分秒保留下来,可以增加一个参数outputformat,它的值就是你在datetime.strftime里面输入的值:find_date(html, outputformat= ) h1 n6 X4 f6 {$ B5 }9 N' ^
%Y-%m-%d %H:%M:%S)1.运行效果如下图所示: 4 v6 {, H/ O( W U( }+ u) l0 W
find_date的参数,除了网页源代码外,还可以传入URL,或者是lxml里面的Dom对象,例如:fromlxml.html import fromstringselector = fromstring(html)
: m" H" e9 C3 Q! n date = find_date(selector)1.2.3.4.参考文献[1] Gne: https://github.com/GeneralNewsExtractor/GeneralNewsExtractor 2 S2 d1 A; s1 x0 X% C: W% F3 [: d
[2] 相互激励 增进友谊(精彩绽放) |残奥|中国代表团|单板滑雪|夺金_网易政务: https://www.163.com/news/article/H28Q6NQ1000189FH.html来源: 未闻Code 8 q: N- z4 @4 T5 z' @# S" D
! Y N; u' ^5 G
& j/ p6 N7 Z2 ?; I6 U6 w+ A' h+ V4 r: R
, v5 |- u6 ~1 j. G6 d2 Z
|