|
% p7 i& h( p8 L3 o) [% @ 作者:kingnameGne[1]虽然在提取新闻正文的时候,准确率比较高,但由于提取新闻发布时间使用的是正则表达式,因此提取效果有时候不那么让人满意最近我发现Python的一个第三方库,叫做htmldate,经过测试,它提取新闻的发布时间比较准确。 2 [' {( } V: p2 U% B% v! Q1 t
我们来看看这个库怎么使用首先使用pip安装:python3 -m pip install htmldate1.然后,我们使用Requests或者Selenium获得网站的源代码:import requests
( \9 }$ I3 ?" k6 { from htmldate & e6 j6 L. f2 r- ?9 ]
import find_date9 H2 J' L2 }! p- x$ l8 z
html = requests.get(https://www.kingname.info/2022/03/09/this-is-gnelist/).content.decode(utf-8)
% o1 L( W. j( H7 |* V% a P + ~5 d% J s. Z/ ]9 ~$ y' T* y3 m
date = find_date(html)8 K& i& ]4 Z( P" Q; s: Z! p
print(date)1.2.3.4.5.运行效果如下图所示: 8 |" W, V9 F: W6 w# z. `# W, [, N/ D
而这篇文章的发布时间,确实是3月9号: O; q' r( C3 X0 U3 H' i( V* R
我们再用网易新闻来看一下,相互激励 增进友谊(精彩绽放) |残奥|中国代表团|单板滑雪|夺金_网易政务[2] 这篇新闻对应的发布时间如下图所示:
& z2 N2 S( c T( y+ M5 U' b 现在我们用Requests获得它的源代码,然后再提取发布时间:
) j3 m4 ]1 {$ Q5 C, u: Z3 L: O 发布日期确实对了,但是后面的时间怎么丢失了呢?如果想把时分秒保留下来,可以增加一个参数outputformat,它的值就是你在datetime.strftime里面输入的值:find_date(html, outputformat=
8 o/ S* F3 N6 X" N, O9 \ %Y-%m-%d %H:%M:%S)1.运行效果如下图所示:
/ V! c) ?% k1 c& ` find_date的参数,除了网页源代码外,还可以传入URL,或者是lxml里面的Dom对象,例如:fromlxml.html import fromstringselector = fromstring(html)
1 y7 A9 }, P( x* K+ t& e! W date = find_date(selector)1.2.3.4.参考文献[1] Gne: https://github.com/GeneralNewsExtractor/GeneralNewsExtractor ' x1 v: G: m' Q& U
[2] 相互激励 增进友谊(精彩绽放) |残奥|中国代表团|单板滑雪|夺金_网易政务: https://www.163.com/news/article/H28Q6NQ1000189FH.html来源: 未闻Code + e% J0 R1 \8 h; e: f1 t6 ~
1 g$ `+ q, ~- w5 u
8 r r. q, Q% Z2 ^1 P
. B- f8 b3 W8 Z3 S; k/ C# B3 b7 ^3 x7 Q1 [+ x9 K
|