|
3 ]/ W& Y) m8 u# y 作者:kingnameGne[1]虽然在提取新闻正文的时候,准确率比较高,但由于提取新闻发布时间使用的是正则表达式,因此提取效果有时候不那么让人满意最近我发现Python的一个第三方库,叫做htmldate,经过测试,它提取新闻的发布时间比较准确。 9 r: f, M! u0 ~( H
我们来看看这个库怎么使用首先使用pip安装:python3 -m pip install htmldate1.然后,我们使用Requests或者Selenium获得网站的源代码:import requests- X8 v7 o S0 R2 M5 L
from htmldate ) C: ^) D6 R% l
import find_date4 J9 ^4 v1 [& z2 g
html = requests.get(https://www.kingname.info/2022/03/09/this-is-gnelist/).content.decode(utf-8)
& }( J. y: `/ J8 O
( K, j. N8 G% Y( E4 w date = find_date(html)
: @1 R- ]8 P5 i& d6 q% c* I+ x print(date)1.2.3.4.5.运行效果如下图所示:
. q! T3 O; B- P& V# A0 x1 w 而这篇文章的发布时间,确实是3月9号:
: @0 b7 R- A. t2 X3 \+ m3 M6 R 我们再用网易新闻来看一下,相互激励 增进友谊(精彩绽放) |残奥|中国代表团|单板滑雪|夺金_网易政务[2] 这篇新闻对应的发布时间如下图所示: . S8 G- T; |1 O
现在我们用Requests获得它的源代码,然后再提取发布时间:
) Q" `" t: {( o7 S0 s% I: o 发布日期确实对了,但是后面的时间怎么丢失了呢?如果想把时分秒保留下来,可以增加一个参数outputformat,它的值就是你在datetime.strftime里面输入的值:find_date(html, outputformat= $ c# ^. z* d2 a1 F# z
%Y-%m-%d %H:%M:%S)1.运行效果如下图所示:
' I0 |1 n) _! r, G2 r find_date的参数,除了网页源代码外,还可以传入URL,或者是lxml里面的Dom对象,例如:fromlxml.html import fromstringselector = fromstring(html) 5 q5 X$ }" _8 c) f* a8 M5 O
date = find_date(selector)1.2.3.4.参考文献[1] Gne: https://github.com/GeneralNewsExtractor/GeneralNewsExtractor k# s' `6 l7 {6 w8 H5 {5 }" ]
[2] 相互激励 增进友谊(精彩绽放) |残奥|中国代表团|单板滑雪|夺金_网易政务: https://www.163.com/news/article/H28Q6NQ1000189FH.html来源: 未闻Code ' m. e4 Q1 E& [* U* F- L
, e1 Z7 z5 V; X% g
. s+ s% y! E( s& k" i2 O
& H1 X. E; ^5 i( ^! H5 m7 W: C# j1 n7 G4 e& e& h
|