找回密码
 加入怎通
查看: 570|回复: 1

[关于百度] 关于中文分词

[复制链接]
Sabey 发表于 2013-01-15 11:29:38 | 显示全部楼层 |阅读模式
本帖最后由 Sabey 于 2013-1-15 11:30 编辑
1 J4 a2 q7 n* W# {$ _8 w/ c. n0 W  L
一、什么是中文分词。中文分词指的是将一个汉语句子切分成一个一个单独的词,按照一定的规则重新组合成词序列的过程。这个也称做“中文切词”。4 B7 z9 D" Q6 H* Y2 M4 x
二、搜索引擎分词方法。(由祛痘三剑客提供)0 s. c1 C8 G2 s0 B) }: x
(一)、基于字典匹配的分词方法。
5 I5 c# I7 u- X1、正向最大匹配法(由左到右的方向)。例:“不知道你在说什么”这句话采用正向最大匹配法是这样分的。“不知道,你,在,说什么”。# X2 ~8 u! c, O3 Q
2、逆向最大匹配法(由右到左的方向)。例:不知道你在说什么”。反向最大匹配法来分这段是这样分的。“不,知道,你在,说,什么”。
. @3 N" }# ^/ E# v8 N8 q, d4 \1 U3、最少切分法(最短路径最大匹配法)(使每一句中切出的词数最小)。例:“不知道你在说什么”。最少切分法来分这段是这样分的。“不知道,你在,说什么”。: S  d/ v' v7 l8 A
4、双向最大匹配法(进行由左到右、由右到左两次扫描)。就是正向最大匹配法与逆向最大匹配法的结合。
1 b" m* V8 X1 z(二)、基于理解匹配的分词方法。; A" R5 v# c9 w) G) o
这种分词方法主要是通过机器模拟人的句法的理解,对其语义进行判断,以达到对句子的理解。其原理就是在分词的同时,进行句法、语义分析,通过句法信息和语法信息进行处理。其主要还是通过分词系统,句法系统对其歧义进行处理,然后总控出句子的意思。这种只是一个理论,并还没有真正的实施。
3 z) D, u7 y- D# `(三)、基于统计匹配的分词方法。/ T+ E# A2 a6 s. z
通过计算词语相邻出现的概率来确定是否是一个单独的词语。所以,掌握的上下文越多,对句子的理解就越准确,分词也越精确。举个例子说,“搜索引擎优化”,在字典中匹配出来可能是:搜索/引擎/优化、搜/索引/擎/优化,但经过后期的概率计算,发现“搜索引擎优化”在上下文相邻出现的次数非常多,那么基于统计就会将这个词语也加入进分词索引库。
9 j. r8 _+ ]! v1 `

暂时无法加载帖子列表

回复

使用道具 举报

00000 发表于 2026-09-09 09:55:19 | 显示全部楼层
蹲了这么久,终于看到有价值的讨论,支持一下!
回复

使用道具 举报

    您需要登录后才可以回帖 登录 | 加入怎通

    本版积分规则

    QQ|手机版|小黑屋|网站地图|真牛社区 ( 苏ICP备2023040716号-2 )

    GMT+8, 2026-9-12 02:34 , Processed in 0.036076 second(s), 26 queries , Gzip On.

    免责声明:本站信息来自互联网,本站不对其内容真实性负责,如有侵权等情况请联系420897364#qq.com(把#换成@)删除。

    Powered by Discuz! X3.5

    快速回复 返回顶部 返回列表