![Python自然语言处理(微课版)](https://wfqqreader-1252317822.image.myqcloud.com/cover/869/44509869/b_44509869.jpg)
上QQ阅读APP看书,第一时间看更新
1.5.5 搜狗新闻语料库
搜狗新闻语料库,下载地址为http://www.sogou.com/labs/resource/cs.php,如图1-14所示。
搜狐新闻数据(SogouCS)请直接下载精简版,文件为SogouCS.reduced.tar.gz,解压到d:\SogouCS.reduced,共有128个文本文件,如图1-15所示。
每一个txt文件采用ANSI编码,内容是XML格式化,如图1-16所示。
将每个txt文件根据url、contenttitle、content进行拆分,具体含义如下。
· url:获取内容类别。
· contenttitle:获取内容标题,作为txt的文档名。
· content:正文内容。
![](https://epubservercos.yuewen.com/CC79B0/23721531409454406/epubprivate/OEBPS/Images/Figure-P31_2511.jpg?sign=1739230743-9sZzUHqV494hAd74mo8sRR6Dg7TDutFY-0-bafa86f172022442492b9f5c3be74045)
图1-14 搜狗新闻语料库网页
![](https://epubservercos.yuewen.com/CC79B0/23721531409454406/epubprivate/OEBPS/Images/Figure-P31_2514.jpg?sign=1739230743-C07hKRgK8xbiLffxO9fXqXBznicBbzlq-0-93377f4aca00c02ced007c7f50c818c0)
图1-15 下载搜狗新闻语料库
![](https://epubservercos.yuewen.com/CC79B0/23721531409454406/epubprivate/OEBPS/Images/Figure-P32_2519.jpg?sign=1739230743-6sGK9Up2omSuSHibjzOFDu4ECbdcKblb-0-02238f7cd21b3a990ca61fe1f1a98142)
图1-16 文件内容
代码如下。
![](https://epubservercos.yuewen.com/CC79B0/23721531409454406/epubprivate/OEBPS/Images/Figure-P32_2522.jpg?sign=1739230743-i80HXwiuIlV7rrGfobHmUDBiPOCsmWtE-0-1cef2e274322c315a4e5a4fc5d9dfb13)
最终数据集整理为15个类别,如图1-17所示。
![](https://epubservercos.yuewen.com/CC79B0/23721531409454406/epubprivate/OEBPS/Images/Figure-P33_2527.jpg?sign=1739230743-pP4ZQ1zqaGLNnMkz9dbonTfbNB9oxftW-0-8d01d0b7d33679c7a9acabff81be983c)
图1-17 语料集分类