实训第十二天
SCWS 是 Simple Chinese Word Segmentation 的首字母縮寫(即:簡(jiǎn)易中文分詞系統(tǒng))。
這是一套基于詞頻詞典的機(jī)械式中文分詞引擎,它能將一整段的中文文本基本正確地切分成詞。 詞是中文的最小語素單位,但在書寫時(shí)并不像英語會(huì)在詞之間用空格分開, 所以如何準(zhǔn)確并快速分詞一直是中文分詞的攻關(guān)難點(diǎn)。
SCWS 采用純 C 語言開發(fā),不依賴任何外部庫函數(shù),可直接使用動(dòng)態(tài)鏈接庫嵌入應(yīng)用程序, 支持的中文編碼包括 GBK、UTF-8 等。此外還提供了 PHP 擴(kuò)展模塊, 可在 PHP 中快速而方便地使用分詞功能。
分詞算法上并無太多創(chuàng)新成分,采用的是自己采集的詞頻詞典,并輔以一定的專有名稱,人名,地名, 數(shù)字年代等規(guī)則識(shí)別來達(dá)到基本分詞,經(jīng)小范圍測(cè)試準(zhǔn)確率在 90% ~ 95% 之間, 基本上能滿足一些小型搜索引擎、關(guān)鍵字提取等場(chǎng)合運(yùn)用。首次雛形版本發(fā)布于 2005 年底。
SCWS 由 hightman 開發(fā), 并以 BSD 許可協(xié)議開源發(fā)布,源碼托管在 github。
這是我們抓取的微博數(shù)據(jù),以Excle形式保存數(shù)據(jù)。
?
轉(zhuǎn)載于:https://www.cnblogs.com/hzsy/p/5858673.html
總結(jié)
- 上一篇: [svc]visio绘制模具
- 下一篇: Codeforces 712C. Mem