好湿?好紧?好多水好爽自慰,久久久噜久噜久久综合,成人做爰A片免费看黄冈,机机对机机30分钟无遮挡

主頁 > 知識庫 > python基礎之停用詞過濾詳解

python基礎之停用詞過濾詳解

熱門標簽:浙江電銷卡外呼系統好用嗎 南京銷售外呼系統軟件 地圖標注微信發送位置不顯示 地圖制圖標注位置改變是移位嗎 315電話機器人廣告 蓋州市地圖標注 地圖標注的意義點 上海機器人外呼系統哪家好 房產電銷外呼系統

一、什么是停用詞

在漢語中,有一類沒有多少意義的詞語,比如組詞“的”,連詞“以及”、副詞“甚至”,語氣詞“吧”,被稱為停用詞。一個句子去掉這些停用詞,并不影響理解。所以,進行自然語言處理時,我們一般將停用詞過濾掉。

而HanLP庫提供了一個小巧的停用詞字典,它位于Lib\site-packages\pyhanlp\static\data\dictionary目錄中,名字為:stopwords.txt。該文本收錄了常見的中英文無意義的詞匯,每行一個詞語。示例如下:

我們在進行自然語言處理時,可以用BinTrie、DoubleArrayTrie和AhoCorasickDoubleArrayTrie中的任意一個來存儲詞典。考慮到該詞典中都是短語且比較多,用雙數組字典樹更劃算,處理時間更快。

二、加載停用詞字典

通過前文的介紹,我們知道了使用雙數組字典樹加載停用詞字典更劃算。下面,我們來加載其停用詞,并返回鍵值對結構。代碼如下:

def load_dictionary(path):
    map=JClass('java.util.TreeMap')()
    with open(path,encoding='utf-8') as src:
        for word in src:
            word=word.strip()
            map[word]=word
    return JClass('com.hankcs.hanlp.collection.trie.DoubleArrayTrie')(map)

三、刪除停用詞

通過上面的停用詞加載,我們獲取了DoubleArrayTrie樹結構的詞匯。如果要刪除停用詞,可以直接使用分詞后的結果剔除停用詞即可。剔除的方法如下:

def remove_stopwords(termlist,trie):
    return [term.word for term in termlist if not trie.containsKey(term.word)]

四、分詞以及刪除停用詞

在前面的博文中,我們已經學會了如何分詞,現在我們又學會了如何剔除停用詞。這里,我們將兩者結合起來,實現分詞效果。代碼如下:

if __name__ == "__main__":
    HanLP.Config.ShowTermNature=False
    trie=load_dictionary(HanLP.Config.CoreStopWordDictionaryPath)
    text="今天就這樣吧!明天我們在說可以嗎?"
    segment=DoubleArrayTrieSegment()
    termlist=segment.seg(text)
    print("分詞結果",termlist)
    print("去掉停用詞",remove_stopwords(termlist,trie))

運行之后,得到如下結果:

五、直接刪除停用詞(不分詞)

對應上面的結果,我們先分詞在刪除停用詞。但是,有時候我們也喜歡先刪除停用詞在進行分詞。下面,我們來實現直接刪除停用詞。

代碼如下:

#直接過濾方法
def direct_remove_stopwords(text,replacement,trie):
    JString=JClass('java.lang.String')
    searcher=trie.getLongestSearcher(JString(text),0)
    offset=0
    result=''
    while searcher.next():
        begin=searcher.begin
        end=begin+searcher.length
        if begin>offset:
            result+=text[offset:begin]
            result+=replacement
            offset=end
    if offsetlen(text):
        result+=text[offset:]
    return result


if __name__ == "__main__":
    HanLP.Config.ShowTermNature = False
    trie = load_dictionary(HanLP.Config.CoreStopWordDictionaryPath)
    text = "今天就這樣吧!明天我們在說可以嗎?"
    segment = DoubleArrayTrieSegment()
    termlist = segment.seg(text)
    print("分詞結果", termlist)
    print("去掉停用詞", remove_stopwords(termlist, trie))
    print("不分詞去掉停用詞", direct_remove_stopwords(text, "**", trie))

運行之后,效果如下:

到此這篇關于python基礎之停用詞過濾詳解的文章就介紹到這了,更多相關python停用詞過濾內容請搜索腳本之家以前的文章或繼續瀏覽下面的相關文章希望大家以后多多支持腳本之家!

您可能感興趣的文章:
  • python使用jieba實現中文分詞去停用詞方法示例
  • 利用Python過濾相似文本的簡單方法示例
  • Python實現敏感詞過濾的4種方法
  • Python過濾序列元素的方法
  • python numpy實現多次循環讀取文件 等間隔過濾數據示例
  • python正則過濾字母、中文、數字及特殊字符方法詳解

標簽:雙鴨山 陽泉 赤峰 克拉瑪依 貴州 日照 臨汾 金華

巨人網絡通訊聲明:本文標題《python基礎之停用詞過濾詳解》,本文關鍵詞  python,基礎,之停,用詞,過濾,;如發現本文內容存在版權問題,煩請提供相關信息告之我們,我們將及時溝通與處理。本站內容系統采集于網絡,涉及言論、版權與本站無關。
  • 相關文章
  • 下面列出與本文章《python基礎之停用詞過濾詳解》相關的同類信息!
  • 本頁收集關于python基礎之停用詞過濾詳解的相關信息資訊供網民參考!
  • 推薦文章
    主站蜘蛛池模板: 美女巨胸喷奶水gif放肆吧| 91精品国产自产老师啪| 美女光屁股图片| h文大全| 无限视频免费看片| 肉臀大屁股熟妇喷潮抽搐HD| 亚洲国产成人毛片久热直播 | 视频一级A片抄老女人| 久久精品伊人波多野结| 久久青青草原综合久久一品道| 91丨国产丨白浆秘?喷水| 八戒8戒午夜| 护士强制榨精漫画3d| 国产乱老熟视频乱老熟女| 亚洲国产精华液网站\| 我被c了半小时还要想要,为什么| 他从后面使劲揉捏着双乳| 国语性猛交xxxx乱大交| 免费未删减黄韩漫画网站| 日产精品一卡2卡三卡四卡的区别| 日韩啊v| 黑黑的长长的硬硬的是什么| 婬荡的秘书呻吟波多野结衣| 3d姉弟とイン动漫在线观看| 戳女人屁股流水羞羞漫画| yw193.c国产在线观看| 啊灬用力啊灬啊灬快灬深| JULIA无码无套在线播放| 99se国产高清视频在线观看| 浪货你这里又湿又软bl| 日本护士在线视频xxxx免费| 色多多www| 少妇婬荡呻吟揉捏丰满奶头网站| 亚洲综合在线观看一区| 午夜时刻| 隔壁小寡妇让我爽了一夜| 国产精品福利片一、二区| 美腿的呻吟| 美女脱了内裤露出尿囗无遮挡| 校草轻点疼涨高h| 国产绿帽娇妻找猛男3p视频|