thulac4j

Chinese Word Segmentation Tool, THULAC的Java实现.

Github星跟蹤圖

thulac4j

thulac4j是THULAC的高效Java 8实现,具有分词速度快、准、强的特点;支持

  • 自定义词典
  • 繁体转简体
  • 停用词过滤

使用示例

在项目中使用thulac4j,添加依赖(请使用最新版本):

<dependency>
  <groupId>io.github.yizhiru</groupId>
  <artifactId>thulac4j</artifactId>
  <version>3.1.2</version>
</dependency>

thulac4j支持中文分词与词性标注,使用示例如下:

String sentence = "滔滔的流水,向着波士顿湾无声逝去";
List<String> words = Segmenter.segment(sentence);
// [滔滔, 的, 流水, ,, 向着, 波士顿湾, 无声, 逝去]

POSTagger pos = new POSTagger("models/model_c_model.bin", "models/model_c_dat.bin");
List<SegItem> words = pos.tagging(sentence);
// [滔滔/a, 的/u, 流水/n, ,/w, 向着/p, 波士顿湾/ns, 无声/v, 逝去/v]

模型数据较大,没有放在jar包与源码。训练模型下载及更多使用说明,请参看Wiki.

最后感谢THUNLP实验室!

主要指標

概覽
名稱與所有者yizhiru/thulac4j
主編程語言Java
編程語言Java (語言數: 1)
平台
許可證Apache License 2.0
所有者活动
創建於2017-03-03 01:00:21
推送於2021-04-12 06:10:51
最后一次提交2020-10-21 10:17:42
發布數1
最新版本名稱3.1.2 (發布於 )
第一版名稱3.1.2 (發布於 )
用户参与
星數86
關注者數10
派生數31
提交數33
已啟用問題?
問題數19
打開的問題數0
拉請求數2
打開的拉請求數0
關閉的拉請求數0
项目设置
已啟用Wiki?
已存檔?
是復刻?
已鎖定?
是鏡像?
是私有?