Nothing
文件后缀名代表的是词典的编码方式。 比如filename.utf8 是 utf8编码,filename.gbk 是 gbk编码方式。
作为最大概率法(MPSegment: Max Probability)分词所使用的词典。
作为隐式马尔科夫模型(HMMSegment: Hidden Markov Model)分词所使用的词典。
对于MixSegment(混合MPSegment和HMMSegment两者)则同时使用以上两个词典
IDF(Inverse Document Frequency) 在KeywordExtractor中,使用的是经典的TF-IDF算法,所以需要这么一个词典提供IDF信息。
停用词词典
Any scripts or data that you put into this service are public.
Add the following code to your website.
For more information on customizing the embed code, read Embedding Snippets.