四虎精品视频-四虎精品成人免费网站-四虎黄色网-四虎国产视频-国产免费91-国产蜜臀97一区二区三区

PHPAnalysis中文分詞類詳解

phpAnalysis是目前廣泛使用的中文分詞類,使用反向匹配模式分詞,因此兼容編碼更廣泛,現(xiàn)將其變量與常用函數(shù)詳解如下:

一、比較重要的成員變量

$resultType   = 1        生成的分詞結(jié)果數(shù)據(jù)類型(1 為全部, 2為 詞典詞匯及單個(gè)中日韓簡(jiǎn)繁字符及英文, 3 為詞典詞匯及英文)
                                    這個(gè)變量一般用 SetResultType( $rstype ) 這方法進(jìn)行設(shè)置。
$notSplitLen  = 5        切分句子最短長(zhǎng)度
$toLower      = false    把英文單詞全部轉(zhuǎn)小寫(xiě)
$differMax    = false    使用最大切分模式對(duì)二元詞進(jìn)行消岐
$unitWord     = true     嘗試合并單字(即是新詞識(shí)別)
$differFreq   = false    使用熱門(mén)詞優(yōu)先模式進(jìn)行消岐

二、主要成員函數(shù)列表

1、public function __construct($source_charset='utf-8', $target_charset='utf-8', $load_all=true, $source='')
函數(shù)說(shuō)明:構(gòu)造函數(shù)
參數(shù)列表:
$source_charset      源字符串編碼
$target_charset      目錄字符串編碼
$load_all            是否完全加載詞典(此參數(shù)已經(jīng)作廢)
$source              源字符串
如果輸入輸出都是utf-8,實(shí)際上可以不必使用任何參數(shù)進(jìn)行初始化,而是通過(guò) SetSource 方法設(shè)置要操作的文本

2、public function SetSource( $source, $source_charset='utf-8', $target_charset='utf-8' )
函數(shù)說(shuō)明:設(shè)置源字符串
參數(shù)列表:
$source              源字符串
$source_charset      源字符串編碼
$target_charset      目錄字符串編碼
返回值:bool

3、public function StartAnalysis($optimize=true)
函數(shù)說(shuō)明:開(kāi)始執(zhí)行分詞操作
參數(shù)列表:
$optimize            分詞后是否嘗試優(yōu)化結(jié)果
返回值:void
一個(gè)基本的分詞過(guò)程:
//////////////////////////////////////
$pa = new phpAnalysis();

$pa->SetSource('需要進(jìn)行分詞的字符串');

//設(shè)置分詞屬性
$pa->resultType = 2;
$pa->differMax  = true;

$pa->StartAnalysis();

//獲取你想要的結(jié)果
$pa->GetFinallyIndex();
////////////////////////////////////////

4、public function SetResultType( $rstype )
函數(shù)說(shuō)明:設(shè)置返回結(jié)果的類型
實(shí)際是對(duì)成員變量$resultType的操作
參數(shù) $rstype 值為:
1 為全部, 2為 詞典詞匯及單個(gè)中日韓簡(jiǎn)繁字符及英文, 3 為詞典詞匯及英文
返回值:void

5、public function GetFinallyKeywords( $num = 10 )
函數(shù)說(shuō)明:獲取出現(xiàn)頻率最高的指定詞條數(shù)(通常用于提取文檔關(guān)鍵字)
參數(shù)列表:
$num = 10  返回詞條個(gè)數(shù)
返回值:用","分隔的關(guān)鍵字列表

6、public function GetFinallyResult($spword=' ')
函數(shù)說(shuō)明:獲得最終分詞結(jié)果
參數(shù)列表:
$spword    詞條之間的分隔符
返回值:string

7、public function GetSimpleResult()
函數(shù)說(shuō)明:獲得粗分結(jié)果
返回值:array

8、public function GetSimpleResultAll()
函數(shù)說(shuō)明:獲得包含屬性信息的粗分結(jié)果
屬性(1中文詞句、2 ANSI詞匯(包括全角),3 ANSI標(biāo)點(diǎn)符號(hào)(包括全角),4數(shù)字(包括全角),5 中文標(biāo)點(diǎn)或無(wú)法識(shí)別字符)
返回值:array

9、public function GetFinallyIndex()
函數(shù)說(shuō)明:獲取hash索引數(shù)組
返回值:array('word'=>count,...) 按出現(xiàn)頻率排序

10、public function MakeDict( $source_file, $target_file='' )
函數(shù)說(shuō)明:把文本文件詞庫(kù)編譯成詞典
參數(shù)列表:
$source_file   源文本文件
$target_file   目標(biāo)文件(如果不指定,則為當(dāng)前詞典)
返回值:void

11、public function ExportDict( $targetfile )
函數(shù)說(shuō)明:導(dǎo)出當(dāng)前詞典全部詞條為文本文件
參數(shù)列表:
$targetfile  目標(biāo)文件
返回值:void

php技術(shù)PHPAnalysis中文分詞類詳解,轉(zhuǎn)載需保留來(lái)源!

鄭重聲明:本文版權(quán)歸原作者所有,轉(zhuǎn)載文章僅為傳播更多信息之目的,如作者信息標(biāo)記有誤,請(qǐng)第一時(shí)間聯(lián)系我們修改或刪除,多謝。

主站蜘蛛池模板: 东莞回忆录| 二年级合并综合算式题| 韩国电影闵度允主演电影| 辛颖| 免费观看污视频网站| 爱的替身| 黄姓的研究报告| 日别视频| 诡娃| 鬼龙院花子的一生| 87版七仙女台湾| 邓伦是石家庄哪里的| 小妖怪的夏天| 抖音下载安装| 朱莉·安妮| 代高政最新短剧| 电影《醉猴》刘家良主演| 禁忌爱情| 八年级上册英语第三单元2b翻译| 红电视剧演员表| 地火电视剧38集| 小镇姑娘高清在线观看| 按摩服务电影| 侦探们的镇魂歌国语版在线观看| 风之谷钢琴谱| sarajay大白臀ryanconner| 寡妇激情| 台州林毅| 刘浩存个人资料简介图片| 施华| 叶玲| 路易斯·帕特里奇| 我是特种兵免费观看完整版| 试衣间电影| 成年黄色在线观看| 冰之下| 超薄轻舞玉女女裤广场舞| (一等奖)班主任经验交流ppt课件| 小小少年电影完整版| 电影院线| 玉林电视台|