日本一卡精品视频免费丨国产午夜片无码区在线播放丨国产精品成人久久久久久久丨国产亚洲日韩av在线播放不卡丨亚洲日韩av无码

TF-IDF算法及其對關鍵詞布局方面的權重分布

2014/6/26 14:16:39   閱讀:10528    發布者:10528
概念
TF-IDF(term frequency–inverse document frequency)是一種用于資訊檢索與資訊探勘的常用加權技術。TF-IDF是一種統計方法,用以評估一字詞對于一個文件集或一個語料庫中的其中一份文件的重要程度。字詞的重要性隨著它在文件中出現的次數成正比增加,但同時會隨著它在語料庫中出現的頻率成反比下降。TF-IDF加權的各種形式常被搜尋引擎應用,作為文件與用戶查詢之間相關程度的度量或評級。除了TF-IDF以外,因特網上的搜尋引擎還會使用基于連結分析的評級方法,以確定文件在搜尋結果中出現的順序。

原理
在一份給定的文件里,詞頻 (term frequency, TF) 指的是某一個給定的詞語在該文件中出現的次數。這個數字通常會被歸一化(分子一般小于分母 區別于IDF),以防止它偏向長的文件。(同一個詞語在長文件里可能會比短文件有更高的詞頻,而不管該詞語重要與否。)
逆向文件頻率 (inverse document frequency, IDF) 是一個詞語普遍重要性的度量。某一特定詞語的IDF,可以由總文件數目除以包含該詞語之文件的數目,再將得到的商取對數得到。
某一特定文件內的高詞語頻率,以及該詞語在整個文件集合中的低文件頻率,可以產生出高權重的TF-IDF。因此,TF-IDF傾向于過濾掉常見的詞語,保留重要的詞語。
TFIDF的主要思想是:如果某個詞或短語在一篇文章中出現的頻率TF高,并且在其他文章中很少出現,則認為此詞或者短語具有很好的類別區分能力,適合用來分類。TFIDF實際上是:TF * IDF,TF詞頻(Term Frequency),IDF反文檔頻率(Inverse Document Frequency)。TF表示詞條在文檔d中出現的頻率(另一說:TF詞頻(Term Frequency)指的是某一個給定的詞語在該文件中出現的次數)。IDF的主要思想是:如果包含詞條t的文檔越少,也就是n越小,IDF越大,則說明詞條t具有很好的類別區分能力。如果某一類文檔C中包含詞條t的文檔數為m,而其它類包含t的文檔總數為k,顯然所有包含t的文檔數n=m+k,當m大的時候,n也大,按照IDF公式得到的IDF的值會小,就說明該詞條t類別區分能力不強。(另一說:IDF反文檔頻率(Inverse Document Frequency)是指果包含詞條的文檔越少,IDF越大,則說明詞條具有很好的類別區分能力。)但是實際上,如果一個詞條在一個類的文檔中頻繁出現,則說明該詞條能夠很好代表這個類的文本的特征,這樣的詞條應該給它們賦予較高的權重,并選來作為該類文本的特征詞以區別與其它類文檔。這就是IDF的不足之處.
在一份給定的文件里,詞頻(term frequency,TF)指的是某一個給定的詞語在該文件中出現的頻率。這個數字是對詞數(term count)的歸一化,以防止它偏向長的文件。(同一個詞語在長文件里可能會比短文件有更高的詞數,而不管該詞語重要與否。)對于在某一特定文件里的詞語
主站蜘蛛池模板: 亚洲久热无码av中文字幕| 精品久久一区二区三区| 国产又粗又猛又爽又黄的视频在线观看动漫 | 国产极品久久| 亚洲阿v天堂在线| 真实国产精品视频400部| 日皮毛片| 我把护士日出水了视频90分钟| 国产3p露脸普通话对白| 波多野结衣视频观看| 可以看三级的网站| 精品少妇人妻av一区二区| 九九热九九| 亚洲一区二区三区av无码| 国产真实愉拍系列在线视频| 久久影音先锋| 精品露脸国产偷人在视频| 亚洲精品网站日本xxxxxxx| 性激情视频| 日本极品少妇xxxx| 天堂av在线免费| 极品熟妇大蝴蝶20p| 精品99久久久| 影音先锋在线资源无码| 曰韩黄色一级片| 国产做无码视频在线观看| jizz免费看| 亚洲呦女专区| 一个人看的www视频在线播放| 久久人人爽天天玩人人妻精品| 久久久久国产精品免费免费搜索 | 69视频在线看| 欧美成人一区二区三区片免费| 国产精品国产亚洲区艳妇糸列短篇| 国产精品99久久精品爆乳| 亚洲欧美激情在线| 两个人看的www免费视频中文| a色网站|