今天在R-ladies 分享語意角色標註,寫個日誌來紀念這一天和自己的成長。

請見:https://github.com/rladiestaipei/R-Main-Panel/blob/master/2017/201712_語意角色標註.pdf

p.s 感謝R leadies 提供網路空間 :) 

這些年開始對語意有更深一層的認識,除了淺層的語意之外,也開始玩語意理解的相關技術,讀paper的時候覺得異常快樂。

已經開始在思考下次的R- Leadies分享的內容了XDD

HaoWei 發表在 痞客邦 留言(0) 人氣()

近期看到解釋W2V的算法中最詳實的文章!!推

http://blog.csdn.net/mytestmy/article/details/26969149

HaoWei 發表在 痞客邦 留言(0) 人氣()


由於維基百科擁有相對完整的覆蓋率,實現文字向量時(如word2vec),  我使用維基百科來作為我的輸入資料,
為了將維基百科的文字題取出來,我作了以下的步驟,來做機器學習的準備資料。

HaoWei 發表在 痞客邦 留言(0) 人氣()

在實現語意理解的過程,我們有時候會需要用到一些frame來實作,在這個教學中,我們即將使用 verbnet 的jar 檔案 以及他公開的資料庫來抓取verbnet的語意框架,只需要兩步驟就可以讓sample code跑起來

1. downlaod jar:  http://projects.csail.mit.edu/jverbnet/

2. download :  http://verbs.colorado.edu/verbnet_downloads/downloads.html

3. sample code :

註解: 我在現行的project下產生一個名為Data的資料夾,並把資料放在裡面

HaoWei 發表在 痞客邦 留言(0) 人氣()

在中文裡頭,有些句意是沒有辦法直接從文字中判斷的,例如:誰說我喜歡姚明。
有這樣的差別是因為,中文是重視『形會』的語言。(請參考之前的文章),因此有些意涵並沒有辦法直接從句子中看到;
再舉一個例子,
          當朋友們出遊時,唯獨漏了阿宅東東,東東問:『怎沒揪?』;小明回答:『你最好會去!』
在這樣的語境之下,我們知道『你最好會去!』這句話暗示小明根本不會跟,但我們沒有辦法直接從語法結構上直接看到這樣的暗示。

HaoWei 發表在 痞客邦 留言(0) 人氣()

在中文文字使用的時候,母語人士習慣『會意』,而英文使用時,母語人士習慣用『形意』。
之前有個腦波研究實驗:在給定中文與英文的語言之後,觀察中、英文母語人士的腦波變化。
其中N-300 與 P-600分別代表處發『語意錯誤』以及 『文法錯誤』;而母語為中文的人,較多的處發為語意錯誤,而母語為英文的人,較多的處發為文法錯誤。
可見英文是比較偏重句法結構的語言,而中文則比較偏重意會理解。
———————————————————————篇章小插曲:關於助動詞-------------------------------------------------------------------

HaoWei 發表在 痞客邦 留言(0) 人氣()

緒論:
  1. 語言通常有三個重要的層次:聲音、形式和意義.在三個層次中,意義是最重要的一層。透過多變的句法形式去做語意分析,已捕獲句子意義的性質
  2. 語句關係的兩個派別:Dependency & Constraint

HaoWei 發表在 痞客邦 留言(0) 人氣()

記得當初在apple電腦上學cml line的時候頭超大der,

但用就了就會發現常用的就是那幾個,然後..不常用的以後在google就是。

這裡要來介紹幾個常用的指令,

HaoWei 發表在 痞客邦 留言(0) 人氣()

解碼問題超棘手der,尤其對常處理文字的工程師來說...嗚嗚

譬如從同事的執行檔中得到big5的程式,但是你的程式主要是針對utf-8做處理,就會產生一系列的麻煩..冏

這裡小筆記一下如何從big5轉到utf-8的指令:

HaoWei 發表在 痞客邦 留言(1) 人氣()

還記得上一章有分享如何進行自然語言處理嗎?處理文章的雛形通常會長成一棵樹的樣子(我們稱之為parser tree) 而這棵樹中充滿了字與字之間的關係,

來快速帶過如何產生parser tree的步驟:

先將句子斷詞 > 進行詞性標記pos > 定義文法規則 chunk > 建構 parser tree

HaoWei 發表在 痞客邦 留言(0) 人氣()

螢幕快照 2015-11-26 下午9.12.10.png

既然標榜15行code解決,就先把code貼上來不囉嗦!(還附上精美樹狀圖)

import nltk

from nltk.tokenize import word_tokenize

HaoWei 發表在 痞客邦 留言(0) 人氣()

pttCookie.png

嗨,為什麼我們要模擬人的行為來玩爬蟲?其實電腦界的兩難就是,既要給你足夠的資訊,又要保護一些東西,例如,認證問題。

(我也不希望你這傢伙把我的東西都爬下來阿,崩潰~~~~)

在上一篇瑋瑋道來的文章中(請點我),有介紹基本的爬蟲程式,可是當我們爬到ptt八卦版時,會有確認身分的問題。

HaoWei 發表在 痞客邦 留言(0) 人氣()

1 2
Blog Stats
⚠️

成人內容提醒

本部落格內容僅限年滿十八歲者瀏覽。
若您未滿十八歲,請立即離開。

已滿十八歲者,亦請勿將內容提供給未成年人士。