顯示具有 自然語言 標籤的文章。 顯示所有文章
顯示具有 自然語言 標籤的文章。 顯示所有文章

7/05/2020

利用自然語言找尋專利前案(二)。


分享一個“找出「一技術描述」與 「多個專利請求項1 」間的相似度”的程式。
https://reurl.cc/9EmGQn

1、要使用這支程式,建議安裝,anaconda python。並且,需要gensim 套件。
2、功能:找出「一個技術描述(sentance1)」,與 「patentlist 中各專利請求項1 」間的相似度。

3、此程式的使用方式如下:
#sentance1 指的是一個技術的描述,最簡單的方法就是一個發明的請求項的記載方式。
#patentlist 提供想要比對的美國專利書號碼,例如['US7654301B2', 'US7654300B2', 'US7654329B2']。

4、改變上述要點3中的變數sentance1及patentlist並執行後,會得到claim_similarity.txt的文件,打開該文件後,可以得到相似度的計算值,如最後所述。
5、結果:如果把一件專利的不同組的請求項,當作sentance1時,相似度會達0.9以上。因此,此方法有實用上的「可能性」,但實際上效果可能沒有很好,需要再優化。目前,我把它當作閱讀順序的排序,覺得滿好用的。

如果顯示0的值,表示沒有爬到該專利的內容。

與US5419973A間的相似度 = 0 -->沒有爬到該專利的內容
與US6111377A間的相似度 = 0
與US6139976A間的相似度 = 0
與US6410174B1間的相似度 = 0
與US7935439B2間的相似度 = 0.7107066750526427
與US7074155B2間的相似度 = 0.7974137131141663
與US7263240B2間的相似度 = 0.7750532627105713
與US7757929B2間的相似度 = 0.7196704377664795
與US7777529B2間的相似度 = 0.7253437776701355

註:參考了以下幾個程式。
google_patent_spider
https://pypi.org/project/google-patent-scraper/

pypatent
https://github.com/daneads/pypatent

patent_client
https://github.com/parkerhancock/patent_client

uspto-tools
https://github.com/jlroo/uspto
https://github.com/clicumu/uspto-tools

Exploring the Intuition Behind Doc2Vec for PyPatent¶
https://github.com/hclent/PyPatent/blob/master/intuition.ipynb


【更新 20200709 】

claimsim_20200708.py

1、需要pypatent的檔案,我要修正它,所以直接下載並修正檔名為「DanEadsPypatent」來使用,請同時下載該檔案。
2、本次是爬美國專利資料庫,已可以爬公開說明書和專利說明書。
3、本次修正,已可以計算整個說明書的段落的近似值,只是段落的編號與說明書編號不一樣。請用p = thispatent('US6924620B2').description[3]來查詢段落內容。最後,本程式的輸出結果為:claim_similarity.txt。
4、與前次版本不同,本次不會下載任何檔案,是以後修正的目標。

6/28/2020

利用自然語言找尋專利前案(一)。

用機器來檢索前案。

https://hant-kb.kutu66.com/others/post_13649887

目前的AI可以做到「句子相似度」的計算,如上連結。
'this is a sentence'及'this is also sentence'的計算結果,高達0.915479828613的
近似度。

因此,如果要用機器幫忙找前案的話,可以先文用描述要檢索的裝置或方法,形成句子(或詞袋),然後用「句子相似度」的演算法,來找出近似的專利。word2vec是由google提出來,google專利資料庫的近似專利,應該也是用這個演算法計算出來的。

考慮到專利用語的多變化,(以下是我亂想的,沒有理論基礎)想要提高演算的精確度時
,選擇詞袋中的詞就很重要,可以考慮先對句子中的詞進行處理。舉例,可以考慮先把
下位詞更換成上位詞,或者把所有的近似詞換成相同的詞等,但這個需要自己整理詞庫。

因此,個人認為用機器幫忙找專利,是有機會的,但需要為不同的領域準備好自己的
詞庫。要用一般的詞庫應該很難達到實用的效果。

其他演算法。
https://reurl.cc/WdQkVx


【更新  20200629 】
https://reurl.cc/8GM9j7
上面有代碼,提供給有興趣玩的網友參考。只要更換sentance1及2的文字,就能算出相似度。
另外,還需要「GoogleNews」詞向量的檔案,下載地址,如下。
https://reurl.cc/xZM3NZ



另外,還有doc2vec,它是word2vec到 phrase-,sentence-的文件級別的擴展,如下所描述
http://cs.stanford.edu/~quocle/paragraph_vector.pdf