求真百科歡迎當事人提供第一手真實資料,洗刷冤屈,終結網路霸凌。

光學字符識別檢視原始碼討論檢視歷史

事實揭露 揭密真相
前往: 導覽搜尋

來自 站酷網 的圖片

光學字符識別OCR (Optical Character Recognition,光學字符識別)是指電子設備(例如掃描儀或數碼相機)檢查紙上打印的字符,通過檢測暗、亮的模式確定其形狀,然後用字符識別方法將形狀翻譯成計算機文字的過程;即,針對印刷體字符,採用光學的方式將紙質文檔中的文字轉換成為黑白點陣的圖像文件,並通過識別軟件將圖像中的文字轉換成文本格式,供文字處理軟件進一步編輯加工的技術。如何除錯或利用輔助信息提高識別正確率,是OCR最重要的課題,ICR(Intelligent Character Recognition)的名詞也因此而產生。衡量一個OCR系統性能好壞的主要指標有:拒識率、誤識率、識別速度、用戶界面的友好性,產品的穩定性,易用性及可行性[1]等。

發展簡史

OCR的概念是在1929年由德國科學家[2]Tausheck最先提出來的,後來美國科學家Handel也提出了利用技術對文字進行識別的想法。而最早對印刷體漢字識別進行研究的是IBM公司的Casey和Nagy,1966年他們發表了第一篇關於漢字識別的文章,採用了模板匹配法識別了1000個印刷體漢字。

早在60、70年代,世界各國就開始有OCR的研究,而研究的初期,多以文字的識別方法研究為主,且識別的文字僅為0至9的數字。以同樣擁有方塊文字的日本為例,1960年左右開始研究OCR的基本識別理論,初期以數字為對象,直至1965至1970年之間開始有一些簡單的產品,如印刷文字的郵政編碼識別系統,識別郵件上的郵政編碼,幫助郵局作區域分信的作業;也因此至今郵政編碼一直是各國所倡導的地址書寫方式。

20世紀70年代初,日本的學者開始研究漢字識別,並做了大量的工作。中國在OCR技術方面的研究工作起步較晚,在70年代才開始對數字、英文字母及符號的識別進行研究,70年代末開始進行漢字識別的研究,到1986年,我國提出「863」高新科技研究計劃,漢字識別的研究進入一個實質性的階段,清華大學的丁曉青教授和中科院分別開發研究,相繼推出了中文OCR產品,現為中國最領先漢字OCR技術。早期的OCR軟件,由於識別率及產品化等多方面的因素,未能達到實際要求。同時,由於硬件設備成本高,運行速度慢,也沒有達到實用的程度。只有個別部門,如信息部門、新聞出版單位等使用OCR軟件。進入20世紀90年代以後,隨着平台式掃描儀的廣泛應用,以及我國信息自動化和辦公自動化的普及,大大推動了OCR技術的進一步發展,使OCR的識別正確率、識別速度滿足了廣大用戶的要求。

2020年9月28日,在中華人民共和國工業和信息化部、北京市人民政府、國際電信聯盟(ITU-T)指導的2020 AIIA人工智能開發者大會上,主辦方正式發布國內首份智能文字識別(OCR)能力測評與應用白皮書。該白皮書從OCR發展背景、技術沿革、產業發展現狀、技術標準化、發展趨勢等多個維度,對當前國內OCR產業進行了梳理,全面助推OCR技術產業化加速落地及可持續發展。

軟件結構

由於掃描儀的普及與廣泛應用,OCR軟件只需提供與掃描儀的接口,利用掃描儀驅動軟件即可。因此,OCR軟件主要是由下面幾個部分組成。

圖像輸入、預處理

圖像輸入:對於不同的圖像格式,有着不同的存儲格式,不同的壓縮方式,目前有OpenCV,CxImage等開源項目。預處理:主要包括二值化,噪聲去除,傾斜較正等

二值化

對攝像頭拍攝的圖片,大多數是彩色圖像,彩色圖像所含信息量巨大,對於圖片的內容,我們可以簡單的分為前景與背景,為了讓計算機更快的,更好的識別文字,我們需要先對彩色圖進行處理,使圖片只前景信息與背景信息,可以簡單的定義前景信息為黑色,背景信息為白色,這就是二值化圖了。

噪聲去除

對於不同的文檔,我們對噪聲的定義可以不同,根據噪聲的特徵進行去噪,就叫做噪聲去除

傾斜較正

由於一般用戶,在拍照文檔時,都比較隨意,因此拍照出來的圖片不可避免的產生傾斜,這就需要文字識別軟件進行校正。

版面分析

將文檔圖片分段落,分行的過程就叫做版面分析,由於實際文檔的多樣性,複雜性,因此,目前還沒有一個固定的,最優的切割模型。

字符切割

由於拍照條件的限制,經常造成字符粘連,斷筆,因此極大限制了識別系統的性能,這就需要文字識別軟件有字符切割功能。

字符識別

這一研究,已經是很早的事情了,比較早有模板匹配,後來以特徵提取為主,由於文字的位移,筆畫的粗細,斷筆,粘連,旋轉等因素的影響,極大影響特徵的提取的難度。

版面恢復

人們希望識別後的文字,仍然像原文檔圖片那樣排列着,段落不變,位置不變,順序不變地輸出到word文檔、pdf文檔等,這一過程就叫做版面恢復。

後處理、校對

根據特定的語言上下文的關係,對識別結果進行較正,就是後處理。

參考文獻