專精於特定領域
高精度 AI 翻譯
想要發展
多語言聊天機器人
準確度
想要加注
在對話和問答環節中,
我想預測這句話。
東南亞國家的語言
對應
翻譯語料庫
尋找
依產業或專業領域劃分
專精
請參閱詞彙表
我想做
自1980年代以來,我們一直在開發機器翻譯,
我們擁有豐富經驗,能為大型企業提供雙語企業。
以多年經驗與專業知識貢獻於解決問題
我們提供多語言語料庫。
旅遊、醫療照護、法律、金融、智慧財產權等等。
擁有跨領域平行語料庫。
記者會、問答環節及其他對話形式
我們也提供翻譯語料庫。
我們能提供超過一百萬對翻譯語料庫!
你正在使用的翻譯支援工具
它也可以用作翻譯記憶。
除了從日文翻譯成英文的資料外,
從英語到東南亞語言與稀有語言
我們持有一份翻譯平行語料庫。
平行語料庫由各語言的母語者決定。
因為它是翻譯的,所以每種語言都獨一無二。
細微差別與陳腔濫調被反映出來。
除了欄位和資料型態之外,
因為我們也管理翻譯方向,
我們可以提取你想要的翻譯語料庫。
我們也提供多語言技術術語的創建。
我們以產業專屬的對話形式呈現,提供工廠與工地安全工作的重要防護措施。
我們涵蓋廣泛領域,從農業、林業、漁業等初級產業,到經濟、金融、資訊科技與核能等領域。
我們提供外國人入境及居住日本所需的多語言資料,包括與入境及居留身份相關的法律,以及醫療機構的醫療面談。
一家大型電信公司的研究部門
/廣播站研究所
/基於 AI 的機器翻譯引擎開發公司
以及更多
在機器翻譯與多語言生成式人工智慧的開發與調校中,對雙語語料庫的需求正穩步增加。此外,當譯者開始涉足新領域的翻譯時,擁有內部累積的翻譯記憶能大幅提升翻譯工作的效率。另一方面,內部收集系統化的雙語語料庫並不容易;外部蒐集資料並專注於開發預期交付物與翻譯工作更有效率。
以下六點是選擇平行語料庫的關鍵點。
1) 語言組合
2)場
3) 品質
4) 數量
5) 資料型別
6) 有無上下文
第一個「語言組合」指的是譯者所翻譯的語言對,或機器翻譯開發訓練的語言對,是日語與英語,還是日語與中文。同樣地,當你註冊翻譯支援工具的翻譯記憶時,「語言組合」被視為最重要的因素。此外,在尋找更自然表達時,判斷哪種語言是原文也是重要因素。例如,即使稱之為「日英平行語料庫」,自然會注意到將日文原文翻譯成英文與英文原文翻譯成日文時,在英語表達流暢度與翻譯背景上存在差異。
2)中的「領域」指的是觀光、醫療保健、法律、經濟、科學與技術等領域。透過來自需要精確領域的機器學習資料,可以加速發展。在建立提升特定領域機器翻譯準確度的語言模型時,估計的有效性約為10萬對。不用說,從雙語翻譯語料庫製作技術術語詞典時,領域也非常重要。就我們而言,日本過去要求的領域主要聚焦於以旅遊為導向國家的入境旅遊,而醫療領域則需要雙語語料庫來強化對入境訪客及外國居民的醫療照護。此外,需求在數年內轉向商業領域,這些領域記錄用於商業簡報與說明、會議與活動講座,以及隨後的問答環節。
第三節中,「品質」指的是準確性,這取決於平行語料庫的製作方式。較理想的是資料由人工翻譯,若以機器翻譯且未經人工檢查或校正,品質自然會下降。此外,即使在手動翻譯資料中,若一句話被翻譯成兩句或更多句子,且原文與翻譯文本必須對應同一句話,這會影響品質。此外,若翻譯過於簡略,則無法被視為高品質的平行語料庫。
第4點的「數量」足以讓譯者在特定領域註冊數萬對平行語料庫,目的是將內部使用的翻譯支援工具的翻譯記憶或詞彙字典登錄。對於特定領域的機器學習,例如開發機器翻譯引擎,據說10萬對語料庫已足夠有效。另一方面,開發通用機器翻譯引擎則需要數千萬對語料庫。因此,所需的平行語料庫數量因應用而異。
在第 5 節中,「資料型別」指用於建立平行語料庫的檔案為以下其中一種:報告/白皮書,或簡報/記者會/問答。若想機器學習書面語言,請使用報告或白皮書;若想機器學習口語,則使用由簡報、記者會及問答所建立的轉錄語料庫。我們的平行語料庫詳細管理屬性,因此可依資料類型擷取平行語料庫。
6)中的「有無語境」指的是多句子之間是否有語意關聯。具體來說,字典中列出的例句僅包含特定的詞頭詞,且與其他例子沒有上下文關聯。因此,它被判斷為「語境性」。相較之下,報告由多句描述特定事件組成,因此被視為「語境性」。同樣地,在記者會和問答環節中,多位講者輪流交談,因此可以說「有語境」。不僅限於機器翻譯,為了用聊天機器人產生更準確的回答,現在比以往任何時候都更重要,在機器學習訓練的轉錄語料庫中包含「語境」。
結論
選擇平行企業時,需依預期用途考量上述第1至6點。尤其在針對特定領域進行機器學習時,必須考量品質、資料類型與情境的需求。若想使用符合您目標的平行語料庫,請先參考我們的免費範例資料。