支援建構大型語言模型,以開發與調整 AI 翻譯引擎及生成式 AI。

人工智慧翻譯引擎與生成式人工智慧的發展,
調音必需品
建構大型語言模型
我們會支持你。

  • 超過一百萬對
  • 支援超過 10 種語言
  • 豐富的交付紀錄
點此索取樣本

關於 AI 翻譯與問答
解決你的機器學習疑慮!

  • 想要開發專門針對特定領域的高精度 AI 翻譯

    專精於特定領域
    高精度 AI 翻譯
    想要發展

  • 想提升多語言聊天機器人的準確度

    多語言聊天機器人
    準確度
    想要加注

  • 想預測在對話或問答環節中該說什麼

    在對話和問答環節中,
    我想預測這句話。

  • 尋找一個與東南亞語言相容的平行語料庫

    東南亞國家的語言
    對應
    翻譯語料庫
    尋找

  • 想要為你的產業或專業領域製作專門詞彙表

    依產業或專業領域劃分
    專精
    請參閱詞彙表
    我想做

Koden 公司的六大優勢

  • 超過40年的經驗

    超過40年的經驗

    自1980年代以來,我們一直在開發機器翻譯,
    我們擁有豐富經驗,能為大型企業提供雙語企業。
    以多年經驗與專業知識貢獻於解決問題
    我們提供多語言語料庫。

  • 專精於專業領域

    專精於專業領域

    旅遊、醫療照護、法律、金融、智慧財產權等等。
    擁有跨領域平行語料庫。
    記者會、問答環節及其他對話形式
    我們也提供翻譯語料庫。

  • 超過一百萬對

    超過一百萬對

    我們能提供超過一百萬對翻譯語料庫!
    你正在使用的翻譯支援工具
    它也可以用作翻譯記憶。

  • 稀有語言

    稀有語言

    除了從日文翻譯成英文的資料外,
    從英語到東南亞語言與稀有語言
    我們持有一份翻譯平行語料庫。

  • 自然表現

    自然表現

    平行語料庫由各語言的母語者決定。
    因為它是翻譯的,所以每種語言都獨一無二。
    細微差別與陳腔濫調被反映出來。

  • 半客製化

    半客製化

    除了欄位和資料型態之外,
    因為我們也管理翻譯方向,
    我們可以提取你想要的翻譯語料庫。
    我們也提供多語言技術術語的創建。

支持這類專業領域

實施成就

一家大型電信公司的研究部門
/廣播站研究所
/基於 AI 的機器翻譯引擎開發公司
以及更多

常見問題

什麼是「平行語料庫」?
平行語料庫是將兩種或多種語言、一種語言與另一種語言混合翻譯的句子集合。在基於 AI 的機器翻譯引擎開發中,能維持前後語境的資料被高度重視。對於少於兩種語言的單一語言,稱為單一語言語料庫。
平行語料庫中常見的詞彙和組合有多少?
我們提供最廣泛的日語與英語選擇。此外,我們支援英語與中文、西班牙語與法語,以及印尼語與葡萄牙語的組合。
如果我購買平行企業,會有什麼使用限制嗎?
是的,有些平行語料庫只能用於機器學習,有些則可發佈在網站或教育資料上。若是後者,我們會在購買前討論相關術語。
翻譯語料庫的最低購買單位或價格是多少?
據說機器學習需要約10萬對,我們的客戶經常在該單位購買。價格將根據用途與購買數量另行協商。
翻譯語料庫是如何交付的?
我們可依需求提供文字檔(CSV、TSV 等)或 Excel 檔案。

選擇平行語料庫的重點

選擇平行語料庫的重點

在機器翻譯與多語言生成式人工智慧的開發與調校中,對雙語語料庫的需求正穩步增加。此外,當譯者開始涉足新領域的翻譯時,擁有內部累積的翻譯記憶能大幅提升翻譯工作的效率。另一方面,內部收集系統化的雙語語料庫並不容易;外部蒐集資料並專注於開發預期交付物與翻譯工作更有效率。

以下六點是選擇平行語料庫的關鍵點。
1) 語言組合
2)場
3) 品質
4) 數量
5) 資料型別
6) 有無上下文

第一個「語言組合」指的是譯者所翻譯的語言對,或機器翻譯開發訓練的語言對,是日語與英語,還是日語與中文。同樣地,當你註冊翻譯支援工具的翻譯記憶時,「語言組合」被視為最重要的因素。此外,在尋找更自然表達時,判斷哪種語言是原文也是重要因素。例如,即使稱之為「日英平行語料庫」,自然會注意到將日文原文翻譯成英文與英文原文翻譯成日文時,在英語表達流暢度與翻譯背景上存在差異。

2)中的「領域」指的是觀光、醫療保健、法律、經濟、科學與技術等領域。透過來自需要精確領域的機器學習資料,可以加速發展。在建立提升特定領域機器翻譯準確度的語言模型時,估計的有效性約為10萬對。不用說,從雙語翻譯語料庫製作技術術語詞典時,領域也非常重要。就我們而言,日本過去要求的領域主要聚焦於以旅遊為導向國家的入境旅遊,而醫療領域則需要雙語語料庫來強化對入境訪客及外國居民的醫療照護。此外,需求在數年內轉向商業領域,這些領域記錄用於商業簡報與說明、會議與活動講座,以及隨後的問答環節。

第三節中,「品質」指的是準確性,這取決於平行語料庫的製作方式。較理想的是資料由人工翻譯,若以機器翻譯且未經人工檢查或校正,品質自然會下降。此外,即使在手動翻譯資料中,若一句話被翻譯成兩句或更多句子,且原文與翻譯文本必須對應同一句話,這會影響品質。此外,若翻譯過於簡略,則無法被視為高品質的平行語料庫。

第4點的「數量」足以讓譯者在特定領域註冊數萬對平行語料庫,目的是將內部使用的翻譯支援工具的翻譯記憶或詞彙字典登錄。對於特定領域的機器學習,例如開發機器翻譯引擎,據說10萬對語料庫已足夠有效。另一方面,開發通用機器翻譯引擎則需要數千萬對語料庫。因此,所需的平行語料庫數量因應用而異。

在第 5 節中,「資料型別」指用於建立平行語料庫的檔案為以下其中一種:報告/白皮書,或簡報/記者會/問答。若想機器學習書面語言,請使用報告或白皮書;若想機器學習口語,則使用由簡報、記者會及問答所建立的轉錄語料庫。我們的平行語料庫詳細管理屬性,因此可依資料類型擷取平行語料庫。

6)中的「有無語境」指的是多句子之間是否有語意關聯。具體來說,字典中列出的例句僅包含特定的詞頭詞,且與其他例子沒有上下文關聯。因此,它被判斷為「語境性」。相較之下,報告由多句描述特定事件組成,因此被視為「語境性」。同樣地,在記者會和問答環節中,多位講者輪流交談,因此可以說「有語境」。不僅限於機器翻譯,為了用聊天機器人產生更準確的回答,現在比以往任何時候都更重要,在機器學習訓練的轉錄語料庫中包含「語境」。

結論
選擇平行企業時,需依預期用途考量上述第1至6點。尤其在針對特定領域進行機器學習時,必須考量品質、資料類型與情境的需求。若想使用符合您目標的平行語料庫,請先參考我們的免費範例資料。

結束
閱讀更多