AIの言語性能に関する議論のほとんどは、依然として英語を中心に展開されている。あるモデルが標準的なベンチマークで高得点を獲得すれば、最先端技術として称賛され、世界規模で利用されるようになる。しかし、 欧州委員会が新たに発表したEU MMLUデータセットを、英語の優れた性能が、フランス語、ハンガリー語、マルタ語の翻訳能力についてはほとんど何も語っていないことを示している。 AIによるリアルタイム翻訳 、このギャップは単なる学術的な注釈ではない。それは、参加者が基調講演を理解できるか、全く聞き逃してしまうかの分かれ目となるのだ。
これは重要な問題です。なぜなら、大規模言語モデル(LLM)を評価するために使用されるベンチマークは、どのシステムが展開され、信頼されるかを左右するからです。もしこれらのベンチマークがほぼ完全に英語で構築されている場合、AIライブ翻訳の対象となるユーザーが話す言語を含め、他のあらゆる言語でモデルがどのように機能するかを知ることはできません。
EU MMLUは、欧州委員会翻訳総局(DG Translation)が公開した新しい多言語ベンチマークデータセットです。これは Massive Multitask Language Understanding(MMLU)、科学や法律から倫理や公共問題まで、57の分野にわたる数千もの多肢選択式問題でモデルの性能をテストします。
EU MMLUは、この枠組みをEUの状況に合わせて特別に適用したものです。欧州機関との関連性を考慮して選ばれた7つの分野に焦点を当て、現在クロアチア語、チェコ語、オランダ語、フランス語、ドイツ語、ギリシャ語、ハンガリー語、アイルランド語、イタリア語、リトアニア語、ポーランド語、ポルトガル語、ルーマニア語、スロバキア語、スロベニア語を含む16のEU公用語をカバーしており、今後さらに追加される予定です。既存の英語の問題を単に翻訳するのではなく、このプロジェクトは、すべての言語バージョンで同じ意味、難易度、テスト価値を維持することを目指しており、ポーランド語のスコアがフランス語のスコアと同じ意味を持つようにしています。.
ほとんどのAI評価データセットは英語で作成されており、英語圏の教育、文化、社会状況を反映している。英語データを中心に学習・テストされたモデルは、高い性能を示すように見えるかもしれないが、他の言語における実際の性能はほとんど測定されていない。.
これはまさに、欧州委員会翻訳総局が埋めようとしたギャップです。EU MMLUの発表にあるように、モデルは英語では高いスコアを出す一方で、フランス語、ハンガリー語、マルタ語では著しく低いスコアを出す可能性があります。根本的な問題は、モデルが他の言語を全く処理できないということではなく、標準的なベンチマークではモデルの弱点を明らかにするほど厳密にテストされることがほとんどないため、文法、ニュアンス、専門用語の弱点が、実際のユーザーがその出力結果に頼るまで気づかれないということです。.
特にAIによるリアルタイム翻訳においては、このパフォーマンスのばらつきは直接的な影響を及ぼします。システムは、分かりやすい英語の原文はうまく処理できるかもしれませんが、同じ内容がテストの少ないターゲット言語に翻訳されると、エラーや不自然な言い回し、意味の欠落が生じる可能性があります。まさに、リアルタイムで音声を聞いているリスナーにとって、正確さが最も重要となる瞬間に、こうした問題が発生するのです。.
言語能力のギャップは、問題の一面に過ぎません。欧州委員会翻訳総局は、翻訳精度にとどまらず、AIモデルがEUの価値観をどれだけ反映し、慣用句、ユーモア、引用、日付や数字の形式、期待される口調や丁寧さの違いなど、文化的に固有のコンテンツをどれだけ適切に処理できるかをテストする、多言語ベンチマークのための品質基準も公表しています。.
これこそが、ライブ翻訳を真に困難にする要素です。地域特有の言い回し、文化的な背景、あるいは現地の慣習に根ざした丁寧な言葉遣いを用いる講演者は、単なる逐語訳以上のものに頼らざるを得ません。特定の言語におけるこうしたニュアンスを理解していないAIシステムは、文字通りの翻訳は正しく行っても、意図された意味やニュアンスを完全に失ってしまう可能性があります。多言語イベントでは、たとえ誰も技術的な誤りに気づかなくても、こうしたギャップによって、聴衆の一部にメッセージが伝わる度合いが変わってしまうことがあるのです。.
EU MMLUの注目すべき点の1つは、その方法論です。非英語のテスト問題を作成する際に主に機械翻訳に依存するほとんどの多言語ベンチマークとは異なり、EU MMLUは人間中心のアプローチを採用しました。欧州翻訳総局(DG Translation)は、ヨーロッパ全土の21の大学から集まった、欧州翻訳修士課程(EMT)ネットワークの約250人の学生翻訳者とプロジェクトマネージャーと協力し、1,000問以上のベンチマーク問題の翻訳と改訂を行いました。.
この区別は、一見些細に見えるかもしれないが、実際には非常に重要である。機械翻訳によって構築されたベンチマークは、本来明らかにするはずの弱点をそのまま引き継いでしまう危険性がある。なぜなら、真の人間による基準ではなく、モデルの出力を別のモデルの出力と比較してしまうからだ。人間によるレビューは、人々が実際にどのように言語を使用しているかという点に基づいて評価を行う。これは、聴衆が人間であり、微妙な誤訳に対する許容度が低い、実際のイベントでのライブ翻訳において最も重要な基準でもある。.
欧州委員会翻訳総局は、長期的な目標を明確に掲げている。それは、多言語AI評価に関する新たな基準を欧州に確立し、AIシステムが英語圏環境だけでなく、言語や文化を超えて一貫した性能を発揮できるようにすることだ。この目標が実現すれば、その実質的な恩恵は研究室にとどまらず、はるかに広範囲に及ぶだろう。.
国際会議、機関会議、グローバルな企業イベントなどを運営する組織にとって、多言語ベンチマークの精度向上は、どのAIシステムがどの言語で信頼できるかを明確に把握できることを意味します。イベント中に特定のツールが英語以外の言語で性能を発揮しないことが判明するような事態を避けることができます。これにより、AIのみによるリアルタイム翻訳が信頼できる場面と、AIと人間の通訳を組み合わせたハイブリッドアプローチが特定の言語や聴衆にとって意味やニュアンスをより適切に保護できる場面について、より的確な判断を下すことが可能になります。.
EU MMLUのようなベンチマークは、多言語AIにおけるあらゆる課題を一夜にして解決するものではありませんが、パフォーマンスの測定方法と伝達方法に大きな変化をもたらします。これらの評価基準が成熟するにつれ、イベント主催者、機関、広報チームは、真に多言語のオーディエンスに適したAIライブ翻訳ソリューションを選択するためのより明確な基準を得ることができます。Interprefyが多言語AIライブ翻訳にどのように取り組んでいるかについては、当社の AI音声翻訳プラットフォームを。