ChatGPTの翻訳をプロジェクトに合わせる:翻訳データベースの作成とフィードバックの実例

本記事の3行要約

  • 過去の採用訳だけでなく、翻訳の目的、表現への評価、修正理由を参照資料として蓄積することで、プロジェクトに合う翻訳を出すための判断を引き継げる。

  • 今回は日英翻訳を対象に、翻訳履歴の整理、公開された英文との照合、3回の翻訳テストとフィードバックを行い、Obsidianで管理できるデータベースへまとめた。

  • 第3回では全体的に良いと評価できる出力が得られた。これはモデル自体の再訓練ではない。


以前、ChatGPT 4.5やClaude 3.7の翻訳能力を比較した記事で、AI翻訳の誤訳や不自然な表現を確認することに加え、翻訳にどのような工夫が見られるかという点にも触れました。その結果、翻訳自体に創意工夫が少なく、したがって加点要素が少ないという評価となっています。

ある翻訳が良いかどうかを判断する上では、その正確さは勿論ですが、どのような語彙やトンマナを用いるか、また過去の翻訳から引き継ぐべき表現はあるかなどを判断しなければなりません。その総合としては、基本的にはその翻訳を行う目的から逆算することになります。例えば作品の紹介ならその人の表現として受け取れるか、ブランドの発信なら既存の文章と語調がそろっているかといったことを確認することになるでしょう。

こうした判断を生成AIに毎回説明するのではなく、過去に選んだ訳や修正理由を参照させることで特定のプロジェクトに合う翻訳へ近づけることを目指すのが、データベースを活用した翻訳制御です。これはモデル自体のファインチューニングではなくデータベース単位で管理することにより、新しいモデルが出たときにも対応しやすく、かつ更新も自社内で比較的容易に行えるというメリットがあります。

このアイデアから、実際にデータベースを作り、翻訳を比較してみることを行いました。以下はその記録です。

今回、何を「学習」させたのか

ここでの『学習』とはモデル自体のファインチューニングではなく、翻訳するときに参照する外部資料としてのデータベースを作成したことを指します。このデータベースに過去の原文と訳、採用結果、表現への評価をまとめ、次の翻訳で参考にできるようにすることで、ひとつのプロジェクト内でのトンマナなどの統一感が生まれるほか、そのプロジェクトで求められる翻訳の方向性に合った翻訳の出力を目指します。

今回は、主に日本語から英語への翻訳を行っています。ビジュアルアーティストが映像に添える短い言葉、歌詞、制作手法の説明、またビジュアルアーティスト本人のプロフィールなどをデータベースとして取り込んでいます。

このような翻訳では、短い作品文では対比や余韻が大切になります。また、直訳ではなく、大胆な言い換えをキャッチコピー的に試みる(トランスクリエーションを行う)ことも求められます。加えて、制作手法の説明では素材と操作の関係を正確に伝える必要があります。つまり、「短く、ラフに訳す」というひとつの指示をすべての文章へ適用すれば良いわけではありません。

過去の翻訳の整理

今回の例では既にChatGPTを利用した翻訳の履歴があったので、この翻訳相談の履歴を整理するところから始めました。可視本文359件を保存し、初期の102記録にまとめています。

そうしたChatGPTとの翻訳相談の履歴からどの翻訳を実際に採用したのかについて、TikTokとYouTubeの公開情報と照合し、実際に使われている英文を特定しました。これにより、ユーザーが好む翻訳の大まかな方向性が明らかになりました。

訳文と判断基準の記録

データはObsidianで管理できるMarkdown形式にしました。各案件のノートには、日本語原文、用途、評価対象の訳、本人の評価、別案、採用訳、公開先、出典を保存しています。このとき、採用されたことと、品質を確認済みであることを分けています。過去に使った文章であっても、次の用途にそのまま適するとは限らないためです。

資料の構成としては、次の三つが中心です。

  • 発信の目的、読者、プロフィール、用語などの前提情報。

  • 個々の翻訳と、その評価・採用結果。

  • 評価から取り出した、次回の翻訳に使う判断基準。

個別の英文だけでは、似た原文が出てこないと参考にしにくい面があります。しかし、なぜその訳を選んだかが分かれば、異なる文章にも判断を応用できる可能性があります。

新しい原文を訳し、修正理由を追加する

以上のように初期データベースを作成後、ChatGPTにこのデータベースに則って新たな翻訳をさせました。データベースのみを参照してチェックするため、適当な日本語の原文(新しい原文)を用意した上で別のWorkのセッションを開き、ファイルを渡して参照させつつ新規に翻訳させています。

その結果を堂本が自分の目で評価し、翻訳上の良かった点や改善点をメモし、訳例を添えて、これをデータベースとスタイルガイドに反映させました。

ChatGPTへのフィードバック例

以下は、原文、それに対するChatGPTの翻訳例(初期データベースを参照)です。

原文: 同じノイズを見ていたはずなのに、君とは違う朝になった。

AI訳: I thought we were watching the same noise, yet morning came differently for you and me.

基本としては翻訳できています。morning came differently は妙訳です。しかし、『見ていたはずなのに』が I thought と訳されると、ちょっと重たい感じがします。例えば前置詞句に置き換えるなどの工夫があっても良いところです。このようなフィードバックを伝えた上で、次のような訳例を渡しました。

訳例: Through the same noise, we arrived at different mornings.

こちらは『見ていたはずなのに』をそのまま英語の動詞にするのではなく、同じ体験を通ったのに違う場所へ着いた、という対比から組み立てています。

これは原文をそのまま再現した訳ではなく、焦点を動かした表現です。それでも、このような作品文では原文の構文を追うより、原文が作られた背景や対比から英語の表現を生む方が合うことがあります。この判断が有効である場合があることを、適用範囲とともにガイドへ残しました。

また、次のような例もありました。

原文: 昨日の自分には分からなかった色が、今日は少しだけ見える。

AI訳: Today, I catch a glimpse of a color I couldn’t understand yesterday.

catch a glimpse は良いと思いますが、ここでの『分かる』を understand とするのは直訳的な感があります。このことを伝えると共に、次の訳例を示しました。

訳例: Today, I catch a glimpse of a color I couldn’t see yesterday.

ここで学習させたいのは、『“分かる”はseeと訳す』という固定ルールではありません。この文脈では理解より知覚として捉えることが適切であるという判断です。良い部分を残し、必要なところだけ変える例でもあります。

類例としてこのような訳もありました。

原文: 踊りたくない夜もある。それでも、音のそばにはいたい。

AI訳: Some nights, I don’t feel like dancing. I still want to stay close to the sound.

ここでの『音』とは sound ではなく music であると考えられます。

訳例: Some nights, I don’t feel like dancing; I still want to stay close to music.

これも『音は sound ではなく music にする』という一律の指定ではありません。環境音や低音、ノイズを扱う別の文章なら、指しているものが違うため、そのような一律の指定は割に合わないためです。

同じ日本語でも文脈によって英語の選択が変わる。その条件を残さなければ、修正例が次の翻訳ではかえって不適切なルールになってしまいます。

また、AIが修正の必要のない翻訳をすることもあります。

原文: 君と同じ景色を見たいけれど、同じように見たいわけではない。

AI訳: I want to see what you see, but not the way you see it.

フィードバックをするとなると、つい変更点を探したくなります。しかし、良い訳まで書き換える必要はありません。肯定した訳も残しておくことで、どのような表現を維持したいかを伝えられます。

フィードバックの詳細は【こちらから】ご確認いただけますので、よろしければご参考ください。ただ、このフィードバックはあくまでこのアーティストのトンマナや表現、また翻訳する際の目的について最適化したものであり、そのまま他のケースに適用できるものではないことを強調しておきます。

3回のフィードバックで、何が変わったか

今回の試行では、フィードバックを3回行いました。その結果、第3回の翻訳は、10件全体として良いと思える結果となっています。例えば、次のような訳を得ることができました。

朝になったからといって、夜が終わったとは限らない。

Morning doesn’t mean the night is over.

それまでであれば直訳的に Even if.. などを用いていた可能性があるところを、名詞構文で言い換えることに成功しています。

昨日までただの傷だったものが、今日は模様に見える。

Yesterday, just a wound. Today, a pattern.

必ずしも文としての構造に囚われる必用がないことを学習しています。

踊る気はなかった。ただ、好きな曲がかかっただけだ。

I wasn’t going to dance. Then a song I love came on.

『〜だけ』を理由などのディスコースマーカーで説明せず、二文の連続性から推測させています。英文では因果関係というよりも時間の関係によって結束性が保たれていますが、バリエーションとしては許容されます。

今後の運用

作成したデータベースはver.1となり、これを参照しつつ今後もChatGPTが翻訳することとなります。その中で良いと思った翻訳は、『A案にする。理由は〜だから。データベースを更新しておいて』などのようにして逐次反映します。これを繰り返すことにより、同じプロジェクトやコンテキストの文脈での翻訳のクオリティが高まることが期待されます。

また同時に、モデル自体のファインチューニングでないため、プロジェクトごとの最適化が可能になります。

どの判断を残すか

データベースを作成する上で難しいのは、その訳の何が良かったのか、どの修正を次回にも使うべきか、どこまで適用してよいかを判断することです。

ある案件で認められた省略が、別の案件では意味の欠落になるかもしれません。詩的な短文の構文を、技術説明へ持ち込むべきでないこともあります。本人が出した訳例であっても、意図した効果と、意味や文法の確認点は分けて考える必要があります。

こうしたデータベース作成に興味がお有りであれば、ぜひご連絡ください。どのように作成が可能か、またはその作成の代行が可能かなど、ご提案させていただきます。

ご参考: 自社で完結できる、育てる翻訳データベースを作っています(note記事)

Akitsugu Domoto

Translator, wordsmith, speaker, author and part-time YouTuber.

https://word-tailor.com
次へ
次へ

CodexとAlfredを用いた辞書の串刺し検索