多言語SEOは、技術的なマークアップが少し付いた翻訳の問題として紹介されるのが普通です。しかし、このサイトを英語、アラビア語、ドイツ語、フランス語、ハンガリー語、イタリア語、日本語、韓国語、ルーマニア語、ベトナム語、そして中国語の二つの表記体系という十二の言語で運用してきて、翻訳は簡単なほうの半分だとはっきり分かりました。
難しいほうの半分は、英語で当たり前に頼っている規則のひとつひとつに、文字体系に依存した別版が存在し、しかもその存在を知らなかった、という点です。長さの上限が違います。構造がずれます。数字は、親切であろうとする翻訳者の手で言葉に書き下され、その瞬間に原文と一致しなくなります。どれも、何かが検査するまでは目に見えません。
これを実際に機能させたのは、努力ではなく自動化でした。 何かが公開される前に、十一の独立したチェックがコンテンツの上を通ります。言語カバレッジ、原文と各翻訳の構造的な一致、数値の整合性、見出しの順序、リンク切れ、そして文字体系ごとのメタデータ長です。そのすべては、対応する失敗がすでに本番に到達したあとで書かれました。多言語サイトが正しさを保つ仕組みについて、これが正直な説明です。
多言語SEOはhreflangから始まる
hreflangの目的は、たいていの解説が示唆するよりもずっと狭いものです。どの言語が上位に来るかを決めるものではありません。複数のURLが別々の言語による同一のコンテンツであることを検索エンジンに伝え、それらが互いに競合するのではなく、適切な利用者に適切な版が表示されるようにするだけです。ランキング要因ではなく、同じ内容の版どうしを結び付けるための対応表だと考えるのが正確です。
重要な規則は三つで、残りはすべて細部です。
アノテーションは相互でなければなりません。 英語ページがドイツ語ページを指しているなら、ドイツ語ページも指し返す必要があります。一方向だけの宣言は原則として無視されますし、これは実装ミスとして群を抜いて多いものです。片側だけの主張を認めてしまうと、誰でも他人のページを自分の翻訳版だと言い張れてしまうため、検索エンジンは返礼のない宣言を信用しません。Google はこの要件を文書化しており、宣言方法の三つの選択肢もあわせて示しています。
どの集合も自分自身を含まなければなりません。 そのページ自身のURLも、そのページの一覧に入ります。
x-defaultを使ってください。 利用者の言語に一致するものが何もなかったときに提供されるページを指定します。これがないと、フォールバックはただの推測になります。
その下にある構造的な判断は、言語をどこに置くかです。このサイトが採用している単一ドメイン配下のサブディレクトリは、すべてを一つのホスト名にまとめるため、権威が十二の資産に分割されません。国ごとに別ドメインを立てる構成が意味を持つのは、事業そのものが実際に別であるときだけで、それ以外ではまれです。別ドメインはそれぞれ独立した資産として扱われ、被リンクも積み上げた評価も共有されないため、同じ労力を十二回払い直すことになります。
翻訳品質は順位の問題である
機械翻訳らしく読める機械翻訳は成績が悪くなります。理由は、検索エンジンが道具を検出するからではありません。出力が一般論に留まるからであり、一般的なコンテンツは、より具体的な何かとの比較になった時点で負けます。読み手の側でも同じことが起きていて、不自然な訳文は最初の数行で信用を失い、その離脱がそのまま評価に返ってきます。
繰り返し現れる失敗が二つあります。キーワードの翻訳です。 英語の表現をそのまま置き換えた語句は、その言語の人が実際に検索している語句ではないことが多く、正しく翻訳されたページが誰も入力しない語句を狙うことになります。キーワード調査は言語ごとに行うべきで、英語で一度行ったものを翻訳して済ませてはいけません。
文化的、規制的なずれです。 通貨の合わない価格、その市場では適用されない規制、誰も見覚えのない事例が該当します。英国のデータ保護義務について書かれたページを、調整せずに日本語へ翻訳すると、正確でありながら役に立ちません。
本当に判断が要るのは、そもそも何を翻訳するかです。すべてを翻訳するのは費用がかかり、その市場の誰も求めないページを生みます。最も強いページだけを、単に変換するのではなく現地に合わせて作り替えて出すほうが、全部を逐語的に訳すよりたいてい良い結果になります。
誰も触れない文字体系ごとの規則
ここが私たちを最も驚かせた部分で、しかも完全に機械的な話です。
メタディスクリプションの長さは一つの数字ではありません。 英語向けに正しく寸法を合わせた説明文は、同じ意味により多くの語を必要とするドイツ語やルーマニア語では長くなりすぎ、一文字がはるかに多くの意味を担う日本語や中国語では途方もなく長くなります。帯域を分けてみて分かったのは、日本語や中国語の説明文は、英語で適正とされる長さの半分にも満たない文字数で同じ内容を伝えられるということでした。そこで私たちは、単一のグローバルな上限ではなく、文字体系ごとに別々の帯域を定めました。一つの上限は、この集合の大半に対して間違っているからです。
本文の長さの下限も同じように異なります。 1,100語の英語記事と同じ内容を伝える日本語記事は、語数で見ればそのごく一部にしかならず、文字数で見ればまったく別の数になります。CJKのコンテンツを語数で測ることには意味がないので、日本語と中国語は文字数を、それ以外は語数を確認しています。
句読点が違います。 疑問符はどこでも?というわけではありません。アラビア語には固有の疑問符があり、中国語と日本語は全角形を使い、日本語の疑問文は疑問符ではなく句点で終わることが珍しくありません。ASCIIの疑問符を探して質問を数えるチェックは、英語以外のすべてのページが問題なしだと静かに報告します。私たちのチェックも、修正するまでまさにそうなっていました。
数値は翻訳でずれます。 英語が数字を使っている箇所で数を言葉に書き下した翻訳者は、間違いを犯したわけではありません。しかしそのページはもはや原文と一致しておらず、どちらか一方が更新されても、もう一方は更新されません。だから私たちは、すべての翻訳の数値が原文と一致しているかを検査します。
構造は一致していなければならない
私たちが動かしているチェックのうち最も役に立つのは、各翻訳を原文と突き合わせて構造的な一致を見るものです。見出しの数が同じか、リストと表の数が同じか、表の行数まで同じか、FAQの項目数が同じかを確認します。原文にあった表が翻訳では段落に化けていれば、そこで止まります。
これは他の何も捕まえられないものを捕まえます。短い節を二つ一つにまとめた翻訳者は、良い文章を書き上げた一方で、ページと構造化データの対応を壊しています。FAQの項目が一つ欠けているということは、表示されるページとFAQPageのマークアップが食い違っているということで、その食い違いは信頼を高めるどころか下げます。
省略も捕まえます。翻訳しづらいという理由で静かに落とされた節は、読み返しでは見えず、数える仕組みには一目瞭然です。
これにいくらかかり、割に合うのか
正直に言えば、十二言語は多く、維持の負担は現実のものです。記事一本が十二のファイルであり、修正一回が十二回の修正であり、すべてのチェックがそのすべてを走査しなければなりません。実際に営業できるのはそのうち一部の言語だとしても、維持の費用は十二言語ぶん等しくかかります。
見合うかどうかは、その市場に実際に売っているかどうかで完全に決まります。対応できない言語のトラフィックは虚栄の指標であり、同じ労力を一つの言語の権威づくりに使ったほうが、売上には普通もっと効きます。これをやる理由は市場へのアクセスであって、表示回数ではありません。
それでも取り組むなら、続けられるようにする要因はただ一つ、チェックが自動化され、公開の前に走ることです。規律だけで維持される十二言語は、一四半期のうちにずれていきます。不整合な集合を通さないゲートを備えた十二言語は、ずれません。
MecanikはWeb開発の一環として多言語サイトの構築と保守を行っていますが、最初の納品物はたいていコンテンツではなくチェックのほうです。
よくある質問
hreflangは実際に何をするのですか? 複数のURLが別々の言語による同一のコンテンツであることを検索エンジンに伝え、それらが互いに競合するのではなく、適切な利用者に適切な版が提供されるようにします。どの言語が上位に来るかを決めるものではありません。アノテーションは相互である必要があり、どの集合もそのページ自身を含む必要があり、x-defaultがフォールバックを指定するべきです。
言語ごとに独自ドメインを持たせるべきですか? たいていは不要です。単一ドメイン配下のサブディレクトリは、権威を別々の資産に分割せず、一つのホスト名にまとめておきます。国別ドメインが意味を持つのは、事業そのものが実際に別であるときで、それ以外ではまれです。
機械翻訳は検索順位を下げますか? 間接的に下げます。問題は道具が検出されることではなく、出力が一般論に留まることであり、一般的なコンテンツはより具体的な何かとの比較で負けます。より大きな失敗はキーワードの翻訳です。英語の表現をそのまま置き換えた語句は、その言語で検索されている語句ではないことが多いため、キーワード調査は言語ごとに行う必要があります。
メタディスクリプションの上限は言語によって違いますか? 違います。一つの数字として扱うと、多言語の集合の大半に対して間違いになります。同じ意味はドイツ語やルーマニア語ではより多くの語を必要とし、一文字がより多くの意味を担う日本語や中国語でははるかに少ない文字数で済みます。単一のグローバルな上限より、文字体系ごとの帯域のほうがうまく機能します。
大規模に翻訳の一貫性を保つにはどうしますか? 規律だけに頼るのではなく、公開前に自動チェックを走らせます。各翻訳を原文と突き合わせて、見出し、リスト、表、FAQの数が同じかという構造的な一致を見て、数値が一致しているかを確認します。どちらも、文章としては何の問題もなく読める不具合、たとえば統合された節や言葉に書き下された数値を捕まえます。
コメント