다국어 SEO는 보통 기술 마크업이 조금 붙은 번역 문제로 소개됩니다. 그러나 이 사이트를 영어, 아랍어, 독일어, 프랑스어, 헝가리어, 이탈리아어, 일본어, 한국어, 루마니아어, 베트남어 그리고 중국어의 두 표기 체계까지 열두 개 언어로 운영해 보니, 번역이 쉬운 쪽 절반이라는 사실이 분명해졌습니다.
어려운 절반은 영어에서 당연하게 의존하던 규칙마다 문자 체계에 따라 달라지는 판본이 따로 있다는 점입니다. 길이 제한이 다릅니다. 구조가 어긋납니다. 숫자는 친절하게 일하려는 번역자의 손에서 글자로 풀어 쓰이고, 그 순간부터 원문과 일치하지 않습니다. 이 가운데 무엇도 누군가 검사하기 전까지는 눈에 보이지 않습니다.
이것을 실제로 굴러가게 만든 것은 노력이 아니라 자동화였습니다. 무엇이든 배포되기 전에 열한 개의 개별 검사가 콘텐츠 위를 지나갑니다. 언어 커버리지, 원문과 번역본 사이의 구조 일치, 수치 일관성, 제목 순서, 죽은 링크, 그리고 문자 체계별 메타데이터 길이입니다. 이 모든 검사는 해당하는 실수가 이미 운영 환경에 도달한 뒤에 작성되었습니다. 다국어 사이트가 어떻게 정확한 상태를 유지하는지에 대한 솔직한 답입니다.
다국어 SEO는 hreflang에서 시작합니다
hreflang의 목적은 대부분의 안내서가 시사하는 것보다 훨씬 좁습니다. 어떤 언어가 상위에 오를지를 정해 주지 않습니다. 여러 URL이 서로 다른 언어로 된 동일한 콘텐츠임을 검색엔진에 알려서, 페이지들이 서로 경쟁하는 대신 알맞은 사용자에게 알맞은 판본이 보이게 할 뿐입니다.
중요한 규칙은 세 가지이고 나머지는 세부 사항입니다.
주석은 상호적이어야 합니다. 영어 페이지가 독일어 페이지를 가리키면 독일어 페이지도 되돌아 가리켜야 합니다. 한쪽 방향만 선언하면 대체로 무시되며, 이것이 압도적으로 흔한 구현 오류입니다. Google은 이 요건을 문서로 밝히면서 선언하는 세 가지 방법도 함께 제시합니다.
모든 집합은 자기 자신을 포함해야 합니다. 페이지 자신의 URL도 그 페이지의 목록에 들어갑니다.
x-default를 사용하세요. 사용자의 언어와 맞는 것이 하나도 없을 때 제공되는 페이지를 가리킵니다. 이것이 없으면 대체 경로는 추측이 됩니다.
그 아래에 놓인 구조적 결정은 언어를 어디에 둘 것인가입니다. 이 사이트가 쓰는 방식인 단일 도메인 하위 디렉터리는 모든 것을 하나의 호스트명에 모아 두므로 권위가 열두 개의 자산으로 쪼개지지 않습니다. 국가별 개별 도메인은 사업 자체가 실제로 분리되어 있을 때 타당하고, 그 밖의 경우에는 드뭅니다.
번역 품질은 순위의 문제입니다
기계 번역처럼 읽히는 기계 번역은 성과가 나쁩니다. 이유는 검색엔진이 도구를 탐지하기 때문이 아닙니다. 결과물이 일반론에 그치기 때문이며, 일반적인 콘텐츠는 더 구체적인 무엇과 맞붙으면 언제나 집니다.
두 가지 실패가 반복됩니다. 키워드 번역. 영어 표현을 그대로 옮긴 말은 그 언어 사용자가 실제로 검색하는 말이 아닌 경우가 잦아서, 정확히 번역된 페이지가 아무도 입력하지 않는 표현을 노리게 됩니다. 키워드 조사는 언어마다 따로 해야 하며, 영어로 한 번 하고 그것을 번역해서는 안 됩니다.
문화적, 규제적 어긋남. 통화가 맞지 않는 가격, 그 시장에 적용되지 않는 규정, 아무도 알아보지 못하는 사례가 여기에 속합니다. 영국 데이터 보호 의무를 다룬 페이지를 조정 없이 일본어로 옮기면 정확하면서도 쓸모가 없습니다.
진짜 판단은 무엇을 번역할 것인가입니다. 전부 번역하면 비용이 크고 그 시장에서 아무도 원하지 않는 페이지가 쌓입니다. 가장 강한 페이지만 골라, 단순 변환이 아니라 현지에 맞게 다듬어 옮기는 편이 전부를 직역하는 것보다 대체로 낫습니다.
아무도 말해 주지 않는 문자 체계별 규칙
가장 크게 놀란 부분이며, 전적으로 기계적인 영역입니다.
메타 설명 길이는 하나의 숫자가 아닙니다. 영어에 맞춰 잰 설명은 같은 뜻에 더 많은 단어가 필요한 독일어와 루마니아어에서 길어지고, 글자 하나가 훨씬 많은 뜻을 담는 일본어나 중국어에서는 터무니없이 길어집니다. 그래서 하나의 전역 한도 대신 문자 체계별로 구간을 나눴습니다. 단일 한도는 집합의 대부분에 대해 틀리기 때문입니다.
본문 길이의 하한도 같은 방식으로 다릅니다. 1,100단어짜리 영어 글과 같은 내용을 담은 일본어 글은 단어 수로는 그 일부에 불과하고 글자 수로는 전혀 다른 값이 나옵니다. CJK 콘텐츠를 단어로 재는 것은 의미가 없으므로, 일본어와 중국어는 글자 수를, 나머지는 단어 수를 확인합니다.
문장 부호가 다릅니다. 물음표는 어디서나 ?인 것이 아닙니다. 아랍어에는 고유한 물음표가 있고, 중국어와 일본어는 전각 형태를 쓰며, 일본어 의문문은 물음표 대신 마침표로 끝나는 일이 흔합니다. ASCII 물음표를 찾아 질문을 세는 검사는 영어가 아닌 모든 페이지가 멀쩡하다고 조용히 보고하는데, 우리 검사가 고쳐지기 전까지 정확히 그랬습니다.
수치는 번역에서 어긋납니다. 영어가 숫자를 쓴 자리에 글자로 풀어 쓴 번역자가 실수를 한 것은 아니지만, 그 페이지는 더 이상 원문과 일치하지 않습니다. 그리고 한쪽이 갱신되면 다른 쪽은 갱신되지 않습니다. 그래서 모든 번역의 숫자가 원문과 맞는지 검사합니다.
구조가 맞아야 합니다
우리가 돌리는 검사 가운데 가장 쓸모 있는 것은 각 번역을 원문과 대조해 구조 일치를 보는 검사입니다. 제목 수가 같은지, 목록과 표의 수가 같은지, FAQ 항목 수가 같은지를 봅니다.
이 검사는 다른 무엇도 잡지 못하는 것을 잡습니다. 짧은 두 절을 하나로 합친 번역자는 좋은 문장을 만들어 냈지만 페이지와 구조화 데이터 사이의 대응을 깨뜨린 것입니다. FAQ 항목이 하나 빠지면 눈에 보이는 페이지와 FAQPage 마크업이 서로 어긋나며, 그런 불일치는 신뢰를 높이기는커녕 떨어뜨립니다.
누락도 잡아냅니다. 번역하기 어려워 조용히 빠진 절은 사람이 읽어서는 보이지 않고 세는 프로그램에는 곧바로 드러납니다.
비용은 얼마이며 그만한 가치가 있는가
솔직히 말해 열두 개 언어는 많고 유지 부담은 실재합니다. 글 하나가 열두 개의 파일이고, 수정 한 번이 열두 번의 수정이며, 모든 검사가 그 전부를 훑어야 합니다.
이것이 회수되는지는 전적으로 그 시장에 실제로 판매하는지에 달려 있습니다. 응대할 수 없는 언어의 트래픽은 허영 지표이고, 같은 노력을 한 언어의 권위에 쏟는 편이 매출에는 대개 더 낫습니다. 이 일을 하는 이유는 시장 접근이지 노출 수가 아닙니다.
그래도 하기로 했다면 지속 가능하게 만드는 것은 검사가 자동화되어 있고 공개 전에 돌아간다는 사실 하나입니다. 규율만으로 관리하는 열두 개 언어는 한 분기 안에 어긋납니다. 일관되지 않은 집합을 통과시키지 않는 관문을 둔 열두 개 언어는 어긋나지 않습니다.
Mecanik은 웹 개발 업무의 일부로 다국어 사이트를 만들고 유지하며, 첫 산출물은 대개 콘텐츠가 아니라 검사입니다.
자주 묻는 질문
hreflang은 실제로 무엇을 하나요? 여러 URL이 서로 다른 언어로 된 동일한 콘텐츠임을 검색엔진에 알려서, 페이지들이 서로 경쟁하는 대신 알맞은 사용자에게 알맞은 판본이 제공되게 합니다. 어떤 언어가 상위에 오를지는 정하지 않습니다. 주석은 상호적이어야 하고, 모든 집합은 페이지 자신을 포함해야 하며, x-default가 대체 경로를 지정해야 합니다.
언어마다 별도의 도메인을 써야 하나요? 대개는 아닙니다. 단일 도메인의 하위 디렉터리는 권위를 여러 자산으로 나누지 않고 하나의 호스트명에 모아 둡니다. 국가별 도메인은 사업 자체가 실제로 분리되어 있을 때 타당하고, 그 밖의 경우에는 드뭅니다.
기계 번역이 검색 순위를 해치나요? 간접적으로 그렇습니다. 문제는 도구가 탐지된다는 점이 아니라 결과물이 일반론에 그친다는 점이며, 일반적인 콘텐츠는 더 구체적인 무엇과 맞붙으면 집니다. 더 큰 실패는 키워드 번역입니다. 영어 표현을 그대로 옮긴 말은 그 언어 사용자가 검색하는 말이 아닌 경우가 많아, 키워드 조사는 언어마다 따로 해야 합니다.
메타 설명 길이 제한이 언어마다 다른가요? 다릅니다. 하나의 숫자로 다루면 다국어 집합의 대부분에 대해 틀립니다. 같은 뜻이 독일어나 루마니아어에서는 더 많은 단어를 요구하고, 글자 하나가 더 많은 뜻을 담는 일본어나 중국어에서는 훨씬 적은 글자로 끝납니다. 전역 한도 하나보다 문자 체계별 구간이 더 잘 맞습니다.
대규모로 번역 일관성을 어떻게 유지하나요? 규율에만 기대지 말고 공개 전에 자동 검사를 돌리십시오. 각 번역을 원문과 대조해 제목, 목록, 표, FAQ 항목 수가 같은지 구조 일치를 보고, 수치가 서로 맞는지 확인하십시오. 두 검사 모두 문장으로는 아무 문제 없이 읽히는 결함, 이를테면 합쳐진 절이나 글자로 풀어 쓴 숫자를 잡아냅니다.
댓글