SEO đa ngôn ngữ thường được trình bày như một bài toán dịch thuật kèm một chút markup kỹ thuật. Việc chúng tôi vận hành trang này bằng mười hai ngôn ngữ, gồm tiếng Anh, Ả Rập, Đức, Pháp, Hungary, Ý, Nhật, Hàn, Romania, Việt và cả hai dạng chữ viết của tiếng Trung, cho thấy rõ rằng dịch mới là nửa dễ.
Nửa khó nằm ở chỗ mọi quy tắc bạn dựa vào trong tiếng Anh đều có một phiên bản phụ thuộc hệ chữ viết mà bạn không hề biết. Giới hạn độ dài khác nhau. Cấu trúc trôi lệch. Các con số bị một bản dịch có thiện chí viết thành chữ và thôi khớp với bản gốc. Không điều nào trong số đó lộ ra cho tới khi có thứ gì đó kiểm tra.
Thứ thực sự khiến mọi chuyện chạy được là tự động hóa, không phải sự chăm chỉ. Mười một cổng kiểm tra riêng biệt chạy qua nội dung trước khi bất cứ thứ gì được xuất bản: độ phủ ngôn ngữ, sự tương ứng cấu trúc giữa bản gốc và các bản dịch, tính nhất quán của số liệu, thứ tự tiêu đề, liên kết chết và độ dài metadata theo từng hệ chữ viết. Mỗi cổng đều được viết sau khi lỗi tương ứng đã lọt lên production. Đó là câu trả lời trung thực cho việc một trang đa ngôn ngữ giữ được sự chính xác.
SEO đa ngôn ngữ bắt đầu từ hreflang
Mục đích của hreflang hẹp hơn nhiều so với những gì phần lớn hướng dẫn gợi ý. Nó không quyết định ngôn ngữ nào lên hạng. Nó nói với công cụ tìm kiếm rằng nhiều URL là cùng một nội dung ở các ngôn ngữ khác nhau, để bản đúng được hiển thị cho đúng người thay vì cạnh tranh lẫn nhau.
Ba quy tắc mới quan trọng, phần còn lại là chi tiết.
Khai báo phải có chiều ngược lại. Nếu trang tiếng Anh trỏ sang trang tiếng Đức thì trang tiếng Đức phải trỏ ngược về. Khai báo một chiều thường bị bỏ qua, và đây là lỗi triển khai phổ biến nhất, hơn hẳn mọi lỗi khác. Google có tài liệu nêu rõ yêu cầu này cùng với ba cách khai báo nó.
Mỗi tập hợp phải chứa chính nó. URL của chính trang đó thuộc về danh sách của nó.
Dùng x-default cho trang mà người dùng nhận được khi không ngôn ngữ nào khớp. Thiếu nó, phương án dự phòng chỉ là phỏng đoán.
Quyết định cấu trúc nằm bên dưới là các ngôn ngữ sống ở đâu. Thư mục con dưới một tên miền, cách trang này đang làm, giữ mọi thứ trên một hostname nên uy tín không bị chia cho mười hai tài sản riêng. Tên miền riêng theo quốc gia chỉ hợp lý khi các pháp nhân thực sự tách biệt, ngoài ra thì hiếm khi.
Chất lượng bản dịch là câu chuyện thứ hạng
Một bản dịch máy đọc lên đúng như dịch máy sẽ cho kết quả kém, và lý do không phải vì công cụ tìm kiếm phát hiện ra công cụ dịch. Lý do là đầu ra chung chung, mà nội dung chung chung luôn thua trong thế so kè trước bất cứ thứ gì cụ thể hơn.
Hai lỗi lặp đi lặp lại. Dịch từ khóa. Bản dịch sát nghĩa của một cụm tiếng Anh thường không phải thứ người ta thực sự tìm trong ngôn ngữ đó, nên một trang dịch đúng lại nhắm vào cụm chẳng ai gõ. Nghiên cứu từ khóa phải làm riêng cho từng ngôn ngữ, chứ không làm một lần bằng tiếng Anh rồi đem dịch.
Trôi lệch văn hóa và pháp lý. Giá sai đơn vị tiền tệ, quy định không áp dụng ở thị trường đó, ví dụ chẳng ai nhận ra. Một trang về nghĩa vụ bảo vệ dữ liệu tại Anh, dịch sang tiếng Nhật mà không hiệu chỉnh, vừa chính xác vừa vô dụng.
Quyết định thực sự là dịch cái gì. Dịch tất cả thì tốn kém và tạo ra những trang chẳng ai ở thị trường đó cần. Dịch các trang mạnh nhất, có hiệu chỉnh thay vì chỉ chuyển ngữ, nhìn chung tốt hơn dịch sát nghĩa toàn bộ.
Những quy tắc theo hệ chữ viết mà không ai nhắc
Đây là phần khiến chúng tôi bất ngờ nhất, và nó hoàn toàn máy móc.
Độ dài meta description không phải một con số. Một mô tả vừa vặn trong tiếng Anh sẽ dài quá mức trong tiếng Đức và tiếng Romania, nơi cùng một ý cần nhiều từ hơn, và dài vô lý trong tiếng Nhật hay tiếng Trung, nơi mỗi ký tự mang nhiều nghĩa hơn. Chúng tôi chốt các dải riêng theo hệ chữ viết thay vì một giới hạn chung, vì một giới hạn duy nhất sai với phần lớn tập ngôn ngữ.
Sàn độ dài bài viết cũng khác theo cách đó. Một bài tiếng Nhật chuyển tải đúng nội dung của bài tiếng Anh 1.100 từ chỉ bằng một phần nhỏ về số từ và có số ký tự hoàn toàn khác. Đo nội dung CJK bằng số từ là vô nghĩa, nên chúng tôi đếm ký tự cho tiếng Nhật và tiếng Trung, đếm từ cho phần còn lại.
Dấu câu khác nhau. Dấu hỏi không phải nơi nào cũng là ?. Tiếng Ả Rập có dấu riêng, tiếng Trung và tiếng Nhật dùng dạng toàn chiều rộng, còn câu hỏi tiếng Nhật thường kết bằng dấu chấm. Một bộ kiểm tra tìm câu hỏi bằng dấu hỏi ASCII sẽ lặng lẽ báo rằng mọi trang không phải tiếng Anh đều ổn, đúng như bộ kiểm tra của chúng tôi cho tới khi được sửa.
Số liệu trôi lệch khi dịch. Người viết số thành chữ ở chỗ bản tiếng Anh dùng chữ số không sai, nhưng trang đó không còn khớp nguồn, và khi một bên được cập nhật thì bên kia sẽ không. Chúng tôi kiểm số liệu của mọi bản dịch so với bản gốc.
Cấu trúc buộc phải khớp
Cổng kiểm tra hữu ích nhất mà chúng tôi chạy so sánh từng bản dịch với bản gốc về sự tương ứng cấu trúc: cùng số tiêu đề, cùng số danh sách và bảng, cùng số mục FAQ.
Nó bắt được những thứ không công cụ nào khác thấy. Người gộp hai mục ngắn thành một đã viết ra văn xuôi tốt và đồng thời phá vỡ sự tương ứng giữa trang hiển thị và dữ liệu có cấu trúc của nó. Thiếu một mục FAQ nghĩa là trang nhìn thấy được và markup FAQPage mâu thuẫn nhau, và mâu thuẫn đó làm giảm độ tin cậy thay vì tăng.
Nó cũng bắt được phần bị bỏ sót. Một mục lặng lẽ biến mất vì khó dịch sẽ vô hình khi đọc soát và lộ ngay với một bộ đếm.
Cái giá phải trả và liệu có đáng không
Nói thật: mười hai ngôn ngữ là nhiều, và chi phí bảo trì là có thật. Mỗi bài viết là mười hai tệp, mỗi lần sửa là mười hai lần sửa, và mọi cổng kiểm tra đều phải chạy qua tất cả.
Việc đó có hoàn vốn hay không phụ thuộc hoàn toàn vào chuyện bạn có bán hàng vào những thị trường ấy hay không. Lưu lượng ở một ngôn ngữ bạn không phục vụ được chỉ là chỉ số phù phiếm, và cùng công sức đó dồn vào uy tín trong một ngôn ngữ thường đem lại doanh thu nhiều hơn. Lý do để làm là tiếp cận thị trường, không phải số lần hiển thị.
Nếu bạn quyết định làm, thứ khiến nó bền vững là các cổng kiểm tra được tự động hóa và chạy trước khi xuất bản. Mười hai ngôn ngữ duy trì bằng kỷ luật đơn thuần sẽ trôi lệch trong vòng một quý. Mười hai ngôn ngữ với một cổng từ chối cho qua tập nội dung thiếu nhất quán thì không.
Mecanik xây dựng và duy trì các trang đa ngôn ngữ trong phạm vi công việc phát triển web của chúng tôi, và hạng mục bàn giao đầu tiên thường là các cổng kiểm tra chứ không phải nội dung.
Câu hỏi thường gặp
hreflang thực sự làm gì? Nó nói với công cụ tìm kiếm rằng nhiều URL là cùng một nội dung ở các ngôn ngữ khác nhau, để bản đúng được phục vụ cho đúng người thay vì cạnh tranh lẫn nhau. Nó không quyết định ngôn ngữ nào lên hạng. Khai báo phải có chiều ngược lại, mỗi tập hợp phải chứa chính trang đó, và một x-default nên chỉ ra phương án dự phòng.
Mỗi ngôn ngữ có nên dùng tên miền riêng không? Thường là không. Thư mục con dưới một tên miền giữ uy tín trên một hostname duy nhất thay vì chia nó cho các tài sản riêng biệt. Tên miền theo quốc gia chỉ hợp lý khi bản thân các pháp nhân thực sự tách biệt, ngoài ra thì hiếm khi.
Dịch máy có làm hại thứ hạng không? Một cách gián tiếp. Vấn đề không nằm ở việc phát hiện công cụ dịch mà ở chỗ đầu ra chung chung, mà nội dung chung chung luôn thua trước bất cứ thứ gì cụ thể hơn. Lỗi lớn hơn là dịch từ khóa: bản dịch sát nghĩa của một cụm tiếng Anh thường không phải thứ người ta tìm trong ngôn ngữ đó, nên nghiên cứu từ khóa phải làm riêng cho từng ngôn ngữ.
Giới hạn meta description có khác nhau theo ngôn ngữ không? Có, và coi chúng là một con số duy nhất là sai với phần lớn một tập đa ngôn ngữ. Cùng một ý cần nhiều từ hơn trong tiếng Đức hay tiếng Romania và ít ký tự hơn hẳn trong tiếng Nhật hay tiếng Trung, nơi mỗi ký tự mang nhiều nghĩa hơn. Các dải riêng theo hệ chữ viết hoạt động tốt hơn một giới hạn chung duy nhất.
Làm sao giữ các bản dịch nhất quán ở quy mô lớn? Bằng kiểm tra tự động chạy trước khi xuất bản chứ không chỉ bằng kỷ luật. Hãy so từng bản dịch với bản gốc về sự tương ứng cấu trúc, tức cùng số tiêu đề, danh sách, bảng và mục FAQ, rồi xác nhận các số liệu khớp nhau. Cả hai đều bắt được lỗi đọc lên vẫn trôi chảy, như hai mục bị gộp hoặc một con số bị viết thành chữ.
Bình luận