Câu chuyện fine-tuning vs RAG hiếm khi đến với chúng tôi dưới dạng một câu hỏi. Nó thường đến dưới dạng một khẳng định: chúng tôi cần fine-tune một mô hình trên dữ liệu của mình. Đây là một trong những câu đắt tiền nhất trong lĩnh vực AI doanh nghiệp, và phần lớn thời gian nó sai. Không phải lúc nào cũng sai, nhưng thường là vậy. Đằng sau yêu cầu đó gần như luôn là một trong hai điều rất khác nhau: hoặc mô hình không biết gì về doanh nghiệp của bạn, hoặc mô hình biết nhưng trả lời theo cách bạn không muốn. Fine-tuning là giải pháp kém cho vấn đề thứ nhất và là giải pháp đắt đỏ cho vấn đề thứ hai.

Việc chọn giữa fine-tuning, RAG và cải thiện prompt không phải là sở thích kỹ thuật hay chuyện chạy theo xu hướng. Mỗi hướng xử lý một loại vấn đề khác nhau, và chọn sai sẽ tạo ra nhiều tháng làm việc nghiêm túc mà không hề chạm tới lời phàn nàn ban đầu. Cái mất thật sự không phải là ngân sách dự án, mà là cả một quý trôi qua trước khi có người nhận ra triệu chứng vẫn còn y nguyên.

Quy tắc tiết kiệm được nhiều tiền nhất: nếu vấn đề là mô hình không biết một điều gì đó, hãy dùng truy hồi. Nếu vấn đề là mô hình biết nhưng trả lời sai phong cách, sai định dạng hoặc sai độ dài, hãy cải thiện prompt trước và chỉ cân nhắc fine-tuning khi cách đó không đủ. Fine-tuning dạy hành vi chứ không dạy sự kiện, và những đội dùng nó để nhồi kiến thức sẽ nhận về một mô hình sai một cách tự tin y như cũ, chỉ khác là trong một giọng văn mới của công ty.


Fine-tuning vs RAG vs prompt: mỗi cách làm gì

Sự phân biệt đơn giản hơn nhiều so với những gì các cuộc tranh luận gợi ra.

Prompt thay đổi phần chỉ dẫn bạn gửi kèm theo mỗi yêu cầu. Nó định hình giọng điệu, định dạng, cấu trúc và cách lập luận, đồng thời có thể mang theo một lượng ngữ cảnh vừa phải ngay trong nội dung. Nó có hiệu lực ngay lập tức, không tốn gì ngoài token, và có thể sửa trực tiếp trên môi trường vận hành trong vài giây, không cần phát hành mã nguồn và cũng không cần cửa sổ bảo trì.

Truy hồi lấy tài liệu liên quan từ chính nội dung của bạn ngay tại thời điểm có yêu cầu và đặt nó vào ngữ cảnh trước khi mô hình trả lời. Cách này cho mô hình tiếp cận thông tin mà nó chưa từng thấy khi huấn luyện, kể cả những thứ vừa thay đổi sáng nay. Bản thân mô hình không hề bị đụng tới; bạn chỉ đang cải thiện thứ mà nó được đưa cho để làm việc. Bài giải thích của chúng tôi về sinh tăng cường truy hồi trình bày chi tiết cơ chế này.

Fine-tuning điều chỉnh trọng số của mô hình dựa trên các ví dụ về hành vi mà bạn muốn. Nó thực sự hiệu quả khi cần dạy một định dạng nhất quán, một giọng điệu riêng hoặc những khuôn mẫu đặc thù của một tác vụ, tức là những thứ khó mô tả bằng lời nhưng dễ trình bày bằng ví dụ. Nó lại kém khi dạy sự kiện, bởi kiến thức học theo cách đó không thể cập nhật, không thể kiểm toán và không thể trích dẫn, còn mô hình thì không có cách nào báo cho bạn biết khi nó đang dựa vào chúng một cách sai lệch.

Sự nhầm lẫn nảy sinh vì cả ba đều thay đổi kết quả đầu ra. Chỉ có truy hồi thay đổi những gì mô hình biết.


Mỗi cách tốn bao nhiêu

Các con số dưới đây phản ánh mức triển khai điển hình tại Anh cho một ứng dụng doanh nghiệp cỡ vừa.

Prompt. Tính bằng ngày chứ không phải bằng tuần, thường từ 1.000 đến 5.000 bảng Anh, đã bao gồm bộ đánh giá mà bạn nên xây dựng song song. Chi phí vận hành chính là chi phí token; một system prompt dài hơn sẽ làm nó nhích lên đôi chút, và cơ chế cache prompt bù lại phần lớn khoản đó.

Truy hồi. Từ bốn đến mười hai tuần, thường từ 15.000 đến 60.000 bảng Anh, tùy vào mức độ lộn xộn của nội dung nguồn. Phần lớn chi phí xây dựng nằm ở khâu nạp dữ liệu: lấy tài liệu ra khỏi những hệ thống đang giữ chúng, cắt đoạn một cách hợp lý, xử lý phân quyền để mỗi người chỉ truy hồi được thứ họ được phép xem, và giữ cho chỉ mục luôn cập nhật. Chi phí vận hành có thêm phần lưu trữ vector và một ngữ cảnh lớn hơn đôi chút trong mỗi yêu cầu.

Fine-tuning. Từ hai đến tám tuần công sức kỹ thuật, cộng với bộ dữ liệu, thường từ 20.000 đến 80.000 bảng Anh. Chi phí tính toán khi huấn luyện thường là khoản nhỏ nhất; phần tốn kém là tạo ra vài trăm đến vài nghìn ví dụ chất lượng cao, và đó là công sức của những người hiểu nghiệp vụ. Chi phí vận hành cũng có thể cao hơn, vì mô hình đã fine-tune thường có mức giá cao hơn hoặc đòi hỏi hạ tầng riêng.

Điểm mấu chốt nằm ở sự bất cân xứng. Prompt rẻ đến mức đáng thử trước tiên ngay cả khi bạn khá chắc rằng nó sẽ không đủ, bởi dù sao bạn cũng cần bộ khung đánh giá, và chỉ khi thử bạn mới biết kiểu lỗi thật sự là gì.


Thứ tự nên thử

Đi tuần tự qua các bước này rẻ hơn nhảy thẳng tới bước cuối, kể cả khi rốt cuộc bạn vẫn dừng ở bước cuối.

Bắt đầu bằng bộ đánh giá. Từ ba mươi đến một trăm đầu vào thật, kèm theo đầu ra đúng đã biết. Không có nó, bạn không thể biết một thay đổi có giúp ích hay không, và mọi quyết định sau đó đều là phỏng đoán. Đây là khoản đầu tư rẻ nhất của cả dự án và là thứ duy nhất còn nguyên giá trị dù cuối cùng bạn chọn hướng nào. Đây chính là hệ thống được mô tả trong hướng dẫn tích hợp OpenAI API .

Sau đó cải thiện prompt. Hãy nói rõ về định dạng, đưa vài ví dụ về câu trả lời tốt ngay trong chỉ dẫn, và nêu rõ phải làm gì khi mô hình không biết câu trả lời. Một tỷ lệ đáng ngạc nhiên các phàn nàn kiểu mô hình chưa đủ tốt được giải quyết ngay tại đây, đặc biệt là chuyện dài dòng và thiếu cấu trúc.

Sau đó thử một mô hình lớn hơn hoặc đơn giản là một mô hình khác. Việc này thường rẻ hơn mọi hình thức tùy biến và chỉ mất một buổi chiều để đánh giá. Hướng dẫn của chúng tôi về rời khỏi OpenAI trình bày cách thực hiện phép so sánh đó cho đúng.

Sau đó thêm truy hồi, nếu lỗi nằm ở kiến thức. Nếu mô hình trả lời về sản phẩm, chính sách hay tài liệu của bạn mà sai hoặc từ chối trả lời, đây chính là bước khắc phục.

Sau đó mới cân nhắc fine-tuning, nếu lỗi nằm ở hành vi. Tới lúc này bạn đã có bộ đánh giá, một prompt được tinh chỉnh và, nếu cần, một quy trình truy hồi. Nếu kết quả vẫn chưa đạt về phong cách hay cấu trúc, và bạn thấy trình bày hành vi mong muốn qua hàng trăm ví dụ dễ hơn là mô tả nó bằng lời, thì fine-tuning là công cụ đúng.

Phần lớn dự án dừng lại ở bước ba hoặc bước bốn. Khoản tiết kiệm nằm chính ở đó.


Khi nào fine-tuning thực sự thắng

Vẫn có những trường hợp thật, và gạt bỏ hoàn toàn chúng cũng sai lầm không kém việc chọn fine-tuning ngay từ đầu.

Đầu ra có cấu trúc nhất quán ở quy mô lớn. Khi mọi phản hồi đều phải tuân theo một định dạng cứng nhắc mà việc mô tả trong prompt rất mệt mỏi, mô hình đã fine-tune tạo ra kết quả ổn định hơn với ít token đầu vào hơn nhiều, và ở quy mô lớn khoản đó tự hoàn vốn.

Một giọng văn hoặc văn phong chuyên ngành. Soạn thảo pháp lý, ghi chép lâm sàng, truyền thông tài chính chịu quản lý: đó là những phong cách có quy ước rất chặt, người trong nghề nhận ra ngay và rất khó gói gọn trong chỉ dẫn.

Phân loại với ranh giới tinh tế, khó diễn đạt thành lời. Khi đội của bạn gán nhãn nhất quán nhưng không nói ra được quy tắc, đó đúng là việc mà huấn luyện trên ví dụ sinh ra để làm.

Giảm chi phí ở lưu lượng cao. Một mô hình nhỏ hơn đã fine-tune, ngang ngửa một mô hình tổng quát lớn hơn trên đúng một tác vụ hẹp, có thể cắt giảm đáng kể chi phí cho mỗi yêu cầu. Điều này chỉ hợp lý khi lưu lượng đủ lớn để khoản tiết kiệm vượt qua chi phí xây dựng và bảo trì.

Điểm chung là hành vi, không phải kiến thức. Nếu bạn nói được điều mình muốn trong một đoạn văn, hãy đưa nó vào prompt. Nếu bạn chỉ có thể cho xem, hãy huấn luyện.


Những chi phí không ai báo giá

Có ba gánh nặng thường trực gần như luôn bị bỏ khỏi bài toán kinh tế của fine-tuning.

Bộ dữ liệu già đi. Mô hình đã fine-tune phản ánh đúng những ví dụ nó từng thấy. Khi sản phẩm, chính sách hay văn phong công ty thay đổi, các ví dụ trở nên lỗi thời, còn mô hình vẫn tiếp tục tạo ra hành vi cũ với sự tự tin y hệt. Hãy tính việc huấn luyện lại định kỳ như một khoản chi thường xuyên, không phải một lần rồi thôi.

Bạn bị neo vào một mô hình nền. Fine-tuning gắn với một phiên bản cụ thể. Khi phiên bản đó bị khai tử hoặc khi có mô hình tốt hơn, muốn chuyển sang thì phải huấn luyện lại, và đó là chi phí chuyển đổi có thật mà một prompt không hề có.

Đánh giá trở thành bắt buộc chứ không còn tùy chọn. Với prompt, bạn nhìn bằng mắt cũng thấy được sự thụt lùi. Với mô hình đã fine-tune, bạn không thể soi vì sao hành vi thay đổi, nên bộ khung đánh giá trở thành thiết bị đo duy nhất bạn có.

Truy hồi cũng có phiên bản nhỏ hơn của những gánh nặng này: chỉ mục phải luôn cập nhật, phân quyền phải luôn đúng khi nhân sự đổi vai trò, và phải có người nhận ra khi luồng nạp dữ liệu lặng lẽ dừng lại. Rẻ hơn huấn luyện lại, nhưng không miễn phí.


Chẩn đoán trước, xây dựng sau

Mecanik xây dựng hệ thống truy hồi, bộ khung đánh giá và quy trình fine-tuning như một phần của dịch vụ tích hợp AI , và chúng tôi bắt đầu bằng việc xác định bạn đang thực sự gặp vấn đề nào trong ba vấn đề trên.

Phần chẩn đoán đó thường là một hợp tác ngắn và khá thường xuyên kết thúc bằng một khuyến nghị rẻ hơn nhiều so với dự án bạn đang chuẩn bị. Ở những nơi fine-tuning đúng là câu trả lời, chúng tôi sẽ nói thẳng và ước lượng trung thực khối lượng công việc cho bộ dữ liệu, vì chính phần đó quyết định thành bại. Để có bức tranh ngân sách rộng hơn, hướng dẫn chi phí tích hợp AI của chúng tôi tách riêng chi phí xây dựng và chi phí vận hành.

Hãy cho chúng tôi biết mô hình đang làm sai điều gì, bằng đúng những từ mà người dùng của bạn sẽ dùng, và chúng tôi sẽ nói cho bạn biết đó là vấn đề nào trong ba vấn đề này.


Bài viết liên quan: Phát triển phần mềm AI - Hướng dẫn cho doanh nghiệp Anh , Tự lưu trữ Kimi K3: phần cứng, chi phí, chủ quyền , Di chuyển Drupal 2026: chi phí, lựa chọn và hạn chót , Xây dựng chatbot OpenAI API: Hướng dẫn 2026 .


Câu hỏi thường gặp

Tôi có nên fine-tune mô hình trên dữ liệu công ty không? Thường là không. Fine-tuning dạy hành vi chứ không dạy sự kiện, và kiến thức học theo cách đó không thể cập nhật, trích dẫn hay kiểm toán. Nếu vấn đề là mô hình không biết về sản phẩm, chính sách hay tài liệu của bạn thì truy hồi mới là hướng đúng, và nó rẻ hơn cả khi xây dựng lẫn khi bảo trì.

Fine-tuning và RAG khác nhau thế nào? Truy hồi lấy tài liệu liên quan từ nội dung của bạn ngay tại thời điểm có yêu cầu và đặt vào ngữ cảnh, nhờ đó mô hình trả lời được từ thông tin nó chưa từng thấy khi huấn luyện. Fine-tuning điều chỉnh trọng số của mô hình dựa trên ví dụ, tức là thay đổi cách nó hành xử chứ không thay đổi những gì nó biết.

Fine-tuning tốn bao nhiêu tiền? Thường từ 20.000 đến 80.000 bảng Anh cho một ứng dụng doanh nghiệp cỡ vừa, với hai đến tám tuần công sức kỹ thuật. Chi phí tính toán khi huấn luyện thường là phần nhỏ nhất; phần lớn chi phí nằm ở việc tạo ra vài trăm đến vài nghìn ví dụ chất lượng cao, và việc này đòi hỏi những người hiểu nghiệp vụ.

Xây một hệ thống RAG tốn bao nhiêu? Thường từ 15.000 đến 60.000 bảng Anh trong bốn đến mười hai tuần, và yếu tố chi phối chủ yếu là mức độ lộn xộn của nội dung nguồn. Phần lớn công sức đổ vào khâu nạp dữ liệu, cắt đoạn, xử lý phân quyền để mỗi người chỉ truy hồi được thứ họ được phép xem, và giữ cho chỉ mục luôn cập nhật.

Nên thử các hướng này theo thứ tự nào? Hãy xây bộ đánh giá trước, rồi cải thiện prompt, rồi thử một mô hình lớn hơn hoặc khác, rồi thêm truy hồi nếu lỗi liên quan tới kiến thức, và chỉ khi đó mới cân nhắc fine-tuning nếu lỗi nằm ở hành vi. Phần lớn dự án được giải quyết trước bước cuối cùng.