10 phút đọc

Retrieval-Augmented Generation (RAG)

Retrieval-augmented generation, hay RAG, là một phương pháp AI truy xuất thông tin liên quan từ các nguồn bên ngoài trước khi mô hình ngôn ngữ lớn tạo câu trả lời. Mục đích của RAG là giúp câu trả lời dựa trên những thông tin được lựa chọn, cập nhật hoặc riêng tư mà có thể không tồn tại trong dữ liệu huấn luyện của mô hình.

Một hệ thống RAG thường kết hợp thành phần truy xuất thông tin với một mô hình sinh nội dung. Bộ truy xuất tìm các đoạn văn, bản ghi hoặc dữ liệu hữu ích, sau đó mô hình sử dụng những thông tin này làm ngữ cảnh khi tạo câu trả lời.

Retrieval-augmented generation hoạt động như thế nào

Một pipeline RAG thường có hai phần: chuẩn bị thông tin để truy xuất và sử dụng thông tin đó để trả lời yêu cầu.

  1. Thu thập và chuẩn bị dữ liệu nguồn. Hệ thống kết nối với các nguồn được phê duyệt như tài liệu, website, cơ sở dữ liệu, hướng dẫn sản phẩm, bài viết hỗ trợ hoặc chính sách của công ty.
  2. Chia nhỏ và lập chỉ mục nội dung. Các tài liệu dài thường được chia thành những phần nhỏ hơn, gọi là chunks. Sau đó hệ thống tạo một chỉ mục có thể được tìm kiếm hiệu quả. Nhiều hệ thống RAG chuyển các chunks thành embeddings, tức các biểu diễn dạng số thể hiện ý nghĩa của nội dung.
  3. Xử lý truy vấn của người dùng. Khi có người đặt câu hỏi, hệ thống truy xuất sẽ tìm kiếm trong chỉ mục để tìm thông tin liên quan. Hệ thống có thể sử dụng tìm kiếm theo từ khóa, semantic search, bộ lọc cơ sở dữ liệu hoặc kết hợp nhiều phương pháp.
  4. Truy xuất ngữ cảnh liên quan nhất. Hệ thống lựa chọn các đoạn văn hoặc bản ghi có vẻ hữu ích nhất để trả lời truy vấn. Một thành phần reranking có thể sắp xếp lại kết quả trước khi chúng được chuyển đến mô hình.
  5. Bổ sung ngữ cảnh vào prompt. Phần ngữ cảnh được truy xuất sẽ được thêm vào hướng dẫn và truy vấn ban đầu được gửi tới mô hình ngôn ngữ lớn.
  6. Tạo câu trả lời. Mô hình tạo phản hồi bằng cách sử dụng cả khả năng ngôn ngữ của mình và phần ngữ cảnh được cung cấp. Ứng dụng cũng có thể hiển thị các trích dẫn dẫn đến những nguồn đã được truy xuất.

Chất lượng của câu trả lời cuối cùng phụ thuộc vào cả hai giai đoạn. Hệ thống phải truy xuất đúng thông tin và mô hình phải sử dụng thông tin đó một cách chính xác.

Vì sao RAG quan trọng

Một mô hình ngôn ngữ lớn học các mẫu từ dữ liệu huấn luyện, nhưng kiến thức bên trong mô hình không phải là một cơ sở dữ liệu được cập nhật theo thời gian thực. Mô hình có thể thiếu thông tin mới, dữ liệu nội bộ của doanh nghiệp hoặc kiến thức chuyên ngành. Mô hình cũng có thể tạo ra một câu trả lời nghe có vẻ hợp lý ngay cả khi không có đủ thông tin đáng tin cậy.

Retrieval-augmented generation giải quyết vấn đề này bằng cách cung cấp cho mô hình bằng chứng liên quan tại thời điểm người dùng gửi yêu cầu. Các tổ chức có thể cập nhật những nguồn kiến thức được kết nối mà không cần huấn luyện lại toàn bộ mô hình.

RAG cũng có thể giúp câu trả lời dễ kiểm chứng hơn. Khi một ứng dụng lưu lại thông tin nguồn, ứng dụng có thể cho người dùng biết tài liệu hoặc đoạn nội dung nào hỗ trợ cho câu trả lời. Điều này không đảm bảo câu trả lời luôn chính xác, nhưng cung cấp cho người dùng cơ sở rõ ràng hơn để kiểm tra các thông tin quan trọng.

Các yêu cầu phổ biến

Một kiến trúc RAG dùng trong môi trường production thường cần:

  • Một tập hợp các nguồn kiến thức đáng tin cậy được xác định rõ
  • Quy trình làm sạch, chia nhỏ và lập chỉ mục nội dung
  • Phương pháp truy xuất phù hợp với loại dữ liệu và loại truy vấn
  • Kiểm soát quyền truy cập đối với thông tin riêng tư hoặc bị giới hạn
  • Một mô hình ngôn ngữ lớn có khả năng sử dụng ngữ cảnh được truy xuất
  • Cơ chế giám sát và đánh giá chất lượng truy xuất cũng như chất lượng câu trả lời
  • Phương pháp cập nhật hoặc xóa thông tin lỗi thời

Quản lý nguồn dữ liệu tốt là yếu tố thiết yếu. Các trang trùng lặp, tiêu đề không rõ ràng, tài liệu không thể truy cập, metadata bị thiếu và nội dung lỗi thời đều có thể khiến quá trình truy xuất kém tin cậy hơn.

Lợi ích của RAG

RAG cung cấp cho các ứng dụng AI quyền truy cập có kiểm soát vào thông tin nằm ngoài dữ liệu huấn luyện ban đầu của mô hình. Điều này mang lại một số lợi ích thực tế:

  • Câu trả lời cập nhật hơn: Nguồn kiến thức có thể được cập nhật mà không cần huấn luyện lại mô hình ngôn ngữ.
  • Sử dụng thông tin riêng tư: Người dùng được cấp quyền có thể đặt câu hỏi về chính sách nội bộ, bản ghi hoặc tài liệu của tổ chức.
  • Câu trả lời phù hợp hơn: Quá trình truy xuất có thể tập trung mô hình vào một tổ chức, sản phẩm hoặc lĩnh vực kỹ thuật cụ thể.
  • Dẫn nguồn: Ứng dụng có thể liên kết câu trả lời với tài liệu hoặc đoạn nội dung hỗ trợ.
  • Khả năng kiểm soát cao hơn: Các nhóm có thể quyết định những nguồn nào hệ thống được phép truy xuất và loại bỏ nội dung không đáng tin cậy.
  • Chi phí thích ứng thấp hơn: Đối với nhiều tác vụ dựa trên kiến thức, việc cập nhật chỉ mục thường thực tế hơn so với huấn luyện lại mô hình mỗi khi thông tin thay đổi.

Những lợi ích này phụ thuộc vào chất lượng dữ liệu, quá trình truy xuất, prompt và mô hình. Chỉ bổ sung khả năng truy xuất không có nghĩa là hệ thống sẽ tự động trở nên đáng tin cậy.

Hạn chế và rủi ro

RAG không loại bỏ hoàn toàn hiện tượng hallucination. Mô hình có thể hiểu sai nội dung được truy xuất, kết hợp các nguồn không chính xác hoặc đưa ra những khẳng định không có căn cứ. Nếu quá trình truy xuất trả về ngữ cảnh không liên quan hoặc không đầy đủ, câu trả lời được tạo ra vẫn có thể sai.

Các hạn chế khác bao gồm:

  • Kết quả kém do nội dung nguồn lỗi thời, trùng lặp hoặc có cấu trúc không tốt
  • Mất ý nghĩa khi tài liệu được chia thành các chunks không phù hợp
  • Truy xuất thất bại do truy vấn mơ hồ hoặc phức tạp
  • Tăng thời gian xử lý và chi phí hạ tầng
  • Giới hạn context window làm giảm lượng bằng chứng mà mô hình có thể sử dụng
  • Khó đánh giá câu trả lời nếu không có bộ câu hỏi kiểm thử mang tính đại diện

Bảo mật cũng cần được thiết kế cẩn thận. Hệ thống phải ngăn người dùng truy xuất những tài liệu mà họ không được cấp quyền truy cập. Các nhóm cũng cần tính đến nguy cơ lộ dữ liệu nhạy cảm, các chỉ dẫn độc hại nằm trong nội dung được truy xuất, nguồn bên ngoài không đáng tin cậy và trích dẫn sai.

Do đó, độ chính xác của RAG cần được đánh giá ở hai cấp độ: hệ thống có truy xuất đúng bằng chứng hay không, và câu trả lời cuối cùng có liên quan, đầy đủ và thực sự dựa trên bằng chứng đó hay không.

Retrieval-augmented generation được sử dụng như thế nào

RAG hữu ích nhất khi một ứng dụng AI cần thông tin mang tính chuyên biệt, thường xuyên được cập nhật, quá lớn để đưa vào mọi prompt hoặc chỉ được phép truy cập bởi một số người dùng nhất định.

Các trường hợp sử dụng phổ biến bao gồm:

  • Trợ lý hỗ trợ khách hàng truy xuất tài liệu sản phẩm và các bài viết hỗ trợ đã được phê duyệt
  • Trợ lý dành cho nhân viên trả lời câu hỏi dựa trên chính sách công ty và cơ sở kiến thức nội bộ
  • Công cụ nghiên cứu tìm các đoạn nội dung liên quan trong báo cáo hoặc bài nghiên cứu học thuật
  • Trợ lý pháp lý hoặc compliance truy xuất các chính sách và quy định được cấp quyền để con người xem xét
  • Trợ lý thương mại điện tử sử dụng thông tin sản phẩm, tồn kho hoặc giao hàng mới nhất
  • AI agent tham khảo hướng dẫn thương hiệu, dữ liệu chiến dịch hoặc hướng dẫn vận hành trước khi hoàn thành một tác vụ

Ví dụ, một AI agent hỗ trợ chiến lược mạng xã hội có thể truy xuất thuật ngữ thương hiệu đã được phê duyệt, nghiên cứu đối tượng và hướng dẫn của từng nền tảng trước khi đề xuất nội dung. Khả năng retrieval cung cấp kiến thức liên quan cho agent, trong khi các công cụ tự động hóa riêng biệt thực hiện những hành động đã được phê duyệt.

Khi AI agent cần làm việc bên trong ứng dụng di động, RAG và cloud phone đảm nhiệm những chức năng khác nhau. RAG cung cấp kiến thức liên quan cho agent. Một điện thoại đám mây Android cung cấp môi trường di động để một workflow được cấp quyền có thể hoạt động.

Multilogin là nền tảng cloud phone dành cho marketer, agency và những người xây dựng AI workflow quản lý nhiều hồ sơ mạng xã hội. Cloud phone, API và quyền truy cập ADB của Multilogin có thể hỗ trợ phần thực thi của workflow AI agent, nhưng Multilogin không phải là một nền tảng RAG.

Các công nghệ liên quan

Semantic search truy xuất thông tin dựa trên ý nghĩa thay vì chỉ dựa vào từ khóa khớp chính xác. Đây là kỹ thuật thường được sử dụng trong các pipeline RAG.

Embeddings là các biểu diễn dạng số của nội dung. Chúng cho phép hệ thống truy xuất so sánh mức độ tương đồng về ngữ nghĩa giữa truy vấn và thông tin đã được lập chỉ mục.

Vector databases lưu trữ và tìm kiếm embeddings một cách hiệu quả. Chúng phổ biến trong kiến trúc RAG nhưng không bắt buộc. Một hệ thống RAG cũng có thể sử dụng tìm kiếm theo từ khóa, truy vấn SQL, search API, knowledge graph hoặc hybrid retrieval.

Fine-tuning thay đổi hành vi hoặc các mẫu mà mô hình đã học bằng cách huấn luyện mô hình với các ví dụ bổ sung. RAG cung cấp ngữ cảnh bên ngoài tại thời điểm truy vấn. Hai phương pháp giải quyết những vấn đề khác nhau và có thể được sử dụng cùng nhau.

Agentic RAG cho phép AI agent lập kế hoạch hoặc lặp lại các bước truy xuất, lựa chọn giữa các nguồn dữ liệu, diễn đạt lại truy vấn và sử dụng công cụ trước khi tạo câu trả lời.

Điểm chính cần nhớ

Retrieval-augmented generation kết nối một mô hình ngôn ngữ với kiến thức bên ngoài trước khi mô hình trả lời yêu cầu. RAG đặc biệt hữu ích khi một ứng dụng cần thông tin cập nhật, riêng tư, chuyên biệt hoặc có thể kiểm chứng mà không phải liên tục huấn luyện lại mô hình.

Một hệ thống RAG đáng tin cậy cần nhiều hơn một vector database. Chất lượng nguồn dữ liệu, kiểm soát quyền truy cập, độ chính xác của quá trình truy xuất, thiết kế prompt, trích dẫn và đánh giá câu trả lời đều ảnh hưởng đến kết quả.

Mọi người cũng hỏi

Retrieval-augmented generation là gì?

Retrieval-augmented generation (RAG) là một phương pháp AI truy xuất thông tin liên quan từ các nguồn bên ngoài và cung cấp thông tin đó cho mô hình ngôn ngữ lớn làm ngữ cảnh trước khi mô hình tạo câu trả lời.

RAG hoạt động như thế nào?

Một hệ thống RAG tìm kiếm trong nguồn kiến thức đã được lập chỉ mục, chọn thông tin liên quan, thêm thông tin đó vào prompt của mô hình và yêu cầu mô hình trả lời dựa trên ngữ cảnh được cung cấp.

Các thành phần chính của hệ thống RAG là gì?

Các thành phần chính gồm nguồn kiến thức, pipeline xử lý và lập chỉ mục nội dung, retriever, reranker tùy chọn, lớp xây dựng prompt và mô hình ngôn ngữ sinh nội dung.

RAG khác gì với fine-tuning?

RAG cung cấp thông tin bên ngoài cho mô hình tại thời điểm truy vấn, trong khi fine-tuning thay đổi hành vi của mô hình bằng cách huấn luyện thêm trên dữ liệu mới. Hai phương pháp giải quyết những vấn đề khác nhau và có thể được sử dụng cùng nhau.

RAG có giúp giảm hallucination không?

Có thể, nhưng không loại bỏ hoàn toàn. RAG giúp mô hình dựa vào thông tin được truy xuất, nhưng câu trả lời vẫn có thể sai nếu nguồn dữ liệu không chính xác, retrieval chọn sai ngữ cảnh hoặc mô hình hiểu sai thông tin.

RAG có cần vector database không?

Không bắt buộc. Nhiều hệ thống RAG sử dụng vector database để tìm kiếm embeddings, nhưng cũng có thể dùng keyword search, SQL, search API, knowledge graph hoặc hybrid retrieval.

RAG thường được sử dụng cho những trường hợp nào?

RAG thường được dùng cho chatbot hỗ trợ khách hàng, trợ lý nội bộ doanh nghiệp, công cụ nghiên cứu, trợ lý pháp lý hoặc compliance, hệ thống thương mại điện tử và AI agent cần truy cập kiến thức cập nhật hoặc riêng tư.

Vận hành tài khoản mạng xã hội trên cloud phone và trình duyệt web

Nuôi tài khoản, tiếp cận thị trường toàn cầu và dễ dàng quản lý hệ thống nhiều tài khoản mạng xã hội chỉ từ một bảng điều khiển.

Dùng thử miễn phí
Telegram
Thank you! We’ve received your request.
Please check your email for the results.
Chúng tôi đang thử nghiệm nền tảng này.
Vui lòng nhập email của bạn để xem kết quả.

Multilogin works with amazon.com