Cách tạo cặp câu hỏi gần giống để thử AI trả lời khách
Dùng cặp câu hỏi gần giống nhưng khác điều kiện để kiểm Nhân sự số, Nhân viên số trước khi cho trả lời khách.

Trả lời ngắn: Cách tạo cặp câu hỏi gần giống để thử AI trả lời khách
Để thử AI trả lời khách, hãy tạo hai câu gần giống nhưng thay một điều kiện làm đáp án phải khác. Ghi kết quả mong đợi trước khi chạy. Cách này giúp kiểm Nhân sự số, Nhân viên số có giữ đúng ranh giới hay chỉ bám vào vài từ quen.
Cặp câu hỏi gần giống kiểm được điều gì?
Một bộ thử chỉ gồm câu dễ thường cho thấy AI biết trả lời trong tình huống thuận lợi. Cặp câu hỏi gần giống giúp kiểm điểm chuyển: khi dữ kiện đổi, câu trả lời có đổi theo đúng quy định không? Anh chị có thể làm bằng bảng giấy trước khi cần công cụ.
Google Dialogflow mô tả các câu gần giống với ý định đã có nhưng thực tế không nên khớp. Bài này dùng nguyên tắc phân biệt đó để thiết kế bài thử cho shop; không yêu cầu shop dùng Dialogflow và không xác nhận ATECH vận hành bằng nền tảng này.
Nguồn cho dữ kiện trên: Intents — Dialogflow CX (Google Cloud Documentation)
Bước đầu nên chọn quy tắc nào?
Chọn một câu hỏi lặp lại đã có nguồn rõ và ranh giới cụ thể. Ví dụ minh họa: một loại dịch vụ áp dụng cho hàng sẵn, còn hàng làm riêng phải được người phụ trách kiểm. Đừng bắt đầu từ chính sách mà hai nhân viên còn hiểu khác nhau.
Ghi phiên bản nguồn, ngày dùng cho lượt thử và người xác nhận đáp án. Nếu nguồn chưa đủ để quyết định, đáp án mong đợi phải là hỏi thêm hoặc chuyển người. Không điền một câu trả lời chắc chắn chỉ để mọi dòng trong bảng đều có “có” hoặc “không”.
Thay một chi tiết trong cặp như thế nào?
Giữ phần lớn câu chữ và đổi một dữ kiện có ý nghĩa. Khi cả sản phẩm, kênh bán và tình trạng đơn cùng thay, khó biết điều gì khiến AI chọn nhánh khác. Cặp tốt cho phép người kiểm chỉ ra đúng chi tiết làm đáp án thay đổi.
Ví dụ minh họa: thử “Tôi chưa gửi lời nhắn” và “Tôi đã gửi lời nhắn”. Hệ thống cần phân biệt việc hướng dẫn gửi lần đầu với kiểm lời nhắn đã nhận. Kết quả cụ thể phải dựa vào quy trình của shop, không coi ví dụ này là một chức năng mặc định.
Ghi đáp án mong đợi trước khi thử để làm gì?
Nếu xem AI trả lời rồi mới chấm, người kiểm dễ bị câu văn trôi chảy thuyết phục. Hãy ghi trước ba ô: thông tin bắt buộc phải có, điều không được nói và hành động đúng. Không cần ép câu chữ giống hệt một bản mẫu.
Ví dụ, khi khách chỉ hỏi cách đổi hàng, điều bắt buộc là mô tả các bước đã duyệt. Điều không được nói là yêu cầu của khách đã được chấp nhận. Hành động đúng có thể chỉ là cung cấp hướng dẫn, không mở một việc đổi hàng thật.
Chạy cặp câu hỏi sao cho kết quả dễ đọc lại?
Với câu độc lập, dùng hai cuộc thử riêng có cùng dữ kiện nền. Không hỏi câu thứ hai ngay sau câu thứ nhất nếu mục tiêu không phải kiểm trí nhớ hội thoại. Sau đó đổi thứ tự và lưu cả câu hỏi, câu trả lời, nguồn cùng thời điểm thử.
Chạy trong nơi thử được phép, không gửi cho khách thật. Nếu câu có thể dẫn đến sửa đơn hay gửi tin, phải chặn hành động thật trong lượt kiểm này. Bài thử đang kiểm khả năng chọn đáp án; quyền thực hiện công việc cần được nghiệm thu riêng.
Sau khi sửa, cần thử lại những câu nào?
Giữ câu từng thất bại và cả câu còn lại trong cặp. Thêm vài biến thể cách nói nhưng không đổi nghĩa để xem bản sửa có chỉ học thuộc một câu hay không. Cũng thử nhóm trước đó đã đạt, tránh sửa được một nhánh nhưng làm sai nhánh bên cạnh.
Google Dialogflow cho phép lưu cuộc thử cùng kết quả mong đợi và chạy lại sau khi cập nhật. Shop có thể áp dụng cách làm đó bằng một bảng nhỏ. Người phụ trách quyết định đáp án; Nhân sự số hoặc Nhân viên số chỉ được mở phạm vi trả lời khi có bằng chứng thử phù hợp.
Nguồn cho dữ kiện trên: Test cases — Dialogflow CX (Google Cloud Documentation)
Khi nào bộ thử đủ để đưa vào bước tiếp?
Một cặp đạt chưa chứng minh hệ thống hiểu mọi câu hỏi. Hãy xem đã phủ các ranh giới có trong phạm vi định giao chưa: đủ dữ kiện, thiếu dữ kiện và ngoài phạm vi. Ghi rõ phần chưa thử để người vận hành không hiểu nhầm.
A Tech Economy đề xuất giữ bộ thử này cùng phiếu giao việc. Con người đặt mục tiêu, cấp quyền, duyệt ngoại lệ và chịu trách nhiệm cuối. Khi đổi chính sách, sửa đáp án mong đợi trước rồi mới kiểm hệ thống; không đổi chuẩn chỉ vì AI đã trả một câu khác.
Câu hỏi thường gặp
Có cần hàng trăm câu mới bắt đầu thử được không?
Không. Có thể bắt đầu từ các ranh giới quan trọng của một nhóm nhỏ, nhưng không suy rộng kết quả ra phần chưa thử.
Hai câu trả lời khác chữ có bị tính sai không?
Không nếu giữ đúng nghĩa, điều kiện và hành động mong đợi. Chấm nội dung và ranh giới, không chỉ so văn bản.
Có nên để AI tự chấm toàn bộ không?
Có thể thử hỗ trợ chấm nếu đã kiểm độ tin cậy; người phụ trách vẫn cần xác nhận đáp án và ca gây tranh luận.
Thuộc cụm chủ đề: AI chăm sóc khách hàng. Xem các câu hỏi liên quan để đi từ khái niệm đến cách áp dụng.
Nguồn tham khảo
- Intents — Dialogflow CX — Google Cloud Documentation
- Test cases — Dialogflow CX — Google Cloud Documentation
Bước tiếp theo
Chọn một quy trình đang gây tắc
ATE có thể cùng bạn bóc tách đầu việc, điểm cần người duyệt và cách đo thử nghiệm. Chưa cần bắt đầu bằng cả phòng ban.