Tổng Quan Giám Sát & Đánh Giá AI
Giám sát, phân tích và tối ưu hóa hệ thống RAG Hỗ trợ Khách hàng OrbitTech Store.
Tổng Số Bộ QA Đánh Giá
20
bộ câu hỏi
14/20 Đạt Chuẩn (70%)
Độ Trung Thực (Faithfulness)
76.5%
+4.2% so với Baseline
Độ Phủ Ngữ Cảnh (Context Recall)
86.2%
Độ phủ truy xuất rất cao
Chỉ Số Chất Lượng AI
78
/100
🟢 Đạt Ngưỡng Phê Duyệt
Phân Tích Chỉ Số RAGAS Theo Từng Câu Hỏi Test
So sánh Độ trung thực (Faithfulness), Độ liên quan (Relevance), Độ hoàn thiện (Completeness).
Phân Bổ Độ Khó Bộ Dữ Liệu
20
Bộ QA
Bảng Chi Tiết Kết Quả Đánh Giá 20 Câu Benchmark
Click vào từng dòng để xem chi tiết Ngữ cảnh truy xuất (Context) & Đáp án chuẩn (Ground Truth).
| Mã | Độ Khó | Nội Dung Câu Hỏi | Trung Thực | Liên Quan | Hoàn Thiện | Ctx Recall | Ctx Precision | Điểm Tổng | Kết Quả |
|---|
Nhật Ký Các Case Benchmark
Kho Dữ Liệu Golden Dataset (20 QA)
Tập dữ liệu câu hỏi và đáp án mẫu được chọn lọc qua 10 tài liệu hỗ trợ của OrbitTech Store.
Phân Tích Lỗi & Phương Pháp Root Cause (5 Whys)
Phân loại 6 case bị lỗi, truy tìm nguyên nhân gốc rễ và đề xuất phương án cải tiến hệ thống.
Phân Bổ Các Loại Lỗi
Nhật Ký Hành Động Khắc Phục (Continuous Improvement Log)
| Mã Lỗi | Phân Loại | Nguyên Nhân Gốc (5 Whys) | Phương Án Khắc Phục Đề Xuất | Trạng Thái |
|---|
Thử Nghiệm Chấm Điểm Trực Tiếp (Live Sandbox)
Nhập câu hỏi để RAG truy xuất ngữ cảnh và chấm điểm live. Các chỉ số cần đáp án chuẩn sẽ hiển thị N/A trong sandbox tự do.
Nhập Câu Hỏi Của Khách Hàng
Mẫu thử nhanh: