Bộ dữ liệu và mô hình Hỏi–Đáp biểu đồ (Chart Question Answering) tiếng Việt, cốt lõi là multi-hop reasoning trên text + chart trong các bài viết thật (không phải chart rời lẻ), hướng tới công bố tại hội nghị NLP hạng A* (ACL hoặc EMNLP).
Trạng thái: giai đoạn lập kế hoạch — chưa có dữ liệu/code. Tài liệu trong repo này là kế hoạch làm việc nội bộ cho nhóm 10 sinh viên, chưa phải công bố chính thức.
Chart QA tiếng Anh đã gần bão hoà ở benchmark gốc ChartQA (VLM hàng đầu đạt >90%), tiếng Việt chưa có benchmark chuyên biệt cho biểu đồ. Phần lớn chart tiếng Việt chất lượng tốt nằm trong bài báo (title + nội dung phân tích + 1-3 chart minh hoạ), không phải chart rời trong thư viện — ViChartQA khai thác đặc điểm này: multi-hop reasoning kết hợp đọc hiểu văn bản và đọc chart, gần với dòng HybridQA/TAT-QA/MultiHiertt/SlideVQA hơn dòng ChartQA/CharXiv (chart-only). So sánh đầy đủ ở docs/01.
ViInfographicVQA và VMMU là căn cứ động lực bổ sung — chi tiết ở docs/01.
ViChartQA nhắm lấp khoảng trống: văn bản + chart cùng lúc × tiếng Việt × multi-hop reasoning thật sự (verify bằng evidence chain, không chỉ gắn nhãn).
- Bộ dữ liệu — bài viết thật nguồn Việt Nam (title + content + 1-3 chart), câu hỏi multi-hop kết hợp đọc văn bản và đọc chart. Miền dữ liệu mở rộng theo nguồn cung thực tế (xem docs/02), ưu tiên kinh tế, mở sang khoa học/giáo dục/y tế/môi trường/năng lượng nếu có nguồn cùng dạng.
- Mô hình — gác lại, chưa chốt hướng. Taxonomy câu hỏi khá đa dạng nên thay vì fine-tune 1 mô hình end-to-end, hướng đang cân nhắc là 1 framework/pipeline nhiều bước kiểu ChartQAPro.
- Công bố — dataset + model paper tại hội nghị A*, qua ACL Rolling Review.
.
├── README.md # tài liệu này
├── docs/
│ ├── 01-related-work.md # bối cảnh & rà soát công trình liên quan
│ ├── 02-dataset-design.md # thiết kế dataset: nguồn, taxonomy câu hỏi, schema
│ ├── 03-annotation-guidelines.md # hướng dẫn gán nhãn chi tiết cho annotator
│ └── 04-model-strategy.md # chiến lược mô hình, backbone, đánh giá
└── annotation-tool/ # công cụ gán nhãn (Streamlit + SQLite) — xem annotation-tool/README.md
(các thư mục data/, models/, scripts/ cho phần dataset/model sẽ được tạo khi cần)
| Nhân lực | 10 sinh viên |
| Thời lượng lõi | 6–7 tuần (14/07 – 31/08/2026) |
| Đơn vị dữ liệu | Document: title + body_text + 1–3 chart (không phải chart rời) |
| Miền dữ liệu | Kinh tế (neo) · Khoa học/giáo dục/y tế/môi trường/năng lượng (mở rộng theo nguồn cung) |
| Taxonomy câu hỏi | 2 chiều: loại suy luận (7 giá trị: data_retrieval/visual/compositional/visual_compositional/multiple_choice/fact_check/unanswerable) × phạm vi bằng chứng (single_chart/text_to_chart/chart_to_chart/fact_check_dual) |
| Quy mô mục tiêu | MVP: 1.200 document / 6.000 QA · Mở rộng: 2.000 document / ~15.000 QA |
| Chiến lược mô hình | Gác lại — xem Mục tiêu dự án #2 |
| Venue mục tiêu | ACL hoặc EMNLP (2 hội nghị CORE A* trong dòng *ACL; NAACL/EACL chỉ hạng A) qua ARR |
Chi tiết đầy đủ từng phần nằm trong docs/. Bản kế hoạch trực quan (bảng so sánh, Gantt, checklist) xem tại artifact đã chia sẻ với nhóm.
- Chất lượng > số lượng thô. ChartQAPro (1.341 chart / 1.948 câu hỏi) vẫn đủ mạnh để công bố nhờ độ khó và thiết kế tốt — nếu phải đánh đổi, ưu tiên độ khó và độ sạch của nhãn.
- Không huấn luyện mô hình từ đầu. Fine-tune backbone có sẵn (ChartGemma, TinyChart, ChartMoE đều làm vậy).
- Ưu tiên nguồn dữ liệu mở/chính phủ. Xem docs/02.
Dự án đang ở giai đoạn nội bộ, chưa mở đóng góp bên ngoài.
Chưa xác định — chốt cùng rà soát pháp lý nguồn dữ liệu ở Tuần 1 (xem docs/02).