Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

37 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

ViChartQA

Bộ dữ liệu và mô hình Hỏi–Đáp biểu đồ (Chart Question Answering) tiếng Việt, cốt lõi là multi-hop reasoning trên text + chart trong các bài viết thật (không phải chart rời lẻ), hướng tới công bố tại hội nghị NLP hạng A* (ACL hoặc EMNLP).

Trạng thái: giai đoạn lập kế hoạch — chưa có dữ liệu/code. Tài liệu trong repo này là kế hoạch làm việc nội bộ cho nhóm 10 sinh viên, chưa phải công bố chính thức.

Vấn đề & động lực

Chart QA tiếng Anh đã gần bão hoà ở benchmark gốc ChartQA (VLM hàng đầu đạt >90%), tiếng Việt chưa có benchmark chuyên biệt cho biểu đồ. Phần lớn chart tiếng Việt chất lượng tốt nằm trong bài báo (title + nội dung phân tích + 1-3 chart minh hoạ), không phải chart rời trong thư viện — ViChartQA khai thác đặc điểm này: multi-hop reasoning kết hợp đọc hiểu văn bản và đọc chart, gần với dòng HybridQA/TAT-QA/MultiHiertt/SlideVQA hơn dòng ChartQA/CharXiv (chart-only). So sánh đầy đủ ở docs/01.

ViInfographicVQA và VMMU là căn cứ động lực bổ sung — chi tiết ở docs/01.

ViChartQA nhắm lấp khoảng trống: văn bản + chart cùng lúc × tiếng Việt × multi-hop reasoning thật sự (verify bằng evidence chain, không chỉ gắn nhãn).

Mục tiêu dự án

  1. Bộ dữ liệu — bài viết thật nguồn Việt Nam (title + content + 1-3 chart), câu hỏi multi-hop kết hợp đọc văn bản và đọc chart. Miền dữ liệu mở rộng theo nguồn cung thực tế (xem docs/02), ưu tiên kinh tế, mở sang khoa học/giáo dục/y tế/môi trường/năng lượng nếu có nguồn cùng dạng.
  2. Mô hình — gác lại, chưa chốt hướng. Taxonomy câu hỏi khá đa dạng nên thay vì fine-tune 1 mô hình end-to-end, hướng đang cân nhắc là 1 framework/pipeline nhiều bước kiểu ChartQAPro.
  3. Công bố — dataset + model paper tại hội nghị A*, qua ACL Rolling Review.

Cấu trúc repo

.
├── README.md                       # tài liệu này
├── docs/
│   ├── 01-related-work.md          # bối cảnh & rà soát công trình liên quan
│   ├── 02-dataset-design.md        # thiết kế dataset: nguồn, taxonomy câu hỏi, schema
│   ├── 03-annotation-guidelines.md # hướng dẫn gán nhãn chi tiết cho annotator
│   └── 04-model-strategy.md        # chiến lược mô hình, backbone, đánh giá
└── annotation-tool/                # công cụ gán nhãn (Streamlit + SQLite) — xem annotation-tool/README.md

(các thư mục data/, models/, scripts/ cho phần dataset/model sẽ được tạo khi cần)

Tóm tắt kế hoạch

Nhân lực 10 sinh viên
Thời lượng lõi 6–7 tuần (14/07 – 31/08/2026)
Đơn vị dữ liệu Document: title + body_text + 1–3 chart (không phải chart rời)
Miền dữ liệu Kinh tế (neo) · Khoa học/giáo dục/y tế/môi trường/năng lượng (mở rộng theo nguồn cung)
Taxonomy câu hỏi 2 chiều: loại suy luận (7 giá trị: data_retrieval/visual/compositional/visual_compositional/multiple_choice/fact_check/unanswerable) × phạm vi bằng chứng (single_chart/text_to_chart/chart_to_chart/fact_check_dual)
Quy mô mục tiêu MVP: 1.200 document / 6.000 QA · Mở rộng: 2.000 document / ~15.000 QA
Chiến lược mô hình Gác lại — xem Mục tiêu dự án #2
Venue mục tiêu ACL hoặc EMNLP (2 hội nghị CORE A* trong dòng *ACL; NAACL/EACL chỉ hạng A) qua ARR

Chi tiết đầy đủ từng phần nằm trong docs/. Bản kế hoạch trực quan (bảng so sánh, Gantt, checklist) xem tại artifact đã chia sẻ với nhóm.

Nguyên tắc làm việc

  • Chất lượng > số lượng thô. ChartQAPro (1.341 chart / 1.948 câu hỏi) vẫn đủ mạnh để công bố nhờ độ khó và thiết kế tốt — nếu phải đánh đổi, ưu tiên độ khó và độ sạch của nhãn.
  • Không huấn luyện mô hình từ đầu. Fine-tune backbone có sẵn (ChartGemma, TinyChart, ChartMoE đều làm vậy).
  • Ưu tiên nguồn dữ liệu mở/chính phủ. Xem docs/02.

Đóng góp

Dự án đang ở giai đoạn nội bộ, chưa mở đóng góp bên ngoài.

Giấy phép

Chưa xác định — chốt cùng rà soát pháp lý nguồn dữ liệu ở Tuần 1 (xem docs/02).

About

No description, website, or topics provided.

Resources

Stars

2 stars

Watchers

1 watching

Forks

Releases

Packages

Contributors

Languages