基于大模型对数据资产元数据做四级分类(level_1..4)+ 敏感级别(L1–L4)标注,面向后训练(RFT / RL)的智能体项目。
数据来自 ModelScope:
export MODELSCOPE_TOKEN=xxx
git clone <ModelScope 数据集地址> data/ # 各领域 all/train/val/test.json + split_report.json# 预处理 + 按表分组切分(0.8/0.1/0.1)
python -m script.preprocessing.cli prepare --dataset finance
# 指南语料 → 检索语料
python -m script.corpus.cli build --dataset finance --overwrite详细 SOP 见 docs/新数据集运行说明.md。
data/knowledge/standards_map/:12 份多领域分类分级标准词典(车联网 YDT 3751 / 白皮书、关基、教育、金融、自贸区京沪、个人信息一般/敏感)