一个面向黑格尔哲学学习的中文知识库、评测集、RAG 对话 Agent 与可复用方法模板。
Hegel-RAG-Lab 研究如何把难读、体系性强且容易被误解的黑格尔文本,整理成可检索、可解释、可评估、可持续改进的学习系统。核心方法是将概念入口、具体文本语境、原子主张、来源定位和二手解释分层表示。
项目不以模仿黑格尔口吻为主要目标,也不替代原典、课程或专业研究。我们更关心:模型能否给出有文本依据、概念准确、对学生有帮助的解释。
| 模块 | 作用 | 当前状态 |
|---|---|---|
| Hegel Knowledge Base | 概念卡、章节导读、术语关系与常见误解 | 建设中 |
| HegelBench-ZH | 中文黑格尔问答题、答案要点和评分标准 | 建设中 |
| Hegel Tutor Agent | 基于知识库检索的学习型对话 Demo | 原型阶段 |
| Philosopher-RAG Template | 可迁移到其他思想家的数据与评测方法 | 规划中 |
第一个数据闭环围绕“承认(Anerkennung)”展开:
- 建立概念入口和一个具体文本语境。
- 把关键断言拆成带来源的原子主张。
- 建立五道开发集问题。
- 对初稿诊断、修订并完成哲学内容复审。
- 上传 RAG 系统检查召回,并盲评 Agent 原始回答。
- 根据错误修改数据并复测。
当前内容是待审核的项目初稿,不能视为权威哲学解释。
data/knowledge/ 著作、概念、语境、来源、主张和解释立场
data/benchmark/ 不直接喂给 Agent 的评测数据
data/schemas/ 数据字段规范
eval/ 评分标准、审核表和结果
prompts/ Agent 行为提示词
scripts/ 数据检查工具
tests/ 自动化测试
- 区分原文、转述、编者概括、学术解释和教学解释。
- 将概念绑定到具体著作、章节和论证语境。
- 每条关键主张关联可检查的来源定位。
- 不编造引文、页码或参考文献。
- 不把有争议的解释写成唯一结论。
- 模型可以辅助生成初稿,但不能批准自己的内容。
- 搜索摘要只能发现文献,不能代替论文正文核验。
- 现代中文译本全文和扫描 PDF 不进入公开仓库。
python -m unittest discover -s tests -v
python scripts/validate_data.py提交数据前请阅读 CONTRIBUTING.md。发现概念错误、来源问题或教学解释不清时,欢迎提交 Issue。