Skip to content

Latest commit

 

History

History
45 lines (34 loc) · 2.17 KB

File metadata and controls

45 lines (34 loc) · 2.17 KB

用三个笨办法将千万字的《凡人修仙传》炼成一个知识图谱

TL;DR

本文提出通过"笨数据+笨方法+笨模型"的系统化方法,将超长篇小说转化为精准知识图谱。通过跨章节语义关联逐步优化实体关系,并借助开源大模型本地部署实现低成本高效构建,可扩展应用于企业知识管理及认知增强系统,体现AI从依赖提示词的魔法转向可工程化的系统化实践。

Summary

本文探索将《凡人修仙传》等超长篇小说转化为结构化知识图谱的解决方案,提出"笨数据+笨方法+笨模型=精准知识"的方法论:

  1. 笨数据基础层
  • 构建线性扫描模块:全本逐章提取候选实体(角色/物品名),允许重复与错误
  • 搭建语义检索模块:通过文本嵌入构建向量空间,实现跨章节/异名实体的关联检索
  • 打破数据割裂性:利用全局语义关联验证初始实体池,形成迭代基础
  1. 知识飞轮迭代系统
  • 四步循环机制: ① 触发任务(穷举/用户请求) ② 调用检索模块获取上下文 ③ 通过LLM判断实体关系(如同角色异名) ④ 更新知识库完成信息聚合
  • 自增强特性:每次迭代提升数据准确性,使后续检索更精准
  1. 模型部署策略
  • 选择开源Qwen3-32B替代闭源大模型: ✔️ 本地部署摆脱API成本焦虑(2090显卡+INT4量化) ✔️ 指令遵循能力提升(自动输出JSON格式) ✔️ 推理效率突破(vLLM框架支持高并发)
  • 范式转变:边际成本趋零使大规模批量处理成为可能
  1. 应用扩展价值
  • 企业知识管理应用:
    • 整合分散的Confluence/Slack数据
    • 构建组织级知识图谱
    • 提升跨团队协作效率
  • 认知增强系统:
    • 自动化记忆与探索
    • 消除信息遗忘和连接错误
    • 构建可交互式知识库

总结:通过接纳初始数据缺陷、设计迭代优化机制、使用可控计算资源,实现非结构化信息向精准知识的转化,标志着AI应用从"提示词魔法"转向系统工程化新阶段。