- URL: https://grapeot.me/fanren.html
- Added At: 2025-06-08 06:05:18
本文提出通过"笨数据+笨方法+笨模型"的系统化方法,将超长篇小说转化为精准知识图谱。通过跨章节语义关联逐步优化实体关系,并借助开源大模型本地部署实现低成本高效构建,可扩展应用于企业知识管理及认知增强系统,体现AI从依赖提示词的魔法转向可工程化的系统化实践。
本文探索将《凡人修仙传》等超长篇小说转化为结构化知识图谱的解决方案,提出"笨数据+笨方法+笨模型=精准知识"的方法论:
- 笨数据基础层
- 构建线性扫描模块:全本逐章提取候选实体(角色/物品名),允许重复与错误
- 搭建语义检索模块:通过文本嵌入构建向量空间,实现跨章节/异名实体的关联检索
- 打破数据割裂性:利用全局语义关联验证初始实体池,形成迭代基础
- 知识飞轮迭代系统
- 四步循环机制: ① 触发任务(穷举/用户请求) ② 调用检索模块获取上下文 ③ 通过LLM判断实体关系(如同角色异名) ④ 更新知识库完成信息聚合
- 自增强特性:每次迭代提升数据准确性,使后续检索更精准
- 模型部署策略
- 选择开源Qwen3-32B替代闭源大模型: ✔️ 本地部署摆脱API成本焦虑(2090显卡+INT4量化) ✔️ 指令遵循能力提升(自动输出JSON格式) ✔️ 推理效率突破(vLLM框架支持高并发)
- 范式转变:边际成本趋零使大规模批量处理成为可能
- 应用扩展价值
- 企业知识管理应用:
- 整合分散的Confluence/Slack数据
- 构建组织级知识图谱
- 提升跨团队协作效率
- 认知增强系统:
- 自动化记忆与探索
- 消除信息遗忘和连接错误
- 构建可交互式知识库
总结:通过接纳初始数据缺陷、设计迭代优化机制、使用可控计算资源,实现非结构化信息向精准知识的转化,标志着AI应用从"提示词魔法"转向系统工程化新阶段。