Skip to content

Latest commit

 

History

History
60 lines (43 loc) · 3.8 KB

File metadata and controls

60 lines (43 loc) · 3.8 KB

KOL Sourcing — Agent 操作手册

你(Claude Code / Codex)是本管线的判断引擎。脚本负责搬数据,逐人核对与定性由你完成

开工前先读:PIPELINE.md(全流程 6 阶段 + 工具/成本)、SCHEMA.md(表维度 + 分类体系)、LESSONS.md(教训)。任务是从零 sourcing 就按 PIPELINE.md Stage 0-5 走(Stage 0 的画像定义必须先和需求方对齐,不要自己猜);任务是验证已有池就按下面的流程走。

完整流程

  1. python3 scripts/fetch_sheet.py 读回表格现状(每次都重新读,不用旧文件)
  2. python3 scripts/extract_handles.py 提取账号 + 行号
  3. bash scripts/pull_timelines.sh 拉时间线(断点续传;单个账号失败不阻塞,最后统计 EMPTY 名单单独报告)
  4. python3 scripts/digest.py > data/digests.txt 生成对照摘要
  5. 逐人判断(见下方判定标准),把结论写成 data/edits.json
  6. 把「删除候选清单 + 主要修正」先汇报给用户确认,确认后python3 scripts/apply_edits.py data/edits.json --write
  7. 写回后报告:改了几行、哪些行、各改了什么

判定标准

对每个账号,比对「表内标签」vs「实际 bio + 最近原创推文」,归入三档:

  • ✅ 属实:内容方向与标签一致 → 不动
  • 🔧 修正:账号真实但标签/描述错(分类错、身份描述夸大、AI相关度不符)→ 改对应单元格 + 备注前置 复核M-D:<结论>
  • 🔴 删除候选:硬伤 → 只改描述为实核内容 + 备注前置 🔴删除候选:<原因>不删行

硬伤(一票否决)清单

  • 农场/搬运号:空 bio + 新建号 + 高粉、内容为情感引流/资源搬运/译制 listicle 模板文;乱码型 handle(如 fhwofjow51260)是强信号
  • 盗版资源分发(破解软件/盗版教材/影视资源)
  • 灰产/赌场/博彩:接码平台、在线赌场推广、金狗喊单+钱包跟单导流、瓜分XX U 抽奖、邀请码返佣
  • 交易所挂名:名字/bio 挂"上XX交易所"类推广后缀
  • 内容与标签完全无关(如标"LegalTech 分析"实为情感杂谈)
  • 高粉低赞:10万+ 粉但原创推文中位赞 ≤ 个位数 = 买粉信号
  • 近乎停更:30 天内原创 ≤ 1 条且与标签无关

常见陷阱

  • 写得越具体越可疑:批量生成的画像列("对标XX""XX产品横评")往往是按账号名脑补的,必须以时间线为准
  • 正则/关键词命中 ≠ 内容主线:命中一条科研推文不代表是科研博主,看最近 8-15 条原创的主体分布
  • 劝退式引用会误伤("别想一夜暴富"命中暴富词),命中必须回读原文定性
  • 内容优先于头衔:按账号实际发什么归类,不按 bio 自称

分类体系(10 类 · 3 方向)

  • 科研学术:AI研究员类(研究对象是 AI/模型本身)|AI4Science类(研究对象是科学问题)|生物医药类物理数学类专业Legal类
  • AI 技术:AIDevs类(agent/编程/工具搭建)|AI资讯KOL类(泛 AI 新闻/科普/点评)|软件工程KOL类
  • 投资金融:投资金融量化类(含 Biotech 投资视角)|Web3类

改表纪律(不可违反)

  • 写回前重新读表;只做 edits.json 里的定点单元格更新
  • 备注列只前置追加(apply_edits.py 已内置),原文用 保留在后
  • 🔴 行只标注,删除永远由表格 owner 手动执行
  • 不确定的判断标 待验 而不是硬下结论

产出格式(汇报给用户)

  1. 一句话总结:核了 N 人,✅ x / 🔧 y / 🔴 z
  2. 🔴 删除候选表格(账号|原标签|实际是什么)
  3. 需要用户拍板的争议项(如 ★强推 账号被降级)
  4. 写回明细