第三章《大语言模型基础》习题答案|逐章学习笔记 #780
Unanswered
jarvanstack
asked this question in
💬 Exercises & Q&A
Replies: 0 comments
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
原章链接:第三章 大语言模型基础
1. 从 N-gram 到 Transformer
迷你语料中,
datawhale agent出现 2 次,后续分别是learns和works。采用最大似然估计且不加平滑:P(works | agent) = count(agent, works) / count(agent) = 1/2若只计算条件概率,答案是
0.5;若句子概率还包含句首,则P(agent | <s>)在给定语料中未出现,必须先明确是否补<s>以及是否平滑。题目通常意在前者。马尔可夫假设认为,下一个词只依赖前面有限的
n-1个词,而非完整历史。N-gram 的局限是上下文窗口固定、长距离依赖丢失;数据稀疏和未登录组合导致零概率;词表与存储随n急剧增大;相似词不能共享统计;无法形成抽象语义表示。RNN/LSTM 用隐藏状态压缩历史,参数跨位置共享,可处理变长序列;LSTM 的门机制缓解梯度消失,更适合顺序和局部时间模式,但训练仍串行,超长依赖和并行效率有限。Transformer 通过自注意力让任意位置直接交互,训练可并行,长距离路径更短,且更易扩展;代价是标准注意力在序列长度上的计算/显存开销较高。
2. Transformer
自注意力的核心是:每个 token 生成 Query、Key、Value,用 Query 与所有 Key 的相似度得到权重,再对 Value 加权汇总。于是同一个词可根据当前上下文动态选择相关信息,多头机制则学习不同关系。
RNN 的第
t个隐藏状态依赖t-1,因此时间维必须串行。Transformer 在训练时一次计算所有位置的 Q/K/V 与注意力矩阵;因架构本身没有顺序递归,需要加入位置编码,让模型区分词序和相对距离。生成阶段的 Decoder-Only 模型仍需自回归逐 token 输出,但训练可对所有目标位置并行计算损失。Encoder-Decoder 有双向编码器和带交叉注意力的解码器,适合输入到输出的条件生成,如翻译。Decoder-Only 只有带因果遮罩的解码堆栈,把指令、上下文和答案统一成“续写”接口。它架构简单、训练目标统一、规模扩展方便,并能通过提示覆盖大量任务,因此成为通用 LLM 的主流;这不表示 Encoder-Decoder 在所有任务上都更差。
3. 为什么使用 BPE 子词
字符词表小且没有未登录词,但序列过长,一个 token 的语义信息少,模型要花更多计算重新组合词义。单词 token 语义完整,但词表巨大,形态变化和新词导致大量 OOV,中文等语言的“单词边界”也不稳定。
BPE 从较小单位出发,反复合并语料中高频相邻对,让高频词/词根用较少 token 表示,同时保留拆分罕见词的能力。它在词表大小、序列长度、开放词汇和跨语言适用性之间取得折中。代价是切分不总符合语言学边界,且不同文本可能产生不直观的 token 成本。
4. 本地模型实验与选型
可复现实验方案
建议固定同一模型、同一提示和随机种子,每组生成至少 20 次,再比较正确率、格式遵循率、多样性和延迟。以 Qwen3-0.6B 为例:
通常低温更稳定、适合分类和抽取;高温增加表达多样性,也增加跑题和格式错误。
top_p降低会收窄候选集合。小模型对复杂 CoT 可能出现“更长但不更正确”,所以不能以输出长度判断推理质量。对工单分类可以比较:Zero-shot 直接给标签定义;Few-shot 增加边界案例;CoT 要求先提取证据再给标签。预期 Few-shot 最能改善标签边界,结构化“证据 + 标签”比自由思维链更易评估。应把标签藏在测试集,统计宏平均 F1,而非只展示几个成功例子。
开源与闭源
企业客服可采用分层/混合选型:常规意图识别、敏感数据处理使用企业内受控模型;复杂对话调用高能力 API 前先脱敏;高风险动作交给规则和人工。因素包括中文和行业效果、并发延迟、上下文长度、工具调用可靠性、隐私法规、SLA、总拥有成本、版本稳定性和退出供应商的能力。
5. 缓解幻觉
选择 RAG:先把可信文档切块并建立索引;问题到来时检索相关片段,将片段与问题共同交给模型;答案要求引用片段,并在证据不足时明确拒答。它适合企业知识、法规、产品手册等知识可外部化且经常更新的场景。RAG 不能自动保证正确:检索错、切块断裂或模型无视证据仍会幻觉,因此要评估检索召回、引用忠实度和最终答案。
其他方向包括:
相比只加一句“请勿幻觉”,这些方法把正确性约束放进数据、检索、解码或验证闭环,更可测量。
6. 论文阅读智能体
基座模型应按长上下文理解、学术语种、表格/公式/图像能力、结构化输出、引用遵循、成本与隐私选型,而不是固定追逐某个排行榜第一。敏感未发表论文可优先用可私有部署模型;高难推理可路由到更强模型。
提示词应明确角色、任务、证据边界和输出 schema。例如要求分别输出研究问题、方法、数据、主要结果、局限,并为每条结论给出页码/段落 ID;禁止把模型推断写成作者结论;证据不足返回“原文未说明”。比较多篇论文时先逐篇抽取统一字段,再做跨文档矩阵,避免一次性混读。
超长论文可采用版面解析 → 按章节和语义切块 → 建立层级索引 → 问题驱动检索 → 局部回答 → 全局综合。摘要任务可用 map-reduce,但需保留章节关系;公式、表格和图片要使用相应解析器并和正文锚点绑定。
可靠性设计包括:页码级引用和点击回原文;原子事实核验;数值从表格工具抽取;引用存在性和 DOI 校验;区分直接陈述、综合结论和推测;用对立证据检索减少确认偏差;对关键回答显示证据覆盖率;保留解析与模型版本。最终定位应是“提高阅读效率的副驾驶”,不是替代研究者判断。
All reactions