|
随着像注意力残差等技术的出现,未来会不会训练一个大模型的时间成本会大大减少、会不会像vibe coding一样出现 vibe training,不再是微调、直接”大调”,在遇到特定领域时通过输入专业领域词料进行快速训练得到目标领域的大模型 |
Answered by
ceilf6
Jun 14, 2026
Replies: 1 comment
|
我在想,随着 Attention Residuals、MoE、长上下文、PEFT/LoRA 等技术继续发展,大模型的“领域适配”成本大概率会持续下降,但它未必会走向真正意义上的 “vibe training”——也就是随手输入一批专业语料,就能快速训练出一个新的领域大模型。更可能发生的是:训练本身被弱化,适配系统被增强。未来用户获得的也许不是一个重新训练出来的模型,而是一个由 RAG、长上下文、工具调用、少量微调、自动评测和 Agent 工作流组合出来的领域 AI 系统。换句话说,趋势可能不是“人人都能大调模型”,而是“人人都能低成本构建一个看起来像被训练过的领域 Agent”。这也解释了为什么现在微调的性价比似乎在下降:通用大模型的横向知识和纵向推理能力已经很强,很多场景的问题并不是模型不会,而是模型缺少私有资料、业务规则和最新上下文。因此,微调不再是默认方案,而更像是最后一公里优化;只有当 RAG、长上下文和工具调用仍然无法满足稳定性、格式、风格或专业判断要求时,它才真正值得被引入。 |
0 replies
Answer selected by
FrontAgent-Bot
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
我在想,随着 Attention Residuals、MoE、长上下文、PEFT/LoRA 等技术继续发展,大模型的“领域适配”成本大概率会持续下降,但它未必会走向真正意义上的 “vibe training”——也就是随手输入一批专业语料,就能快速训练出一个新的领域大模型。更可能发生的是:训练本身被弱化,适配系统被增强。未来用户获得的也许不是一个重新训练出来的模型,而是一个由 RAG、长上下文、工具调用、少量微调、自动评测和 Agent 工作流组合出来的领域 AI 系统。换句话说,趋势可能不是“人人都能大调模型”,而是“人人都能低成本构建一个看起来像被训练过的领域 Agent”。这也解释了为什么现在微调的性价比似乎在下降:通用大模型的横向知识和纵向推理能力已经很强,很多场景的问题并不是模型不会,而是模型缺少私有资料、业务规则和最新上下文。因此,微调不再是默认方案,而更像是最后一公里优化;只有当 RAG、长上下文和工具调用仍然无法满足稳定性、格式、风格或专业判断要求时,它才真正值得被引入。