您好,感谢您开源 BearLLM。我在使用项目中的 corpus.json 健康管理语料库时,有几个问题想请教:
1.corpus.json 是如何构建的?
它是否是由 9 个公开数据集合并而成,还是我的理解有误?
2.为什么这个文件目前只有大约 600 条样本?
这个数量是否是经过筛选、清洗、去重或其他处理后的结果?
3.我注意到其中的 response 风格差异较大。
有些回复非常简短,比如只有 yes 或 no,但有些回复则像论文 Figure 8 中展示的那样,内容更完整、分析也更详细。
这种差异是来自原始数据集本身,还是在构建数据时做了额外处理?
4.如果我需要更多像 Figure 8 那样较完整、较详细的数据,应该如何获取?
是否需要我自己加载你们发布的模型进行推理,还是已经提供了对应的数据、生成流程,或者可复现这类输出的相关设置?
您好,感谢您开源 BearLLM。我在使用项目中的 corpus.json 健康管理语料库时,有几个问题想请教:
1.corpus.json 是如何构建的?
它是否是由 9 个公开数据集合并而成,还是我的理解有误?
2.为什么这个文件目前只有大约 600 条样本?
这个数量是否是经过筛选、清洗、去重或其他处理后的结果?
3.我注意到其中的 response 风格差异较大。
有些回复非常简短,比如只有 yes 或 no,但有些回复则像论文 Figure 8 中展示的那样,内容更完整、分析也更详细。
这种差异是来自原始数据集本身,还是在构建数据时做了额外处理?
4.如果我需要更多像 Figure 8 那样较完整、较详细的数据,应该如何获取?
是否需要我自己加载你们发布的模型进行推理,还是已经提供了对应的数据、生成流程,或者可复现这类输出的相关设置?