Skip to content

关于 corpus.json 构成方式与回复风格的几个问题 #24

Description

@YiMin0130

您好,感谢您开源 BearLLM。我在使用项目中的 corpus.json 健康管理语料库时,有几个问题想请教:

1.corpus.json 是如何构建的?
它是否是由 9 个公开数据集合并而成,还是我的理解有误?

2.为什么这个文件目前只有大约 600 条样本?
这个数量是否是经过筛选、清洗、去重或其他处理后的结果?

3.我注意到其中的 response 风格差异较大。
有些回复非常简短,比如只有 yes 或 no,但有些回复则像论文 Figure 8 中展示的那样,内容更完整、分析也更详细。
这种差异是来自原始数据集本身,还是在构建数据时做了额外处理?

4.如果我需要更多像 Figure 8 那样较完整、较详细的数据,应该如何获取?
是否需要我自己加载你们发布的模型进行推理,还是已经提供了对应的数据、生成流程,或者可复现这类输出的相关设置?

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Fields

    No fields configured for issues without a type.

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions