Skip to content

Request for instruction finetuning datasets #16

Description

@Wilboludriver

作者您好,

祝贺你们的工作被Findings of ACL 2024接受!

这篇工作的数据集准备部分给了我很大启发,我在自己合成instruction ft datasets的时候发现有部分步骤不太完整:

  1. 在2.1 Graph Caption Generation 部分的 group (1) Wikipedia + Wikidata5M 中,我加载的是了wiki5m官网发布的corpus,该文件的数据数量比jupyter notebook上的记录要少1/5,导致在构造子图和三元组的部分跑不出来,而完整的wikipedia最新corpus数据量过大不便操作。请问能否开源你们使用的Wikipedia corpus呢?
  2. 在2.2 Graph Question Answering的FreeBase预加载中,我没有在freebase下载网页上找到你们使用的“rel2id.pickle","entity_name.pickle","ent2id.pickle"。 请问方便开源或者告知获取方法吗。
  3. 在 3.1 Knowledge Graph Generation的InstructIE部分,请问train.json 需要额外处理吗,我直接load后发现没有“input”这个key,导致text = example["input"]报错。
  4. 请问您方便开源用gpt合成的第四部分graph thought modelin的数据集吗?

非常感谢你们的贡献,祝学术工作顺利~

Wilbolu

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions