Skip to content

Latest commit

 

History

History
23 lines (15 loc) · 1.46 KB

File metadata and controls

23 lines (15 loc) · 1.46 KB

Данные для LLM и генеративного ИИ

Датасеты

English

  • OpenAssistant Conversations — 161K сообщений, 35 языков, краудсорсинг для обучения ассистентов
  • Dolly (Databricks) — 15K instruction-response пар
  • UltraChat — 1.5M многоходовых диалогов для обучения чат-моделей
  • UltraFeedback — 256K пар с оценками для DPO/RLHF
  • MMLU — 57 предметов, стандартный бенчмарк знаний LLM

Русский

  • ru_turbo_alpaca (Илья Гусев) — русскоязычный instruction-датасет

Бенчмарки (репозитории)

English

  • HumanEval (OpenAI) — бенчмарк генерации кода
  • IFEval (Google) — оценка следования инструкциям
  • Chatbot Arena (LMSYS) — парные сравнения моделей, ELO-рейтинг