- OpenAssistant Conversations — 161K сообщений, 35 языков, краудсорсинг для обучения ассистентов
- Dolly (Databricks) — 15K instruction-response пар
- UltraChat — 1.5M многоходовых диалогов для обучения чат-моделей
- UltraFeedback — 256K пар с оценками для DPO/RLHF
- MMLU — 57 предметов, стандартный бенчмарк знаний LLM
- ru_turbo_alpaca (Илья Гусев) — русскоязычный instruction-датасет
- HumanEval (OpenAI) — бенчмарк генерации кода
- IFEval (Google) — оценка следования инструкциям
- Chatbot Arena (LMSYS) — парные сравнения моделей, ELO-рейтинг