Skip to content

Latest commit

 

History

History
225 lines (144 loc) · 22 KB

File metadata and controls

225 lines (144 loc) · 22 KB

1.8.0 (2026-08-03)

Features

  • harness: avalia GPT-5.6 Sol, Qwen 3.7 Max, DeepSeek V4 Pro, Kimi K3 e Grok 4.5 no ENAMED 2025 (#48) (d1a65a3)

1.7.0 (2026-08-03)

Features

  • harness: avalia Gemini 3.6 Flash, Claude Opus 5 e Sonnet 5 no ENAMED 2025 (#47) (d190b73)

CI/CD

  • atualizar GitHub Actions para o runtime Node 24 (#44) (0105e1b)

1.6.0 (2026-06-10)

Features

  • avalia Claude Fable 5 no ENAMED 2025 (#42) (2c47b99)
  • avalia Claude Opus 4.8 nas 4 edições (#39) (ba127ef)

CI/CD

  • pin actions e tripwire publish-watch (postmortem TanStack) (#38) (08a8a09)
  • roda publish-watch uma vez por dia em vez de a cada 15min (#40) (5098406)

1.5.0 (2026-05-12)

Features

  • results: publica Qwen 2.5 14B baseline + CPT-4gen via MLX local (#37) (ccbb02a)
  • site: consumir Header e OpenFooter compartilhados do @precisa-saude/ui (#33) (6c10cbd)

Documentation

  • site: adiciona seção "Benchmarks relacionados" em Metodologia (#36) (fcd77b7)

CI/CD

  • bump pnpm/action-setup para v5 (Node.js 24) (#34) (6705f42)

Chores

  • deps: bump @precisa-saude/* para ^1.5.0 (#32) (8c27e93)

1.4.0 (2026-04-22)

Features

  • ci: adotar workflows canônicos split + doctor + publish-tag (80a56ec)
  • consumir @precisa-saude/agent-instructions + worktree-cli (acc582c)

Bug Fixes

  • lint: settings.react.version para compat com ESLint 10 (fa3e618)
  • site: favicon mostra marca Precisa, não letra "F" (f185246)

Refactoring

  • site: quebrar componentes longos sob limite de 400 linhas (84d5a4f)

Styles

  • site: ordenar props JSX (perfectionist/sort-jsx-props auto-fix) (560c653)

Tests

  • fechar gaps de cobertura em dataset + harness + ingestion (e076091)

Chores

  • alinhar hooks husky e turbo.json ao template compartilhado (a68db11)
  • deps: sync dotfiles + pre-push hook + Radix→Base UI Select (#30) (9beb857)

1.3.0 (2026-04-21)

Features

Bug Fixes

  • cortes de treino a partir de fontes oficiais dos fornecedores (#20) (329e27f)
  • results: backfill raws ausentes em revalida-2024-1 (16 modelos) (#22) (2edf2e9)
  • results: backfill raws ausentes em revalida-2025-1 (12 modelos) (#23) (a936c31)
  • site: CTAs do hero alinhados e sem clipping em viewports estreitos (dbd636d)

Documentation

  • claude: polling automático de PRs após push (#28) (abdbed8)

CI/CD

Chores

1.2.1 (2026-04-20)

Bug Fixes

  • consumo dos pacotes npm (CJS do dataset, polish do CLI) (#18) (ab28a88)

1.2.0 (2026-04-20)

Features

  • métricas PROPOR 2026 (Macro-F1, passesCutoff, Conceito Enade, consenso) (#17) (6131216)
  • scripts: worktree.sh com alocação de porta do site (#16) (874dd3d)
  • site: visualizações de specialty, contaminação e tendência (#15) (aff7f44)

1.1.1 (2026-04-20)

Refactoring

  • dedupe providers, split CLI e cleanup geral (#12) (5997181)

CI/CD

  • ci: [skip ci] no commit empty injetado para forçar release (#13) (ff4b06f)
  • ci: substitui force_release path por workflow publish-tag standalone (#14) (eaaaecf), closes #11 #13

1.1.0 (2026-04-20)

Features

  • results: revalida-2024-2 sweep (20 de 21 modelos) (#10) (d315df7)

Bug Fixes

  • manual release trigger via workflow_dispatch (e208418)

Documentation

  • adiciona READMEs para medbench-dataset e medbench-harness (#9) (2eb9f32)
  • reescreve motivação e adiciona referências acadêmicas (#8) (a6622a2)

CI/CD

  • ci: adiciona workflow_dispatch com force_release para release manual (#11) (c064ce4), closes 6/#7 #9

Chores

  • atualiza domínio de medbench-brasil.dev.br para .ia.br (#5) (610af9e)

1.0.0 (2026-04-19)

Features

  • convergência Revalida + ENAMED — generaliza schema, ingesta ENAMED 2025 (#3) (3f205b6)
  • dataset: adicionar edições Revalida 2024/1 e 2024/2 (c0b7db6)
  • harness,results: validar safeguards com GPT-5 nano + fix temperature (2d7053b)
  • harness,site: adicionar backend Maritaca (Sabiá 4) (24ed2ac)
  • harness,site: backend OpenRouter como primário para open-weight (42dc8de)
  • harness,site: backend Together AI para Qwen, Llama 4 e DeepSeek (f593a42)
  • harness,site: layout por edição para artefatos de resultado (1848c8b)
  • harness: medbench smoke + raw JSONL log para cada chamada (d45fa54)
  • harness: providers OpenAI, Google e OpenAI-compat (Ollama) + CLI multi-backend (1fc1998)
  • harness: retomar eval a partir do JSONL bruto (a0afd0d)
  • ingestion,dataset: extração real de Revalida 2025/1 via Bedrock Haiku 4.5 (ab4cb3f)
  • ingestion: pipeline de extração Revalida com @kreuzberg/node + Claude tool_use (ff68d5a)
  • results,site: Llama 4 Scout em revalida-2024-1 + rota wildcard para modelIds com barra (83b2e62)
  • results: adicionar avaliações de Llama 3.3, Llama 4 Maverick, Sabiá 3, DeepSeek V3-0324 (7b29e98)
  • results: DeepSeek R1 em Revalida 2024/1 (85.9%) (764b861)
  • results: Gemini 3.1 Pro em Revalida 2024/1 (96.5%, contaminada) (707c49b)
  • results: Qwen 3 235B + DeepSeek V3.1/R1 em revalida-2024-1 e 2025-1 (322017f)
  • results: Qwen 3.6 Plus, Qwen 3.5 122B, V3-0324, Mistral Large (2411+2512) (57c1bed)
  • site,harness: redesign do site alinhado ao fhir-brasil + resultados 2024-1 (4cbdb4e)
  • site: adicionar Mistral Large (2512 + 2411) ao leaderboard (22b6742)
  • site: agrupa barras do ComparisonChart por Jenks natural breaks (bf00e49)
  • site: cards de execução por modelo no grid de 12 col com link pro detalhe (694149f)
  • site: filtro por família no ComparisonChart + barras de altura fixa (6f09d91)
  • site: metadados para Opus 4.5/4.6, GPT-5.1/5.2, Gemini 2.5/3.1, Qwen 3.6 (5453cb6)
  • site: metadata para versões anteriores imediatas dos flagships open-weight (17d5d52)
  • site: trocar Qwen 3.6 local por Qwen 3.6 Plus via OpenRouter (9c86887)

Bug Fixes

  • dataset: publishedAt real para 2024/1 e 2024/2 (3222b0e)
  • harness: AbortController timeout por request + log de progresso (166d508)
  • harness: Anthropic timeout 180s + retry em AbortError (6f0fb45)
  • harness: parser de letra pega PRIMEIRA maiúscula após frase de compromisso (38cdef4)
  • harness: parser resolve commit final + re-run DeepSeek V3.1 com score corrigido (1fd86f3)
  • harness: parser robusto de letra + max_tokens suficiente para modelos com reasoning (e765c98)
  • harness: retry com backoff exponencial em erros transientes + OpenAI max_completion_tokens + Opus 4 sem temperature (f2442cc)
  • harness: retry reconhece undici 'terminated' + cause.message (f0dbd37)
  • ingestion,harness: marcadores anulada unicode + budget suficiente para Gemini thoughts (d2f9ebd)
  • ingestion: download via curl para lidar com cadeia ICP-Brasil + tipo metadata (06c4521)
  • results: corrigir Mistral Large com parser final (ddf0145)
  • site: backfill accuracyByEdition a partir do path para artefatos v0 (41c0e6e)
  • site: contenimination panel sem contagem bruta de runs (312cf04)
  • site: trocar por modelos serverless do Together (Llama 3.3, Qwen 3-235B) (2fdd171)

Styles

  • site: 'Apenas limpas' como visão default do ranking (a95eee4)
  • site: ajustes de tipografia, scrollbar, radar e página de modelo (9a54d14)
  • site: ajustes finos no leaderboard, metodologia e chart de comparação (400bd05)
  • site: precisão em vez de acurácia no ContaminationPanel (5b14dc4)
  • site: tweaks no ranking, chart e reprodução + citation + reorder models (3c891ff)

CI/CD

  • pipeline de release via GitHub App + publish npm + notify Slack (#4) (6b77b9f)
  • review automatizado de PRs via Claude Opus 4.6 no Bedrock (86b4e56)

Chores

  • build loop limpo, subpath export e rodapé Precisa (21b0555)
  • config: husky hooks + commitlint scopes + index.html SEO (68c9b9a)
  • scaffold inicial do medbench-brasil (6f0a48a)

Changelog

Não lançado

  • Bootstrap do repositório: toolchain pnpm + turbo, pacotes dataset e eval-harness, site React + Vite + Tailwind + Recharts, workflow de CI e deploy no Cloudflare Pages, documentação de metodologia em pt-BR