1.8.0 (2026-08-03)
- harness: avalia GPT-5.6 Sol, Qwen 3.7 Max, DeepSeek V4 Pro, Kimi K3 e Grok 4.5 no ENAMED 2025 (#48) (d1a65a3)
1.7.0 (2026-08-03)
1.6.0 (2026-06-10)
- avalia Claude Fable 5 no ENAMED 2025 (#42) (2c47b99)
- avalia Claude Opus 4.8 nas 4 edições (#39) (ba127ef)
- pin actions e tripwire publish-watch (postmortem TanStack) (#38) (08a8a09)
- roda publish-watch uma vez por dia em vez de a cada 15min (#40) (5098406)
1.5.0 (2026-05-12)
- results: publica Qwen 2.5 14B baseline + CPT-4gen via MLX local (#37) (ccbb02a)
- site: consumir Header e OpenFooter compartilhados do @precisa-saude/ui (#33) (6c10cbd)
1.4.0 (2026-04-22)
- ci: adotar workflows canônicos split + doctor + publish-tag (80a56ec)
- consumir @precisa-saude/agent-instructions + worktree-cli (acc582c)
- lint: settings.react.version para compat com ESLint 10 (fa3e618)
- site: favicon mostra marca Precisa, não letra "F" (f185246)
- site: quebrar componentes longos sob limite de 400 linhas (84d5a4f)
- site: ordenar props JSX (perfectionist/sort-jsx-props auto-fix) (560c653)
- fechar gaps de cobertura em dataset + harness + ingestion (e076091)
- alinhar hooks husky e turbo.json ao template compartilhado (a68db11)
- deps: sync dotfiles + pre-push hook + Radix→Base UI Select (#30) (9beb857)
1.3.0 (2026-04-21)
- scripts: sanity-check-raws e diff de IC95 (PRE-194) (#21) (63bdfd8)
- site: contrapesos de escopo no hero e redesenho do leaderboard (#27) (34013f4)
- site: metodologia explica variância entre execuções e deriva de fornecedor (#24) (8efa9b4)
- site: polish do heatmap, questões no mobile, cards de pacotes e tooltips (#19) (97e53eb)
- site: revisar metodologia com TOC, debate institucional e legenda de elegibilidade (#26) (cbbd314), closes #exames #protocolo #prompt #variancia #contaminacao #linha-de-base #fontes
- cortes de treino a partir de fontes oficiais dos fornecedores (#20) (329e27f)
- results: backfill raws ausentes em revalida-2024-1 (16 modelos) (#22) (2edf2e9)
- results: backfill raws ausentes em revalida-2025-1 (12 modelos) (#23) (a936c31)
- site: CTAs do hero alinhados e sem clipping em viewports estreitos (dbd636d)
- deps: adotar configs e UI compartilhados @precisa-saude (#29) (a4b1f2d)
1.2.1 (2026-04-20)
1.2.0 (2026-04-20)
- métricas PROPOR 2026 (Macro-F1, passesCutoff, Conceito Enade, consenso) (#17) (6131216)
- scripts: worktree.sh com alocação de porta do site (#16) (874dd3d)
- site: visualizações de specialty, contaminação e tendência (#15) (aff7f44)
1.1.1 (2026-04-20)
- ci: [skip ci] no commit empty injetado para forçar release (#13) (ff4b06f)
- ci: substitui force_release path por workflow publish-tag standalone (#14) (eaaaecf), closes #11 #13
1.1.0 (2026-04-20)
- manual release trigger via workflow_dispatch (e208418)
- adiciona READMEs para medbench-dataset e medbench-harness (#9) (2eb9f32)
- reescreve motivação e adiciona referências acadêmicas (#8) (a6622a2)
- ci: adiciona workflow_dispatch com force_release para release manual (#11) (c064ce4), closes 6/#7 #9
- convergência Revalida + ENAMED — generaliza schema, ingesta ENAMED 2025 (#3) (3f205b6)
- dataset: adicionar edições Revalida 2024/1 e 2024/2 (c0b7db6)
- harness,results: validar safeguards com GPT-5 nano + fix temperature (2d7053b)
- harness,site: adicionar backend Maritaca (Sabiá 4) (24ed2ac)
- harness,site: backend OpenRouter como primário para open-weight (42dc8de)
- harness,site: backend Together AI para Qwen, Llama 4 e DeepSeek (f593a42)
- harness,site: layout por edição para artefatos de resultado (1848c8b)
- harness: medbench smoke + raw JSONL log para cada chamada (d45fa54)
- harness: providers OpenAI, Google e OpenAI-compat (Ollama) + CLI multi-backend (1fc1998)
- harness: retomar eval a partir do JSONL bruto (a0afd0d)
- ingestion,dataset: extração real de Revalida 2025/1 via Bedrock Haiku 4.5 (ab4cb3f)
- ingestion: pipeline de extração Revalida com @kreuzberg/node + Claude tool_use (ff68d5a)
- results,site: Llama 4 Scout em revalida-2024-1 + rota wildcard para modelIds com barra (83b2e62)
- results: adicionar avaliações de Llama 3.3, Llama 4 Maverick, Sabiá 3, DeepSeek V3-0324 (7b29e98)
- results: DeepSeek R1 em Revalida 2024/1 (85.9%) (764b861)
- results: Gemini 3.1 Pro em Revalida 2024/1 (96.5%, contaminada) (707c49b)
- results: Qwen 3 235B + DeepSeek V3.1/R1 em revalida-2024-1 e 2025-1 (322017f)
- results: Qwen 3.6 Plus, Qwen 3.5 122B, V3-0324, Mistral Large (2411+2512) (57c1bed)
- site,harness: redesign do site alinhado ao fhir-brasil + resultados 2024-1 (4cbdb4e)
- site: adicionar Mistral Large (2512 + 2411) ao leaderboard (22b6742)
- site: agrupa barras do ComparisonChart por Jenks natural breaks (bf00e49)
- site: cards de execução por modelo no grid de 12 col com link pro detalhe (694149f)
- site: filtro por família no ComparisonChart + barras de altura fixa (6f09d91)
- site: metadados para Opus 4.5/4.6, GPT-5.1/5.2, Gemini 2.5/3.1, Qwen 3.6 (5453cb6)
- site: metadata para versões anteriores imediatas dos flagships open-weight (17d5d52)
- site: trocar Qwen 3.6 local por Qwen 3.6 Plus via OpenRouter (9c86887)
- dataset: publishedAt real para 2024/1 e 2024/2 (3222b0e)
- harness: AbortController timeout por request + log de progresso (166d508)
- harness: Anthropic timeout 180s + retry em AbortError (6f0fb45)
- harness: parser de letra pega PRIMEIRA maiúscula após frase de compromisso (38cdef4)
- harness: parser resolve commit final + re-run DeepSeek V3.1 com score corrigido (1fd86f3)
- harness: parser robusto de letra + max_tokens suficiente para modelos com reasoning (e765c98)
- harness: retry com backoff exponencial em erros transientes + OpenAI max_completion_tokens + Opus 4 sem temperature (f2442cc)
- harness: retry reconhece undici 'terminated' + cause.message (f0dbd37)
- ingestion,harness: marcadores anulada unicode + budget suficiente para Gemini thoughts (d2f9ebd)
- ingestion: download via curl para lidar com cadeia ICP-Brasil + tipo metadata (06c4521)
- results: corrigir Mistral Large com parser final (ddf0145)
- site: backfill accuracyByEdition a partir do path para artefatos v0 (41c0e6e)
- site: contenimination panel sem contagem bruta de runs (312cf04)
- site: trocar por modelos serverless do Together (Llama 3.3, Qwen 3-235B) (2fdd171)
- site: 'Apenas limpas' como visão default do ranking (a95eee4)
- site: ajustes de tipografia, scrollbar, radar e página de modelo (9a54d14)
- site: ajustes finos no leaderboard, metodologia e chart de comparação (400bd05)
- site: precisão em vez de acurácia no ContaminationPanel (5b14dc4)
- site: tweaks no ranking, chart e reprodução + citation + reorder models (3c891ff)
- pipeline de release via GitHub App + publish npm + notify Slack (#4) (6b77b9f)
- review automatizado de PRs via Claude Opus 4.6 no Bedrock (86b4e56)
- build loop limpo, subpath export e rodapé Precisa (21b0555)
- config: husky hooks + commitlint scopes + index.html SEO (68c9b9a)
- scaffold inicial do medbench-brasil (6f0a48a)
- Bootstrap do repositório: toolchain pnpm + turbo, pacotes
dataseteeval-harness, site React + Vite + Tailwind + Recharts, workflow de CI e deploy no Cloudflare Pages, documentação de metodologia em pt-BR