Skip to content

Commit 174ae5a

Browse files
committed
Add new summaries
1 parent 54ac7ca commit 174ae5a

5 files changed

Lines changed: 55 additions & 5 deletions
Lines changed: 31 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -0,0 +1,31 @@
1+
# smevals - a small eval suite for evaluating models, prompts, and harnesses | Prime Radiant
2+
- URL: https://primeradiant.com/blog/2026/smevals.html
3+
- Added At: 2026-08-01 05:12:52
4+
- Tags: #read #agent #llm
5+
6+
## TL;DR
7+
smevals 是评估小模型的 CLI 工具,可自定义任务和评分,对比多模型,支持编码代理辅助搭建评估,并提供可视化报告,帮助从廉价模型中找到最佳方案。
8+
9+
## Summary
10+
smevals 是一个基于 Python 的 CLI 工具,专为评估小型语言模型而设计。它的目标不是追逐最前沿、昂贵的模型,而是在大量廉价模型(包括本地运行的开源模型)中找到最适合特定任务的方案。随着前沿模型价格持续上涨,这种评估体系变得尤为重要。
11+
12+
smevals 的核心概念十分明确:
13+
- **eval**:一组用于回答某个模型能力问题的挑战集合,例如“模型生成 SVG 的能力如何?”
14+
- **task**:eval 中的单一具体挑战,比如“生成一幅鹈鹕骑自行车的 SVG”。
15+
- **config**:运行评估时所用的配置,可指定模型、系统提示词、模型参数甚至代理外壳,同一个 eval 可以同时应对多个 config。
16+
- **run**:用某个 config 执行某个 task 的完整记录,产生的数据由 runner 脚本负责收集。
17+
- **grader**:对 run 的结果进行评分的组件,产生 grade。每个 grader 包含一系列 check,既可以是简单检查(如输出中是否包含特定字符串、是否为合法 XML),也可以是通过自定义脚本(称为 checker)实现的复杂评判,甚至可以利用其他模型来辅助判断。
18+
19+
使用 smevals 的流程大致分四步:
20+
1. 为 eval 设计和实现 task。
21+
2. 确定评分方式,设计 grader 和 checker。
22+
3. 针对一个或多个模型配置运行 task,生成 run 记录。
23+
4. 运行 grader 对结果进行打分,得出每个 run 的成绩。
24+
25+
运行结果既能在终端直接查看,也能通过内置的 Web 应用可视化浏览(`smevals serve`),或者构建为纯静态站点(`smevals build`)以便部署到静态托管服务。
26+
27+
文章特别强调了 smevals 能让编码代理(如 Claude Code、OpenAI Codex 等)直接参与 eval 的构建。只需让代理运行 `uvx smevals docs` 阅读文档,然后给出类似“构建一个测试模型写俳句能力的 eval,包含两个任务:写一首关于鹈鹕的俳句,以及一首关于两情相悦的水獭的俳句”的指令,代理就能在当前目录生成完整的 eval 目录结构(包含 eval.yaml、tasks 文件、configs、graders、checkers 和执行脚本等)。开发者随后可以用 `uvx smevals run . -g` 一键运行并评分,还能通过 `-m` 参数指定多个模型进行对比。
28+
29+
grader 的灵活性很强,初始可能只是一个简单的检查脚本(如判断输出是否恰好包含三个非空行),但可以不断改进。例如在俳句案例中,作者让 Codex 增加了一个使用 gpt-5.5 的 checker,通过 LLM 评判俳句的音节是否符合 5-7-5 规律、主题是否相符、诗意如何,并设定 pass_threshold 为 0.8。由于 smevals 将运行和评分解耦,更新 grader 后只需执行 `uvx smevals grade . --regrade` 就能对历史 run 重新打分,无需重复运行模型。
30+
31+
最终,无论是 Web 应用还是静态报告,都能清晰展示不同模型在各项任务上的得分、通过率、最近运行记录等,帮助团队直观地比较各类小型模型在特定场景下的真实表现,从而为生产环境选出性价比最优的选择。

202608/monthly-index.md

Lines changed: 4 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -1,5 +1,9 @@
11
# 2026-08 Monthly Index
22

3+
- (2026-08-01) [smevals - a small eval suite for evaluating models, prompts, and harnesses | Prime Radiant](2026-08-01-smevals---a-small-eval-suite-for-evaluating-models%2C-prompts%2C-and-harnesses-prime-radiant.md)
4+
- smevals 是评估小模型的 CLI 工具,可自定义任务和评分,对比多模型,支持编码代理辅助搭建评估,并提供可视化报告,帮助从廉价模型中找到最佳方案。
5+
- Tags: #read #agent #llm
6+
37
- (2026-08-01) [Write-Only Code | Heavybit](2026-08-01-write-only-code-heavybit.md)
48
- 随着大语言模型生成代码能力的提升,软件行业正进入“只写代码”时代:AI直接生成并部署代码,人类审查不再可行。工程师角色将从代码编写者转向系统设计师,专注接口、约束与风险管理,并建立新的信任机制以应对无人阅读代码的现实。
59
- Tags: #read #agent

README.md

Lines changed: 5 additions & 5 deletions
Original file line numberDiff line numberDiff line change
@@ -3,6 +3,10 @@
33

44
## Latest 10 Summaries
55

6+
- (2026-08-01) [smevals - a small eval suite for evaluating models, prompts, and harnesses | Prime Radiant](202608/2026-08-01-smevals---a-small-eval-suite-for-evaluating-models%2C-prompts%2C-and-harnesses-prime-radiant.md)
7+
- smevals 是评估小模型的 CLI 工具,可自定义任务和评分,对比多模型,支持编码代理辅助搭建评估,并提供可视化报告,帮助从廉价模型中找到最佳方案。
8+
- Tags: #read #agent #llm
9+
610
- (2026-08-01) [Write-Only Code | Heavybit](202608/2026-08-01-write-only-code-heavybit.md)
711
- 随着大语言模型生成代码能力的提升,软件行业正进入“只写代码”时代:AI直接生成并部署代码,人类审查不再可行。工程师角色将从代码编写者转向系统设计师,专注接口、约束与风险管理,并建立新的信任机制以应对无人阅读代码的现实。
812
- Tags: #read #agent
@@ -39,13 +43,9 @@
3943
- Linus的卓越在于早期停止编码,专注设计领导与一致性把控。AI编程时代,专家应扮演类似角色,主导AI代理并注入设计判断,而非亲自写代码。工具降低门槛,但设计能力仍是核心竞争力。
4044
- Tags: #read #agent
4145

42-
- (2026-07-22) [Not just development, distribution of software may change as well - <antirez>](202607/2026-07-22-not-just-development%2C-distribution-of-software-may-change-as-well---antirez.md)
43-
- AI编程让用户能自行修改源码,传统分支模式过时。代码库正成为可演化的模板,实验性分支与范例代码价值凸显,文档也需对代理友好。开发者应适应这种流动、可塑的软件分发新范式。
44-
- Tags: #read
45-
4646
## Monthly Archive
4747

48-
- [2026-08](202608/monthly-index.md) (1 entries)
48+
- [2026-08](202608/monthly-index.md) (2 entries)
4949
- [2026-07](202607/monthly-index.md) (30 entries)
5050
- [2026-06](202606/monthly-index.md) (33 entries)
5151
- [2026-05](202605/monthly-index.md) (70 entries)

all_summary.md

Lines changed: 4 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -1,5 +1,9 @@
11
# All Bookmarks Summary
22

3+
- (2026-08-01) [smevals - a small eval suite for evaluating models, prompts, and harnesses | Prime Radiant](202608/2026-08-01-smevals---a-small-eval-suite-for-evaluating-models%2C-prompts%2C-and-harnesses-prime-radiant.md)
4+
- Tags: #read #agent #llm
5+
- Summary: smevals 是评估小模型的 CLI 工具,可自定义任务和评分,对比多模型,支持编码代理辅助搭建评估,并提供可视化报告,帮助从廉价模型中找到最佳方案。
6+
37
- (2026-08-01) [Write-Only Code | Heavybit](202608/2026-08-01-write-only-code-heavybit.md)
48
- Tags: #read #agent
59
- Summary: 随着大语言模型生成代码能力的提升,软件行业正进入“只写代码”时代:AI直接生成并部署代码,人类审查不再可行。工程师角色将从代码编写者转向系统设计师,专注接口、约束与风险管理,并建立新的信任机制以应对无人阅读代码的现实。

data.json

Lines changed: 11 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -12916,5 +12916,16 @@
1291612916
"read",
1291712917
"agent"
1291812918
]
12919+
},
12920+
{
12921+
"month": "202608",
12922+
"title": "smevals - a small eval suite for evaluating models, prompts, and harnesses | Prime Radiant",
12923+
"url": "https://primeradiant.com/blog/2026/smevals.html",
12924+
"timestamp": 1785561716,
12925+
"tags": [
12926+
"read",
12927+
"agent",
12928+
"llm"
12929+
]
1291912930
}
1292012931
]

0 commit comments

Comments
 (0)