Skip to content

Latest commit

 

History

History
119 lines (79 loc) · 13.2 KB

File metadata and controls

119 lines (79 loc) · 13.2 KB

Model Radar 研究与改进记录

研究日期:2026-09-10。基于 wychuang/model-radard128013

我怎样理解这个项目

我先读了 README、DESIGN、DEVELOPMENT 和提交历史,再打开实际页面。DESIGN 中的四个问题最能说明目的:

  1. 现在谁在领先?
  2. 哪些模型刚刚发布,哪些仍待官方确认?
  3. 哪些企业正在接近自己过去常见的发布间隔?
  4. 面对当前用途,到底应该选哪个模型?

我的最初推断是:这是给个人长期使用的模型观察和选型工具。你随后明确了公开分享、亲切和直观的目标,因此本次也加入了普通访客能直接操作的价格与智能对比。雷达把所选指标与发布日期放在同一个视图;原始评测和来源让用户能够继续核对;固定页面的每日检查减少重复查资料的工作量。项目已经有三套界面,继续增加页面或引入框架的收益很小。

本次已经确认的问题

  1. 9 月 10 日生成的快照仍展示 6 月 9 日至 8 月 7 日的评测记录。种子文件最后修改于 8 月 7 日。每日检查没有更新模型分数,首页需要直接讲清数据年龄。
  2. 23 个来源中包含 14 个厂商页面、9 个评测页面。快照记录 OpenAI 来源 HTTP 403 Forbidden,三个页面的来源列表却都过滤掉了厂商。
  3. 更新器只从旧快照带入页面摘要。检查失败会清空观察词;页面变化在下一次内容不变的检查后消失。这样难以回答“上次发生变化是什么时候”。
  4. 选型函数将指标覆盖率标为“高置信”;覆盖百分比没有衡量评测质量、数据年龄或推荐准确度。
  5. 8 月 31 日的截止事件,在 9 月 10 日仍标为“将到期”。
  6. 默认首页没有进入雷达与研究桌面的链接,直接打开公开首页的用户容易错过已有功能。

本次实施范围

沿用浏览器 ES modules、Node 内置测试和现有页面。只增加必要的历史状态与展示逻辑,模型、分数、价格继续由原有人工核实流程维护。

  • tests/updateModelRadar.test.mjs 复现“成功 → 失败 → 恢复”和“变化 → 不变”的行为,再修改 scripts/update-model-radar.mjs,保留最近成功、最近页面变化和观察词增减的日期;同一来源 URL 更换后重新建立基线。
  • tests/modelRadar.test.mjs 验证数据日期与检查时间独立、失败来源排在前面;在 src/model-radar.mjs 提供三个页面共用的日期和来源顺序。
  • 修改三个 src/app*.mjs 与对应 HTML/CSS,首屏展示评测日期范围和来源检查统计,来源列表展示全部 23 个页面、错误原因及变化记录;首页加已有视图入口。
  • 在现有辅助函数中将覆盖标签写为“证据覆盖”,将已过截止日期写为“日期已过,待核实”,保留事件原文及来源。
  • 运行现有测试与针对性新增测试,检查桌面和窄屏的实际交互,再进行一次独立代码审查。把结果补回本文件。

你补充的产品目标与本次新增功能

你已明确希望做成值得长期维护和分享的公开网站,有辨识度、亲切,让人对模型形成直观印象。你补充的“斩杀线”是智能与价格散点图:更便宜且不弱、或同价更强的模型,可以淘汰缺乏优势的选择。

我据此增加一个实施项:在雷达页加入“模型斩杀线”,用 AA 智力原始分数和现有 API 输出单价计算性价比前沿。点选模型时说明具体被谁压过、差价和分差;预算与最低智能筛选只影响选型结果,不移动原始数据点。价格或智能缺失时不参与淘汰判断。默认首页和研究桌面提供直达入口。数学规则包括同价、同分、完全相同、缺失和零价测试。

我查到 XTokenChecker 的模型斩杀线,其价格是 75% 输入与 25% 输出混合,能力采用 Arena。本项目现有字段适合先用输出价格与 AA 智力;价格没有独立核实日期,已在界面说明,界面明确标出这两项口径。Artificial Analysis 对 GPT-5.6 的前沿分析也明确区分同价更强与同等智能更低成本。

仍需后续确认:你最常用的模型用途、重点厂商、能投入的数据核实频率。现有自动任务只观察固定的已知页面与关键词,发现全新型号的能力有限。

来源:项目 README、本仓库 DESIGN.mdDEVELOPMENT.mdsrc/model-radar-seed.mjssrc/model-radar-snapshot.mjs 与 Git 历史。首轮交付中的模型数值是仓库历史记录,后续核实与当前值见下节。

首轮交付结果与具体案例(8 月旧快照)

  • 已加入一个新互动区,复用雷达页,没有新增站点、框架或依赖。
  • 当前快照有 14 个模型,其中 12 个可比较,5 个在性价比前沿,7 个存在更优替代,2 个因数据缺失单列。
  • 点 DeepSeek-V4 Pro:44 分、$0.87;界面给出的 Flash 0731 是 50 分、$0.28,因此每百万输出 tokens 便宜 $0.59,智能高 6 分。
  • 这批快照中的前沿为 Flash 0731、Muse Spark 1.1、Grok 4.5、Kimi K3、Claude Opus 5。结论仅覆盖 AA 智力与输出单价,不包含速度、上下文、缓存成本和任务用量。
  • 全部 23 个来源可见,OpenAI 的 403 错误排在首位;最近检查成功数为 22/23。这里只引用克隆时已有快照,未以本地试跑替换每日检查记录。
  • 新检查器在下一次执行后开始累积历史,兼容当前不含新增字段的快照。离线测试跑通了完整的检查、合并与写出流程。

首轮验证

原有 31 项测试先全部通过。补充来源历史、配置变化、日期与 Pareto 规则后,共 44 项测试通过。测试使用内置运行器,没有加入测试依赖。

浏览器检查覆盖雷达页桌面 1440px 与手机 375px、研究桌面与默认首页手机入口。12 个散点和 23 个来源正常渲染;预算为零、最低智能调整、模型选择、替代按钮均可操作。桌面与手机下没有发现横向溢出。原有雷达几何与选型逻辑继续通过测试。

独立审查指出了三个边界,我都修正了:修改本地观察词不应被标成网站新增词;通用官方页面不能直接充当已核实的价格来源;全部模型缺少数据时仍应给出名单和解释。价格的独立核实日期目前没有历史记录,界面明确说明这一点。

接下来最值得做的三件事

  1. 持续维护同口径数据。 本轮已完成 9 月 10 日更新,详见下节。以后升级 AA 指数时仍需成批核实,不能将新版分数与旧版混排。价格来源与条件随数据一起维护。
  2. 补“新模型第一印象”的原始案例。 建议每个重点新模型只放一个固定任务的输入、实际输出、耗时和费用。例如同一份长文提取清单,或同一个小型网页修改。用户能看到真实结果,比较才有内容。需要实际测试材料,不能靠模型名称生成印象。
  3. 收拢对外入口。 目前三个视图继续保留,并已互相导流。你看过本轮后,可以把雷达与斩杀线定为公开主入口,研究桌面作为另一种浏览方式。这样能逐步减少三套页面同时演化的维护成本。

公开入口:雷达与模型斩杀线。本地开发时可打开相同页面的 #value-frontier 区域。

9 月 10 日模型资料更新

你要求更新最新模型情况。我按现有 12 个厂商核实新型号,保留有参考价值的低价型号,并统一 AA 智力指数口径。实施顺序如下:

  • 更新 src/model-radar-seed.mjs:AA v4.3、Arena 9 月 2 日榜单、官方价格、发布日期、型号状态和事件。新型号不继承上一代成绩。
  • 在现有取值函数和斩杀线中使用价格自身的来源、核实日期与条件;增加版本不兼容时不参与比较的回归测试。
  • 固定来源列表补入实际使用的官方文档,低频串行检查一次并生成快照。
  • 验证数据引用、测试及浏览器展示,将具体变化和仍缺失的证据补回本节。

本轮完成后,收录 20 个模型,其中 17 个同时具备 AA v4.3 智力和输出单价,4 个位于本次价格口径下的前沿。资料来自厂商页面、AA 榜单公开数据和 Arena 原始榜单。没有新增框架、依赖或自动抓榜层。

重点型号 发布 / 版本日期 AA v4.3 输出美元 / 百万 tokens 本次变化
GPT-6 Astra 2026-09-03 52.81 50 新增;1.05M 上下文,长输入加价单列
Claude Fable 5.1 2026-09-01 53.37 50 新增,AA max with fallback
Gemini 3.8 Flash 2026-09-02 41.19 3.75 替换 3.6;年末前优惠价
Muse Spark 1.3 2026-09-02 48.17 4.25 替换 1.1;价格暂采用 AA 记录
GLM-5.3 2026-08-18 44.86 4.4 替换 5.2,保留开放权重标记
GLM-5.3 Flash 2026-08-26 41.91 0.5 新增低价多模态型号
Grok 4.6 2026-08-12 44.41 6 替换 4.5;Arena high 为初步结果
DeepSeek V4 Pro 0813 2026-08-13 36.28 3.96 预览转正式版,价格更新为高峰档
DeepSeek V4 Flash 0731 2026-07-31 35 1.32 保留型号,重新核实智力与现行价格
GPT-5.6 Sol 2026-07-09 47.06 20 输出价从旧记录 30 调整到 20
GPT-5.6 Terra / Luna 2026-07-09 42.25 / 37.5 12 / 1.2 补全中低价档位
Qwen3.8 Max 0902 2026-09-02 N/A 6 新版本单独收录,不复制旧型号成绩

智力和速度取自 AA 当前榜单,其中 Flash 0731 取自 AA 精确型号页。读取日期为 2026-09-10,不能解释为全部测试于当日运行。Arena 文字榜标注的日期为 2026-09-02,保留各自的原始型号与档位。Astra、Muse 1.3、Qwen 0902 没有借用别的版本的 Arena 分数。

价格逐项保留出处:OpenAI AstraSol / TerraLunaClaudeGemini 3.8 FlashDeepSeekZ.aiGrok 4.6KimiQwen 0902Mistral。Meta 与 Gemini Flash-Lite 暂采用 AA 的价格,界面明确写出尚未直接核实官方定价。

几个会影响使用的具体修正:

  • DeepSeek 旧记录的 $0.28 / $0.87 输出价格已过期;现行高峰输出分别 $1.32 / $3.96,闲时减半。图中统一高峰档,选中模型可看到时段。
  • Sonnet 5 原定 9 月涨价已取消,$2 输入 / $10 输出成为标准价。旧的到期提醒改成核实事件。
  • Gemini 3.8 Flash 优惠持续到 12 月 31 日,2027 年起回到 $1.50 / $7.50。三个详情页和斩杀线都直接显示条件。
  • Mistral Medium 3.5 按官方规格修正为 4 月 28 日、256K 上下文;Nova 2 Omni 保留 Nova Forge 预览状态;Cohere API 名修正为 command-a-plus-05-2026。
  • 无法确认的 Qwen 0902、Command A+、Nova 2 Omni 保持可见,缺失数据不参与斩杀判断。

当前前沿是 GLM-5.3 Flash、Muse Spark 1.3、Claude Opus 5、Claude Fable 5.1。例如选 DeepSeek V4 Pro 0813,会显示 GLM Flash 输出价便宜 $3.46、智能高 5.63 分。这只说明所用两项指标的关系;Astra 与 Fable 5.1 相差仅 0.56 分,不能据此推断实际任务一定存在明显差距。

自动直连检查完成:39 个固定来源中 28 个成功、11 个失败。OpenAI 与 Arena 部分页面返回 403,另有网络读取失败;网页检索中已核实的数据不因此被清空,也没有把失败伪装成成功。旧版厂商专项数据保留原日期,因此页面记录范围仍从 6 月开始。

新增了价格自身来源/日期与评测版本隔离测试;更新旧快照断言,并修复证据覆盖率恰好 50% 时浮点累加造成的误判。46 项测试通过。独立审查对照 16 个 AA 型号的 80 个数值均吻合,指出的开放权重标记和详情页价格条件已补齐。

浏览器已核对更新后的雷达与斩杀线,17 个点、39 个来源正常渲染;点 Pro 0813 的差价、分差与峰谷说明正确。375px 手机宽度下,雷达和研究桌面没有横向溢出;研究桌面点 Gemini 3.8 Flash 可直接看到优惠截止及后续价格。首页同步显示 20 个模型和 9 月 10 日数据,浏览器未报告脚本错误。

本轮模型资料、斩杀线、来源检查改进和说明文档已获确认,发布目标为 main;GitHub Pages 沿用根目录发布,部署结果以仓库的 Pages 构建记录为准。