01 · 先固定输入,再观察输出。
每个模型使用下方完全一致的 v1 提示词,在新的对话中独立生成。模型版本、生成参数、日期、完整输入与原始输出一并记录。网站展示的是单次运行,不把单个结果等同于模型能力的整体排名。
- 原样提交固定提示词,不添加模型专属修饰。
- 保留第一次完整输出,包括失败、解释文字或代码围栏;不手工修复后冒充原始结果。
- 使用静态检查记录合规性,再以固定视口检查画面、交互和控制台。
- 评分必须附带评审者、日期与各维度依据;未评审显示“未评分”。
作品库只展示正式投稿;原始输出与评审证据分别保存。
02 · 固定提示词 v1
正在读取…
哈希以 JSON 中 text 字段的 UTF-8 字节计算,保留 LF 换行,不追加末尾换行。更改内容需新建提示词版本,不能静默替换 v1。
03 · 看什么,如何评分。
五个维度分别按 0–10 分记录,总分为各项得分乘权重后相加,再乘 10,满分 100。缺少任一维度或评审信息时不展示总分。
| 维度 | 权重 | 观察依据 |
|---|---|---|
| 可运行性 | 20% | 直接打开能否运行,有无控制台错误、缺失资源。 |
| 画面识别与构图 | 30% | 长喙、喉囊、翅膀、车架与脚踏是否清晰,场景是否协调。 |
| 动画与交互 | 20% | 车轮、脚踏和前进感是否连贯,按钮与空格键是否有效。 |
| 响应式与无障碍 | 20% | 手机无横向溢出,键盘焦点可见,减少动态偏好有效。 |
| 代码质量与性能 | 10% | 代码结构、重复计算、动画开销及资源使用。 |
04 · 同一个窗口,同一把尺。
| 桌面视口 | 1200 × 800 CSS 像素,DPR 1 |
|---|---|
| 手机视口 | 390 × 844 CSS 像素,DPR 1 |
| 浏览器 | 每次实测记录浏览器名称和完整版本;未提供时标记“未记录”。 |
| 截图时机 | 页面加载后第 3 秒;同批测试保持一致,记录动态偏好与播放状态。 |
| 交互验收 | 播放/暂停、空格键、Tab 焦点与减少动态偏好逐项检查。 |
截图必须来自真实浏览器;缺失截图时显示待补充,不用插画替代证据。
05 · 把下一只鹈鹕放进来。
下载元数据模板,补齐模型版本、生成日期、完整输入和参数。将 AI 的原始输出保存为 UTF-8 文本,再在本地仓库执行导入。
npm ci npm run submission:init -- model-effort-yyyymmdd-run01 # 填写 output/model-effort-yyyymmdd-run01.meta.json npm run import -- --source ./result.txt --meta ./output/model-effort-yyyymmdd-run01.meta.json npm run check npm run dev
导入工具计算原始输出 SHA-256,保留完整输入,生成受限预览和静态检查报告。检查未通过的作品仍可登记,运行预览会停用。桌面、手机 PNG / WebP 截图可通过 --desktop 和 --mobile 导入,并需在元数据中填写环境。
将生成的作品目录与索引提交 PR。Action 自动检查提示词、原始文件哈希、投稿声明与变更范围,并提供检查报告。人工审阅合并后自动发布。阅读完整 PR 投稿规范 ↗
本批 Codex 投稿通过独立任务发送相同 v1 输入,模型可自行使用本地工具;DeepSeek 为用户确认的首次外部投稿。各平台的执行环境不同,生成耗时不用于直接排名。作品的来源、配置和实测记录可在详情页复查。
06 · 保留实验的边界。
画面质量包含主观判断;单次生成、不同采样参数、工具能力和生成耗时都会影响结果。本项目不宣称提供统计意义上的模型排行榜。
预览在仅允许脚本执行的独立沙盒中运行,不赋予同源、弹窗、表单或顶层导航权限,并通过内容安全策略限制网络与外部资源。静态检查是保守的诊断,不等于完整安全审计,也可能拒绝合规代码。
沙盒限制可能改变原始作品的表现。静态检查失败、截图缺失、未评分分别标注。原始输出以文本保存,复制或下载后仍应先审阅再自行运行。