鹈鹕骑车
A transparent experiment

让差异,有据可循。

这是一组公开的 HTML 小实验。保留原始输入和输出,让每一次观察都能被复查。

01 · 先固定输入,再观察输出。

每个模型使用下方完全一致的 v1 提示词,在新的对话中独立生成。模型版本、生成参数、日期、完整输入与原始输出一并记录。网站展示的是单次运行,不把单个结果等同于模型能力的整体排名。

  1. 原样提交固定提示词,不添加模型专属修饰。
  2. 保留第一次完整输出,包括失败、解释文字或代码围栏;不手工修复后冒充原始结果。
  3. 使用静态检查记录合规性,再以固定视口检查画面、交互和控制台。
  4. 评分必须附带评审者、日期与各维度依据;未评审显示“未评分”。

作品库只展示正式投稿;原始输出与评审证据分别保存。

02 · 固定提示词 v1

下载提示词 JSON ↓
正在读取…

哈希以 JSON 中 text 字段的 UTF-8 字节计算,保留 LF 换行,不追加末尾换行。更改内容需新建提示词版本,不能静默替换 v1。

03 · 看什么,如何评分。

五个维度分别按 0–10 分记录,总分为各项得分乘权重后相加,再乘 10,满分 100。缺少任一维度或评审信息时不展示总分。

维度 权重 观察依据
可运行性 20% 直接打开能否运行,有无控制台错误、缺失资源。
画面识别与构图 30% 长喙、喉囊、翅膀、车架与脚踏是否清晰,场景是否协调。
动画与交互 20% 车轮、脚踏和前进感是否连贯,按钮与空格键是否有效。
响应式与无障碍 20% 手机无横向溢出,键盘焦点可见,减少动态偏好有效。
代码质量与性能 10% 代码结构、重复计算、动画开销及资源使用。

04 · 同一个窗口,同一把尺。

桌面视口 1200 × 800 CSS 像素,DPR 1
手机视口 390 × 844 CSS 像素,DPR 1
浏览器 每次实测记录浏览器名称和完整版本;未提供时标记“未记录”。
截图时机 页面加载后第 3 秒;同批测试保持一致,记录动态偏好与播放状态。
交互验收 播放/暂停、空格键、Tab 焦点与减少动态偏好逐项检查。

截图必须来自真实浏览器;缺失截图时显示待补充,不用插画替代证据。

05 · 把下一只鹈鹕放进来。

下载元数据模板,补齐模型版本、生成日期、完整输入和参数。将 AI 的原始输出保存为 UTF-8 文本,再在本地仓库执行导入。

npm ci
npm run submission:init -- model-effort-yyyymmdd-run01
# 填写 output/model-effort-yyyymmdd-run01.meta.json
npm run import -- --source ./result.txt --meta ./output/model-effort-yyyymmdd-run01.meta.json
npm run check
npm run dev

导入工具计算原始输出 SHA-256,保留完整输入,生成受限预览和静态检查报告。检查未通过的作品仍可登记,运行预览会停用。桌面、手机 PNG / WebP 截图可通过 --desktop 和 --mobile 导入,并需在元数据中填写环境。

将生成的作品目录与索引提交 PR。Action 自动检查提示词、原始文件哈希、投稿声明与变更范围,并提供检查报告。人工审阅合并后自动发布。阅读完整 PR 投稿规范 ↗

本批 Codex 投稿通过独立任务发送相同 v1 输入,模型可自行使用本地工具;DeepSeek 为用户确认的首次外部投稿。各平台的执行环境不同,生成耗时不用于直接排名。作品的来源、配置和实测记录可在详情页复查。

06 · 保留实验的边界。

画面质量包含主观判断;单次生成、不同采样参数、工具能力和生成耗时都会影响结果。本项目不宣称提供统计意义上的模型排行榜。

预览在仅允许脚本执行的独立沙盒中运行,不赋予同源、弹窗、表单或顶层导航权限,并通过内容安全策略限制网络与外部资源。静态检查是保守的诊断,不等于完整安全审计,也可能拒绝合规代码。

沙盒限制可能改变原始作品的表现。静态检查失败、截图缺失、未评分分别标注。原始输出以文本保存,复制或下载后仍应先审阅再自行运行。

THE SHARED PROMPT · V1

从同一句话开始。

以下是每个作品使用的完整提示词,可直接复制。