# 用自己的任务比较本地与云端 AI

Neaptide 模板 · 2026 年 9 月 27 日

这是一套小规模工作试点的方法建议，不是行业标准或现成的基准测试。请在实际测试后填写结果。不要向任何方案发送它无权处理的数据。

## 1. 条件与决策

- 需要做出什么决定：
- 任务及典型月度工作量：
- 当前完成方式及成本：
- 各方案获准处理的数据：
- 不可接受的错误：
- 由谁验收结果：
- 最低可接受质量与时间要求（测试前确定）：
- 比较相同条件下的模型，还是完整工作流程：
- 试点日期与持续时间：

## 2. 配置

| 参数 | 本地方案 | 云端方案 |
| --- | --- | --- |
| 模型名称与版本 | | |
| 应用 / API / 模式 | | |
| 量化方式，如适用 | | |
| 硬件 / 套餐 | | |
| 上下文与生成参数 | | |
| 可用工具和搜索 | | |
| 文档读取与索引建立的位置 | | |
| 数据保留与训练条款 | | |
| 网络、并发用户、其他程序 | | |

## 3. 任务卡片：每个案例复制一份

- 编号：
- 原始材料及处理许可：
- 完整提示词：
- 正确事实及来源，或预期行为检查方法：
- 验收标准：
- 信息不足时模型应如何处理：
- 关键错误：

加入日常任务、材料中没有答案的问题，以及存在矛盾数据的案例。参考答案应与模型输入分开保存。首次试点可以选 12 项任务，但组成应符合你的实际工作。

## 4. 记录表：每次尝试填写一行

| 编号 | 方案与运行次数 | 首次可见响应时间，秒 | 完整响应时间，秒 | 检查与修改，分钟 | 错误 | 是否按标准验收通过？ | 使用费用 |
| --- | --- | --- | --- | --- | --- | --- | --- |
| | | | | | | | |

记录模型是否已经加载。先核对定义，再合并不同程序的技术指标。保留失败尝试；如果修改后才通过验收，要计入全部耗时。

## 5. 按相同工作量和周期计算成本

- 额外硬件减去计入的残值 / 使用期限：
- 初始配置 / 相同期限：
- 服务、许可证与集成费用：
- 额外电力：
- 维护与管理（小时 × 每小时成本）：
- 检查与修改（小时 × 每小时成本）：
- 其他费用：
- 双方都排除的共同成本：
- 验收通过的结果总数：

每个通过结果的成本 = 全部被比较工作量的支出（包括失败尝试）/ 验收通过的结果数量。通过数量为零时，该指标无法计算。

不要把小规模试点结论直接推广到所有未来任务。长文档、峰值负载和模型版本变化，需要单独复测。

## 6. 试点结论

- 选择的方案及原因：
- 结论适用哪些任务：
- 哪些项目未通过检查：
- 仍存在哪些限制：
- 何时重新测试：
