探索路径
搭一个小型本地 AI 工作台
一条短路径:试本地模型,比较托管模型,再加一个可重复 eval。
带走一次本地模型测试、一次托管模型比较,以及一个可重复运行的小 eval。
这条兔子洞把 AI 实验压小:一个本地基线、一次托管比较、一个可重复检查。
适合谁
- 想先搭一个小型模型工作流、但不想一开始就买基础设施的开发者或 AI 好奇用户。
- 准备比较本地模型和托管模型、再决定是否改真实产品流程的小团队。
开始前准备
- 一台能跑小模型的机器,或愿意用托管模型作为 fallback。
- 一个具体 prompt 或任务,不需要完整 benchmark 也能判断结果好坏。
完成后得到什么
- 同一个 prompt 的一次本地基线结果和一次托管模型对比。
- 一个记录期望行为的小评测,方便换模型前后重复检查。
常见坑
- 把一次看起来舒服的 demo 回答当成模型可靠性的证据。
- 用不同 prompt、上下文或成功标准去比较模型。
后续动作
- 记录 prompt、模型名、服务商、日期和观察到的失败案例。
- 每次更换模型大小、服务商或系统提示词后,都重复跑同一个小评测。
路线
- 01
- 02
- 03