探索路径

搭一个小型本地 AI 工作台

一条短路径:试本地模型,比较托管模型,再加一个可重复 eval。

结果

带走一次本地模型测试、一次托管模型比较,以及一个可重复运行的小 eval。

这条兔子洞把 AI 实验压小:一个本地基线、一次托管比较、一个可重复检查。

适合谁

  • 想先搭一个小型模型工作流、但不想一开始就买基础设施的开发者或 AI 好奇用户。
  • 准备比较本地模型和托管模型、再决定是否改真实产品流程的小团队。

开始前准备

  • 一台能跑小模型的机器,或愿意用托管模型作为 fallback。
  • 一个具体 prompt 或任务,不需要完整 benchmark 也能判断结果好坏。

完成后得到什么

  • 同一个 prompt 的一次本地基线结果和一次托管模型对比。
  • 一个记录期望行为的小评测,方便换模型前后重复检查。

常见坑

  • 把一次看起来舒服的 demo 回答当成模型可靠性的证据。
  • 用不同 prompt、上下文或成功标准去比较模型。

后续动作

  • 记录 prompt、模型名、服务商、日期和观察到的失败案例。
  • 每次更换模型大小、服务商或系统提示词后,都重复跑同一个小评测。

路线

  1. 01

    从一个小本地模型开始

    用 Ollama Library 选择你的机器能舒服运行的模型。

    Ollama Library
  2. 02

    和托管模型做比较

    用 OpenRouter Models 比较上下文、价格信号和供应商可用性。

    OpenRouter Models
  3. 03

    把一个 prompt 变成测试

    用 promptfoo 记录三个输入和一个行为预期,再切换模型。

    promptfoo

下一步

打开第一个来源,每一步只记一个要点,直到得到一个可以复用的结果。