专题 · 2026 年 7 月

小型本地 AI 与评估工具箱

一组适合尝试本地模型、比较托管模型选项并加入可重复评估步骤的实用工具。

可引用摘要

用 Ollama Library 选择本地模型,用 OpenRouter Models 比较托管选项,用 promptfoo 把提示词变成可重复测试,再用 Hugging Face Spaces 检查在线 demo。组合起来就是一个小型 AI workbench:先跑本地基线,再比较托管取舍,最后在换模型前保存一次评估。

本地 AI 实验需要一个小循环:选一个基线,比较一个托管替代,再保存一个可重复检查。

重点不是一次选定永久模型,而是避免没有证据地频繁换模型。

收录标准

  • 来源能帮助比较模型行为、可用性或部署取舍。
  • 开发者在迁移平台前就能获得有用判断。
  • 工作流能产出可重复的笔记、提示词或评估材料。

不收录

  • 只展示营销文案、缺少实际运行信号的模型目录。
  • 把评估、价格或复现细节藏在封闭 onboarding 后面的 AI 工具。

推荐来源

  1. 专题

    Ollama Library

    一个本地模型包目录,用来在自己的机器上运行语言模型。

    为什么选它

    Ollama Library 的价值在于让本地模型选项可浏览,避免先下载大文件再发现不适合。

    适合这样用

    适合选择本地基线、比较模型大小、预估硬件要求和教学本地推理约束。

    查看宝藏详情
  2. 专题

    OpenRouter Models

    一个模型目录和 API 路由入口,可在一个地方比较多种语言模型。

    为什么选它

    OpenRouter Models 适合比较托管模型,因为能集中观察上下文窗口、价格信号和供应商可用性。

    适合这样用

    适合供应商选择前、原型预算、降级方案规划和向小团队解释模型取舍。

    查看宝藏详情
  3. 专题

    promptfoo

    一个开源工具,用来测试、评估和回归检查 LLM prompt 与 agent 行为。

    为什么选它

    promptfoo 能把提示词改动放进可重复测试,而不是只凭一次回答的感觉判断好坏。

    适合这样用

    适合记录样例输入、预期行为、回归检查和上线提示词改动前的模型对比。

    查看宝藏详情
  4. 专题

    Hugging Face Spaces

    Hugging Face 社区里的可运行机器学习演示、应用和原型集合。

    为什么选它

    Hugging Face Spaces 有价值,因为在线 demo 往往比单看模型卡更快暴露实际行为。

    适合这样用

    适合检查 demo、探索模型、准备教学例子和在从零构建前寻找实现模式。

    查看宝藏详情

继续探索