推出 Supabase Evals

作者:杖雍皓

推出 Supabase Evals

推出 Supabase Evals Supabase 刚发了 Evals,我觉得这事比它看起来的要重要。 做 AI 应用的人都有一个心照不宣的痛:你调 prompt 的方式跟调 CSS 差不多——改一个词,跑一下,看看感觉对不对,再改。没有断言,没有回归测试,没有 CI。上线前唯一的 QA 流程是"我试了五个 case 都没翻车"。 Supabase Evals 试图把这件事工程化: 📦 Datasets:上传输入/期望输出对,作为你的测试集 🧪 Experiments:对数据集跑评估,支持批量 ⚖️ Evaluators:内置 LLM-as-judge,也能写自定义评估器 🔗 Tracing:每次评估自动关联完整调用链,哪个 tool call 出了问题一目了然 🔁 CI/CD:直接接 GitHub Actions,PR 合并前自动跑 eval 最让我觉得对的一个设计决策:evals 不是一次性脚本,是平台级基础设施。 你不需要自己搭一套"跑数据集 → 打分 → 存结果 → 画图表"的管道。它跟 Supabase 的 AI Gateway、Edge Functions、...

打开原帖

推荐阅读

← 返回首页查看更多