Promptfoo

开源的 LLM 评测与红队测试工具,用宣告式设定就能比较 GPT、Claude、Gemini 的表现,还能对 AI 应用做越狱、prompt 注入等弱点扫描,评测直接在本机跑。

Freemium 4.3 United States
访问官网 ↗

Promptfoo 是什么

Promptfoo 是一套开源的 LLM 评测与红队测试(red teaming)工具,定位很明确:在你的 AI 应用上线前,先把弱点测出来、修掉。它有两个面向。一是评测:用简单的宣告式设定档,就能对同一批 prompt 在 GPT、Claude、Gemini、DeepSeek 等不同模型上跑比较,看谁准、谁快、谁便宜,还能整进 CI/CD,每次改 prompt 都自动回归测试。二是安全:内建弱点扫描器,系统性地尝试越狱模型,测 prompt 注入、资料外泄等 OWASP LLM Top 10 的风险。

它的一大优点是评测完全在本机跑、直接和你的 LLM 对话,prompt 与资料不必送上第三方,对在意机敏资料的团队很重要。它是 MIT 授权的开源专案,GitHub 上累积 2 万多颗星,连 OpenAI、Anthropic 自己都在用。2026 年 3 月 Promptfoo 宣布被 OpenAI 收购,但官方表示仍维持开源与 MIT 授权。

功能特色与适用场景

适合谁?适合在做 LLM 应用、agent 或 RAG,需要把「prompt 改了会不会变烂」「会不会被越狱、泄资料」这两件事测清楚的工程团队,从个人开发者到企业安全团队都涵盖。它有免费开源版与企业方案(含 guardrails 即时防护、企业支援)。如果你只是偶尔手动试 prompt,可能用不到这么系统化的工具,但一旦要正式上线,这类测试是省不掉的。

主要功能

  • 宣告式设定比较 GPT、Claude、Gemini、DeepSeek 等模型表现
  • 红队测试:模拟越狱、prompt 注入、资料外泄等攻击
  • 弱点扫描涵盖 OWASP LLM Top 10 风险
  • 评测在本机执行,直接与 LLM 对话、不送第三方
  • 整合 CI/CD,改 prompt 自动回归测试;另有即时 guardrails

优点

  • MIT 开源、本机执行,机敏资料不外流
  • 评测与安全红队一套到位,可进 CI/CD
  • 连 OpenAI、Anthropic 都在用,社群与信任度高

缺点

  • 命令列与设定档取向,非工程背景者门槛较高
  • 企业级功能(如 guardrails)需付费
  • 被 OpenAI 收购后的长期走向仍待观察

使用场景

  • 比较不同模型在同一批 prompt 上的表现
  • 对 LLM 应用做越狱与 prompt 注入弱点扫描
  • 把 prompt 评测整进 CI/CD 做回归测试
  • 上线前系统性检查 RAG 与 agent 的安全风险

编辑点评

LLM 应用要上线,评测和安全红队两件事躲不掉,Promptfoo 把这两块用开源、本机执行的方式包在一起,还能进 CI/CD,我相当推。连 OpenAI、Anthropic 自己都在用,说明它不是花架子。被 OpenAI 收了之后会不会变调得看后续,但目前仍 MIT 开源。我们给 4.3 分。

常见问题

Promptfoo 的资料会被送到云端吗?

预设不会。评测在你的本机执行,直接和你设定的 LLM 对话,prompt 与测试资料不必上传到第三方,对处理机敏资料的团队比较安心。

被 OpenAI 收购后还是开源吗?

官方表示是的。2026 年 3 月宣布被 OpenAI 收购后,Promptfoo 仍维持开源与 MIT 授权;不过长期走向仍建议持续留意官方公告。

相关 AI 工具

繁體中文版 →