Canary
Y Combinator 支持的 AI 程式碼獨立測試者:把每個改動跑起來、想辦法弄壞它,回報會進到正式環境的問題
Canary 是 Y Combinator 支持的新創 Canaries, Inc. 推出的測試服務,在 Show HN 的介紹是「AI 程式碼的獨立驗證」,標語是「AI writes your code. Canary tests it.」。它的立場很明確:審查者讀 diff,Canary 則把你的 App 實際跑起來,針對每一個改動去找能把它弄壞的方法,回報那些原本會直接上線的問題。
流程分四步:讀取 diff 與程式碼庫,對應出這個改動會影響到的所有使用者流程;在乾淨的沙箱裡啟動應用;嘗試破壞;最後驗證。它有兩種觸發方式,一是在你的編碼代理宣告任務完成之前執行 canary verify,對還沒 commit 的工作樹拍快照並測試,不需要 commit 或開 PR;二是在每個 PR 上自動執行。安裝方式是把一行提示貼給代理,由代理用 npm 安裝 @runcanary/cli 並依指示完成設定。
功能特色與適用場景:官網展示的實例很有說服力:某個 API 用 storageId 取圖片時沒有檢查組織歸屬,A 組織的使用者換個 ID 就能打開 B 組織的私人檔案,Canary 在 6 分 9 秒內自主找出、標為 P0,附上根本原因、修正建議,並把這個測試加入每次 PR 的回歸檢查。它能讀取 GitHub、Linear、Sentry、Datadog、Notion、Slack 的脈絡,並把問題回送給 Claude Code 等代理修。官方另發布 QA-Bench v0 基準,自家成績 83.1。對台灣大量讓 AI 寫程式的 SaaS 團隊,越權存取這類 bug 正是程式碼審查最容易漏掉的。定價需洽詢。
TheAI學院 編輯建議
編輯實測後的真心話AI 寫程式越快,「誰來驗證」就越重要。Canary 用實際執行加對抗式測試補上審查的盲點,對大量採用編碼代理的團隊值得試。
主要功能
- 讀取 diff 並對應改動影響的所有使用者流程
- 在乾淨沙箱啟動應用並嘗試破壞改動
- canary verify 在代理完成前測試未 commit 的工作樹
- 每個 PR 自動執行並產出報告
- 回報附根本原因、修正建議與回歸測試
- 整合 GitHub、Linear、Sentry、Datadog、Notion、Slack
適用場景
- AI 寫完功能後在 commit 前自動測一輪
- 每個 PR 檢查是否引入越權或資料外洩問題
- 把找到的破壞案例變成永久回歸測試
- 讓 Claude Code 依 Canary 報告自動修正
Canary 的優點與缺點
優點
- 實際執行應用而非只讀程式碼
- 能抓出越權存取等審查易漏的問題
- 可直接由編碼代理安裝與接收修正
缺點
- 官網未公開定價
- 需要應用能在沙箱中啟動
- QA-Bench 為官方自行發布的基準
價格方案
官網未公開定價,可預約通話洽詢,以官網為準
Canary 常見問題
Canary 跟一般程式碼審查有什麼不同?
審查是讀 diff,Canary 會把應用跑起來,針對改動實際嘗試破壞,回報會進到正式環境的問題。
可以在還沒開 PR 前就測嗎?
可以,canary verify 會對未 commit 的工作樹拍快照,在乾淨沙箱裡測試。
費用怎麼算?
官網未公開定價,可預約通話洽詢。
使用者評價
還沒有足夠評價,搶先分享你的使用心得!
寫下你的評價
Canary 的替代方案
查看相似的 AI 工具 →相關 AI 工具
Claude
Anthropic 的 AI 助理,長文件與寫作品質是它的主場。
Kiln
開源的 AI 工作台:評測、提示自動最佳化、微調、合成資料與 RAG,桌面 App 加 MIT 授權 Python 函式庫
Runloop
AI 代理的沙箱加速器:micro-VM Devbox、快照與分支、評測與強化微調,可部署到自己的 VPC
Adaline
讓代理自我改善的平台:從正式環境追蹤歸納行為、自動產生評測與合成測資,再把修正推回代理
Recurse
理解整個程式庫的 AI 程式碼審查:抓出破壞性變更與上下游 bug,可接 Claude Code 與 Cursor
Relace
給程式碼代理用的小模型與基礎設施:快速套用修改、程式庫檢索、上下文壓縮,加上代理專用的版本控制