Vibe Coding 準確度是一種量測,不是模型的特性

兩個團隊用同一個模型,結果可能天差地遠,因為你真正在意的那個層次的準確度,取決於生成之後發生了什麼事。有人檢查過嗎?拿什麼來對照?錯誤的結果多快被回報回來修正?

這樣來看,問題就不再是「哪個模型最準」,而是「我的回饋迴圈長什麼樣」,而那是你能掌控的。

值得量測的是什麼

描述的行為有沒有真的發生

  • 這是唯一能在真實使用者面前站得住腳的「正確」定義。

  • 靠實際跑過流程來量測,而不是靠讀程式碼。

昨天能動的今天還能動嗎

  • 過了第一週之後,退化率(regression rate)比第一次就做對的準確度更重要。

  • 大約每五次功能變更,就有一次會弄壞原本正常的東西。

多久才能得到正確的結果

  • 「試幾次才會變綠」比「第一次是過還是不過」更有用。

  • 它反映的是你真正感受到的東西:這個迴圈要花多久。

陷阱:由同一個作者寫出來的測試

量測準確度最直覺的做法,就是讓 agent 自己寫測試,再看看過不過。這樣得到的數字幾乎都很高,卻幾乎沒有意義。測試如果是從跟實作相同的假設生出來的,它在結構上就注定會同意實作,包括兩邊都錯的地方。

準確度量測需要一個獨立的檢查:拿產品去對照它應該有的行為實際跑一遍,而不是對照程式碼自己對自己的認知。

把量測建立起來

在下一輪變更之前,先用白話把定義你產品「正確」的那些流程描述出來,然後拿它們去跑已部署的應用程式。第一次執行給你一條基準線,之後的每一次執行都給你一個退化訊號。

這一切都不需要用到終端機。在 TestSprite 儀表板建立一個專案,用白話描述要檢查的內容,再指向你的應用程式就好。團隊裡的開發者如果偏好命令列,也可以用同一套做法,相關內容就在 CLI 儲存庫

一個值得知道的數據點

在一個讓各家 coding agent 打造同一個應用程式的公開排行榜上,只要搭配驗證迴圈,場上最便宜的模型做出了最正確的應用程式,成本只有最貴那一項的一半。有趣的地方不在排名,而在於迴圈比模型更關鍵,這跟一般談準確度的方式正好相反。

這個數字究竟要拿來做什麼

準確度數字通常是為了回答一個沒人問過的問題而收集的,例如這個模型好不好。真正有用的問題其實更窄:這次變更我可以合併嗎。

這會重新定義量測的方式。你不需要一個涵蓋整個產品的分數,你需要知道的是這次變更有沒有弄壞先前正常的東西。幾個涵蓋關鍵流程的檢查,拿去跑已部署的版本,幾分鐘內就能回答。而一套全面的基準測試,要花上一週回答的是另一個問題。

它也改變了「數字難看」的意義。基準測試上準確度下滑,是個有趣的現象;而某個昨天還能跑、今天卻不能跑的具體流程,是可以立刻動手處理的,真正能擋下問題、不讓它流到使用者手上的,是後者。

讓量測持續進行

一次性的量測只能告訴你某個當下的狀況。準確度是一個持續進行的流程所具備的特性,所以這些檢查應該跟著每一次變更一起跑。

有兩條路可以走,而怎麼選其實是看誰擁有這條管線。從儀表板串接 GitHub App ,完全不需要動到你的儲存庫,因為它是對你的建置流程本來就會產生的部署做出反應。而加上一個 GitHub Actions 步驟,則是把檢查放進儲存庫裡,讓它像建置流程的其他部分一樣接受審查。

把準確度變成你真的會去量測的東西

TestSprite 就是這種量測所需要的獨立檢查。它拿你描述的行為去實際操作你已部署的產品,而不是對照程式碼自己對自己的認知,當實作和測試都出自同一個 agent 時,這正是讓數字有意義的關鍵。

實際做法是:把定義你產品「正確」的那些流程描述一次,之後每一次變更它們都會執行。第一次執行就是你的基準線,之後的每一次執行,回答的都是你真正關心的問題,也就是這次變更有沒有弄壞昨天還正常的東西。

這會給你兩個值得追蹤的數字:每次變更的退化率,以及要試幾次才能回到全綠。迴圈收緊時這兩個數字都會跟著變動,而且都沒辦法靠多寫測試來灌水。

做 Vibe Coding 時,哪個模型最準確?

對多數團隊來說,這是個問錯的問題。有沒有做驗證所造成的差異,比目前各家前沿模型之間的差異還要大。

不寫測試也能量測準確度嗎?

可以。用白話把流程描述出來,讓它們去跑你的應用程式就行。你量測的是行為,而觀察行為並不需要測試程式碼。

準確度數字要多高才算好?

跨產品比較並沒有什麼有用的基準。改成追蹤你自己的趨勢:每次變更的退化率,以及要試幾次才會得到正確的結果。隨著迴圈收緊,這兩個數字都應該往下走。

覆蓋率越高,準確度就越高嗎?

不一定。覆蓋率算的是哪些東西被跑過,而不是那些預期是否正確。一整套生成出來的大量測試,完全可能在錯誤的假設之上回報很高的覆蓋率。

應該多久重新量測一次?

每一次變更,而且要自動執行。照排程量測出來的準確度,反映的是那個排程,而不是那次把東西弄壞的變更。

簡短版

準確度取決於你的迴圈,不是你的模型。

Vibe Coding 準確度是你在自己產品上量測出來的東西:描述的行為有沒有發生、昨天能動的今天還能不能動、多久才能得到正確的結果。用獨立的檢查,而不是同一個作者寫的測試,並且在每一次變更時都量測。