- 講者:Jeremy Lu (@cat88tw)
- 活動:2026-09-05 第六屆「AI 取暖會」
- 內容整合:
1. 上半場:歷時兩年打造的 agentflow 框架,解構 SDD 歷史共業,封裝最佳實踐成「輔具外骨骼肌」,讓用戶無腦出張嘴即可獲取高質量產出。
2. 下半場:重度使用 AI 兩年及在台灣金融業擔任顧問與企業內訓的血淚教訓,揭露人機協作心理陷阱、模型性格缺陷、Eval 體系與企業落地核心心法。
Pit of Success(掉入成功之坑):設計產品最理想的境界,是讓使用者不論怎麼做、甚至「無腦」操作,都能自然而然地步入成功,而不是被迫去克服陡峭的學習曲線。
flowchart TD
A[痛點:一般用戶/企業學員無助] --> B[核心思維:不該讓客戶花時間學習]
B --> C[框架內建 20 年軟體工程經驗]
C --> D[Pit of Success:出張嘴即得 90~95 分]「再叫 AI 順便多做一點、把剩下的 Quota / Token 燒完、等一下我再一起看……」\rightarrow 這就是毀滅的開始!
\rightarrow 這三點都是工程師必須主動提高警覺、堅決抗拒的!
在實戰中,不同能力或家族的模型具有鮮明的「性格特徵」,必須針對性防範:
git diff。git diff:細微的偏差往往就藏在小小的 diff 修改中,初期若未察覺,日後整個架構就會完全歪斜。tracker.md 或 TODO),然後嚴格按表操課。Jeremy 在實戰中將主力工作環境由 Claude 遷移至 Codex,背後有著極其現實的工程與經濟考量:
sol/low 即可滿足 99% 的需求。盲目追求最新、最強、最貴的模型已毫無實質意義。 Prompting(過去) ──► [ Steering 轉向引導 | Review 對抗審查 | Eval 評測基準 | Local LLM 地端化 ](未來)
「只要學得夠慢,就什麼都不用學。」
既然模型具備強大的 plan / decompose / implement 推理解題能力,就不要試圖用規則硬碰硬,而應將框架打造為輔具 / 外骨骼肌(Harness)。
flowchart TD
subgraph Agentflow Harness 基礎設施
A[Context 乾淨隔離] --> D[監督與引導]
B[對抗式審查機制] --> D
C[Invariants 正面檢核] --> D
end
D --> E[外骨骼肌包覆]
E --> F[核心 LLM: 自由發揮 Plan/Decompose/Implement]
F --> G[成果: 避免過度設計、防走偏、防言行不一]graph TD
Devlog["📄 devlog.md<br/>(唯一真實之源 / 溝通介面)"]
Design["📐 design.md<br/>(精簡定義規格 / 企畫共識)"]
Tracker["🧭 tracker.md<br/>(內部狀態外部化 / 進度追蹤)"]
Devlog -->|許願與工作記錄| Devlog
Devlog -->|觸發規劃| Design
Design -->|拆解步驟| Tracker
Tracker -->|長程執行反饋| Devlog/clear):/clear 清空。godev,Agent 便會閱讀 devlog.md 狀態,精準自上次中斷處接續,永不遺失進度。devlog.archive.md,防止上下文無限膨脹。tracker.md。 /goal keep going till tracker is complete
可安心放手讓 Agent 自主執行 8~12 小時。
codex exec、claude -p)處理繁重髒活。3ways 模式:Model A 寫企畫 \rightarrow Model B 審查質疑 \rightarrow 雙方來回交鋒辯論,直到達成共識(Consensus: AGREE),從源頭杜絕走偏。plan-NNN.md,睡前丟給 looper.js 自動化排程執行。傳統第一代 SDD 淪為歷史共業:步驟繁重、循環打轉、執行緩慢、燃燒 Token,產出海量人類讀不完的冗餘文件。Agentflow 的革新策略:
flowchart TD
subgraph 傳統第一代 SDD
Old1[繁複死板步驟] --> Old2[Rubrics 評分制: 自由心證 9-10 分]
Old2 --> Old3[生成海量無效廢話文件]
Old3 --> Old4[Token 暴增且依然漏實作]
end
Old4 ~~~ New1
subgraph Agentflow 新一代 SDD
New1[動態按需觸發] --> New2[正面表列 Invariants 檢核]
New2 --> New3[精確判定: PASS / NEEDS_FIX / BLOCKED]
New3 --> New4[允許動態回退重跑]
endPASS、NEEDS_FIX 或 BLOCKED:| # | 步驟名稱 (`roles`) | 核心任務與產出 |
|---|---|---|
| 1 | requirements | 需求訪談與對齊,生成 requirements.md。 |
| 2 | codewalk | 既有專案(Brownfield)掃描架構脈絡,產出 codewalk.md。 |
| 3 | explore | 探索不確定性與潛在技術風險、架構盲點。 |
| 4 | spike | 針對高風險不確定性快速建立小型 Prototype 驗證假說。 |
| 5 | spec | 將需求規格化,定義不可變條件(Invariants)。 |
| 6 | implementation | 完全放手交由 LLM 發揮編碼實力,只需嚴格達成 Spec。 |
| 7 | security-scan | 基礎或第三方工具資安掃描,防止機敏外洩與高危漏洞。 |
| 8 | acceptance | 依據 Invariants 逐條驗收實作成果。 |
| 9 | cross-check | 實作後的對抗式 Code Review,由獨立 reviewer 審查。 |
| 10 | learn | 記錄所犯錯誤與踩坑經驗,自動回饋更新 Skill 知識庫。 |
在台灣金融業與大型企業內訓諮詢中,面臨著真實殘酷的限制:
\rightarrow 透過 godev 的導引式開發(Guided Development)手把手帶領完成。\rightarrow 框架強制把守 Best Practices 底線。\rightarrow devlog.md + Git 留下完整的稽核軌跡,隨時可追溯、可覆核。面對雲端 API 成本與資料隱私考量,未來的重大佈局在於將推論成本降至原本的 1/10:
# Claude Code 外掛安裝(支援自動更新)
/plugin marketplace add agfnow/agentflow
# 其他環境(Codex 等)透過 Skills 安裝
npx skills add agfnow/agentflow
# 終端啟動與接續
godev
godev:啟動協定、檢查專案狀態或從上次中斷處無縫接續。/clear:清空終端 Context(所有成果都在 devlog.md 中,隨時放心清除)。nolog:此句為純口頭提問,不記錄進 devlog.md。cross-check:強制要求外部獨立 reviewer 審查最後實作 commit。3ways:在重大計畫前啟動跨模型三方交互辯論。all-in:強制此任務執行完整 10 步 SDD Pipeline。/goal keep going till tracker is complete:長程無人值守自主推進任務直到 tracker.md 勾選完畢。1. 放下 Prompt Hacks:模型已足夠聰明,人類只需把需求說清楚,把心力放在 Steering、Review 與 Eval。
2. 學會克制與減法:抵擋燒 Quota 的誘惑,隨時喊停踩煞車;極度重視 git diff,永遠維持防衛性審查。
3. 落入成功之坑(Pit of Success):讓 AI 成為在旁輔助的外骨骼肌,把繁瑣工程防呆全封裝在背後,讓任何人只需出張嘴,就能穩定做出資深水準的軟體作品!