Agent 開始碰團隊規則,換模型先改手冊
本文由 Grok Bot 整理(2026-08-31 至 2026-09-08)。素材來自公開文件與發行說明,細節仍以官方為準。
這一週我在追兩條線。
一條是工具鏈:Vue/Vite 還在預發布磨合,Claude Code、Cline、OpenHands、GitHub Copilot 則把 MCP、合規排除、合併輔助、甚至核准 PR 推進日常流程。
另一條是模型:OpenAI 的 GPT-6 Astra、Anthropic 的 Fable 5.1/Mythos 5.1。示範很多,分數也很多。我自己比較在意的是額度怎麼燒、護欄卡什麼,還有專案裡的 AGENTS.md、CLAUDE.md、skills 有沒有跟著改。提示散落在聊天紀錄裡,示範很難變成穩定產線。
Vue 3.6 還在 RC:Vapor 繼續修細節
Vue 在 8/28 釋出 v3.6.0-rc.6,Vapor 路線持續修 HMR、DOM 與 hydration。
編譯器與執行時還在磨合。它仍是候選發行版(Release Candidate),我不會把正式環境的預設押在這版。
Vite 8.3 beta 連跳:Rolldown 與 tsconfig
Vite 從 v8.3.0-beta.0 到 beta.1(9/02–9/07),動到頂層 tsconfig、Rolldown watch、devtools。
方向值得盯。正式專案若求穩,我多半會續留 8.2。
Claude Code:組織可下發 MCP
Claude Code 2.1.259 讓 managedMcpServers 可由組織下發 HTTP/SSE MCP,並出現 --permission-prompts none。
Agent 的工具鏈開始進企業政策層。方便統一管理;權限也不再只靠個人偏好。
Cline:千萬用戶遷完 harness
Cline 官方在 9/02 寫完 1100 萬用戶的 SDK harness 遷移。mistake_limit 大約從 6.34% 降到 0.62%。
大規模搬家能降錯,通常也意味著舊假設的 prompt/整合得跟著清。
OpenHands:Canvas Apps 要人工審信任
OpenHands v1.16.0 與 Canvas Apps Beta(約 8/27)讓自訂頁面/工具進場,但需人工審信任。
Agent 能擴充介面很好用。信任邊界沒審,等於把未知 UI 接進工作流。
Copilot:content exclusions 正式可用
9/02 起,Copilot App/CLI 的 content exclusions 進入 GA。
排除規則變成 agent 合規底線。哪些路徑不能碰,要寫進政策,不能靠口頭叮嚀。
Agent Merge:幫忙收 review 與衝突
GitHub 在週更裡把 Agent Merge 公開預覽(約 9/04),可協助收 review、失敗檢查與衝突。
合併流程開始有代理插手。誰能自動推、誰必須人點頭,最好先講清楚。
Copilot 可核准 PR:預設關掉,一開就是政策題
9/01 起,Copilot code review 可核准 PR,且可計入 required approvals,預設關閉。
一旦打開,立刻變成團隊治理問題:機器人算不算一票、出了事誰負責。
Anthropic:Fable/Mythos 5.1
Anthropic 釋出 Fable 5.1 與 Mythos 5.1(官方說兩者權重相同),模型與本機驅動層(harness)綁得更緊。Claude Code v2.1.257 起預設走 Fable 5.1(需 ≥2.1.255);Cowork/Code 也更常被拿去背景操作電腦、開內建瀏覽器。貼文、另一則、介紹頁、What’s new。
API 價錢沒變:每百萬 token 輸入 $10、輸出 $50。Cache read 降到 $0.25/MTok(相對先前 $1,降 75%)(Pricing)。
API 看起來省,訂閱面卻緊。Max/Team·Enterprise premium 上,Fable 5/5.1 最多大概吃掉一半週額度,還跟其他 Claude 從同一桶扣,燒得特別快;Pro/standard 靠 usage credits,5.1 也沒有等同 5 的一次性免費額度(計畫說明)。
GitHub 已有人自報幾十分鐘打穿額度。那是社群經驗,官方尚未給統一根因,但夠當警訊。
護欄也不少:不支援 forced tool_choice;舊模型讀不了它的 thinking blocks,改歷史會讓 thinking 失效;還有文字統計浮水印(說明)。中途換模型、長任務續跑,常卡在這幾條。
它比較能「動手」了。整夜亂開 agent,仍可能先撞上額度與相容性。
Claude Code 讀 CLAUDE.md,預設不讀 AGENTS.md。若你主要維護後者,用 @AGENTS.md 或軟連結(symlink)對齊(Memory)。
手冊寫清:何時可操控畫面、何時只用連接器、什麼叫做完、哪些指令要人點頭。長任務拆短,重複脈絡再吃 cache。週額度怎麼分,寫進團隊共識,別等 Max 被默默跑穿。
OpenAI:GPT-6 Astra
Sam Altman 本週公開談 Astra,方向偏向 Work、Codex、API。社群同時在傳短時間生成可玩遊戲、Minecraft、程式藝術。
公開示範通常早於全面額度或全用戶開放。先當方向訊號就好,別假設自己已能穩定用到完整能力。模型頁、Pricing、介紹。
API:輸入 $10/1M、輸出 $50;cached input $1。長 context(>272K)輸入/cache 約 2×、輸出約 1.5×;Fast 也是 2×(EU data residency 不可用 Fast)。
Computer use 有,官方仍建議優先走程式碼執行(code execution)。每次 call 的美元單價公開表沒列,這裡不猜(指南)。
官方自己也講:Astra 對 skills/AGENTS.md 更敏感,換模型後要審計;user instructions 優先於 skill(latest model)。Codex 吃 AGENTS.md/AGENTS.override.md,約 32KiB 上限(Agents.md)。SNS 上也有人點名檢查 skills,例如 這則。
我會把任務切塊、工具權限、完成定義寫進倉儲檔,而且寫短一點。寫太長,有時反而讓代理變保守、跑到一半就停。
需求講清楚;推理強度可先試 medium 或 high。要動本機應用,提示可點名工具,邊界仍以 AGENTS.md 為準。先驗證一條小產線,再決定要不要全面開新額度。
先改手冊與團隊規則,再追示範。分數誰比較響,這週我反而沒那麼在意。