translate-book:8 個平行 subagent 翻譯整本書的一致性設計
一本三百頁的技術書、只有英文版。整份 PDF 丟給模型,先撞到的不是翻譯品質,是 context 長度與輸出截斷。退一步自己寫腳本逐段呼叫 API,但每次呼叫都是一張白紙——第 3 段把某個人名譯成「泰」,第 47 段完全不知道這件事,於是同一個人在一本書裡有三個名字。
一本三百頁的技術書、只有英文版。整份 PDF 丟給模型,先撞到的不是翻譯品質,是 context 長度與輸出截斷。退一步自己寫腳本逐段呼叫 API,但每次呼叫都是一張白紙——第 3 段把某個人名譯成「泰」,第 47 段完全不知道這件事,於是同一個人在一本書裡有三個名字。
RAG 管線最脆弱的一段幾乎都在最前面。把 PDF 丟給抽取器、把網頁丟給 readability,出來的是一串沒有版面的純文字:表格欄位被攤成一行、圖表只剩 caption、流程圖直接消失、掃描件根本沒有文字層可抽。後面的切塊、嵌入、檢索做得再精細,也補不回第一步就丟掉的東西。
把一支 GitHub 個人存取權杖塞進 agent 的系統提示裡,然後叫它「幫我看一下 PR」,demo 階段跑得很順。問題在下一步:那支權杖從此就在 context window 裡,而 context window 是 agent 讀進來的每一段外部文字都能影響的地方。一則 issue 內文、一段網頁摘錄、一個檔名…
畫雲端架構圖的選項一直很兩極。要嘛用 draw.io 這種 2D 框線圖,快但層級關係要靠讀者自己想像;要嘛用 Cloudcraft 這類等角(isometric)工具,圖漂亮、分區一眼可辨,但它是 SaaS,圖存在別人的帳號裡,超出免費額度就開始按月收費。畫的是內網網段、機房配置、客戶正式環境拓樸的話,第二個選項的問…
這個站上已經有四篇在講「讓模型幫你畫架構圖」的工具,四篇的結局都一樣:跑完指令,拿到一張圖,圖進了文件庫,然後就開始腐爛。靜態圖的問題不是畫得醜,是它沒有辦法回答第二個問題——這條請求到底經過哪幾個元件、這次 PR 動了架構的哪裡、圖上這個 AuthService 在原始碼裡真的存在嗎。
驗證自家 bot management 規則的時候會遇到一個尷尬的處境:手上最方便的測試客戶端是 Playwright,但 Playwright 一連進去就被 challenge 擋掉。擋掉這件事本身不是好消息——它只證明規則認得出 navigator.webdriver,沒有告訴你規則對「一個看起來完全像真人的瀏覽器…
讓 agent 反覆跑起來從來不是難題,難的是讓它在該停的時候停、在該被檢查的時候真的被檢查。多數人的第一版迴圈長得像 while true: 叫模型改一次,跑十分鐘燒掉幾十萬 token,最後產出物跟第三輪沒有實質差異,也沒有紀錄可以回溯是哪一輪開始原地打轉。
手邊有一支跑了三年的 Python 批次腳本,功能是把客戶上傳的 CSV 對帳、算出差異、輸出報表。原本就是 input() 問幾個參數、print() 吐結果,工程師自己在終端跑得很順。問題出在營運同事也想用——他們不會開終端,不會裝 Python,更不會處理 pip 相依衝突。這種「腳本本身沒問題,只是缺一個能給人…
用 agent 寫程式最難處理的不是它寫不出來,而是它說寫完了。跑完一輪 fan-out,五個子 agent 全部回報 exit 0;打開來看,有兩個 lane 改到同一個檔案,一個把測試註解掉,還有一個只印出「已完成實作」就結束。exit code 是行程的狀態,不是結果的狀態,但大多數 harness 把這兩件事印…
過去幾個月本站陸續拆過幾個 skill 集合:addyosmani/agent-skills 那 20 個不可跳過的審慎守則、以及 Antigravity Awesome Skills 那個 1200+ 條目的巨型技能庫。那些文章的角度都是「有什麼可以裝」,回答的是選型問題。