Agentic Reliability Engineering

第一章
為何可靠性必須演進

本章為最終書稿的第一部分。請注意,GitHub 儲存庫將於稍後正式啟用。
若您願意實際參與本草稿的審閱與意見回饋,請與編輯聯繫:jleonard@oreilly.com

人力步調可靠性的結構性極限、任何代理系統所仰賴的可觀測性,以及將失敗轉化為系統學習訊號的韌性迴圈——這正是接下來三章要探討的內容。

序言已經說明了本書所描述的這門學科為何在此刻興起。第一部分則要論證:在此之前存在的各種學科,已經無法承接接下來即將到來的工作量。三個章節依序完成這項論證,每一章都會建立起一個貫穿全書、後續章節會不斷回頭引用的基礎。

第一章是診斷章。開場是一位資深的待命工程師在凌晨三點,盡其職責所能地處理一套已經成長到超出這個角色所能負荷的系統。本章主張:SRE 過去幾年一直在頂撞的那道天花板,並非工具的天花板、流程的天花板,也不是人力招募的天花板。那是一道「認知天花板」,而再多的自動化都無法移除它,因為自動化擴展的是「執行」,不是「判斷」。本章確立了貫穿全書的重心轉移,並為這門學科命名:當迴圈核心的行動者不再永遠是人類時,SRE 就演變成了「代理式可靠性工程」(Agentic Reliability Engineering,簡稱 ARE)。人類則移到迴圈之上,負責設計意圖、驗證結果。可靠性的衡量標準,不再只是正常運行時間,還包括系統在通往那個正常運行時間過程中所做決策的品質。本書中被反覆引用最多的兩個概念,也在第一章登場:「自主邊界」(autonomy boundary)與「迴圈之上的人類」(above-the-loop human)。

第二章是基質章。在後續章節談論代理如何推理、行動、自我治理之前,必須先誠實回答一個問題:它們究竟是根據什麼進行推理的?今日的可觀測性堆疊是為了供人類判讀而建構的,這一點反映在它的每一項設計選擇上:為視覺模式辨識而優化的儀表板、依人類注意力預算調校的告警閾值、以散文寫成的操作手冊。當代理讀取同樣的資料時,表現得就像一位極為聰明的新人第一天上班——技術能力足夠,卻缺乏能讓資料真正產生意義的組織脈絡。第二章確立了「決策級遙測」(decision-grade telemetry)的概念:從一開始就設計為供「必須做決策」的對象使用,而非僅供「必須用眼睛看」的對象使用的訊號。本章具體指出這在實務上意味著什麼:語意豐富化、將依賴關係圖視為第一等資料、將所有權與意圖視為結構化的模式(schema)而非維基頁面。章末所設下的標準,正是第二部分每一個工作流程章節都要仰賴的門檻。

第三章是迴圈章。有了第一章命名的認知天花板,以及第二章命名的基質,第三章加入了將基質轉化為行動的運作迴圈:偵測、推理、行動、學習(Detect, Reason, Act, Learn,簡稱 DRAL)。DRAL 迴圈是第二部分每一章都會回頭引用的架構原型。後續每一個工作流程章節都會對應迴圈中的某一個環節,並展開它所要求的操作紀律。第三章也確立了五項旗艦級代理式 SLO(ARR、DQ-SLO、RL-SLO、AE-SLO 與 CE),用以衡量迴圈是否依照設計運作。傳統意義上的 SLO 並未因此消失,而是與這些衡量系統「推理」而非僅僅衡量「輸出」的新 SLO 並存,本章也仔細說明了每一項 SLO 各自回答什麼問題。

本部分一開始就值得說明的結構性特質是:第一部分並非宣言,而是全書賴以建立的地基,三個章節之所以佔有其位置,是因為它們為後續內容提供了承重的基礎。沒有第一章對意圖與自主性的詞彙,第四章就無法建立四個平面;沒有第二章對決策級遙測的概念,第五章就無法描述事故應變流程。第二部分的每一個工作流程章節,開頭都會指向第三章 DRAL 迴圈中的某一環節。依序閱讀,第一部分的三個章節會築起地基;跳著讀,全書其餘部分將不斷在這些缺口上絆倒。

到第一部分結束時,有一項主張應當已經確立:代理式可靠性工程並不是團隊疊加在既有 SRE 實務之上、用來加快速度的東西。而是當「判斷」而非「執行」成為瓶頸時,SRE 演變而成的樣貌,而通往這裡的學科,始於系統如何感知、如何學習,以及它如何贏得最終被授予的自主性。接下來要談的是架構。第二部分,正是這門學科開始運作之處。