
ModelFold 編輯部
我們報道 AI 如何真正落地於企業之中。文章以具名資料來源為起點,清楚區分查證所得與編輯觀點,並依據有文件記錄的編採監控,運用 AI 協助研究及草擬。本刊不能取代個別專家的審閱。
為問責的人工智能計劃提供清晰、以資料來源為本的實用資訊。
以八個邏輯階段及交接合約設計智能文件處理流程,逐一釐清收件、預處理、分類、擷取、驗證、路由、人手覆核與保存的輸入、持久輸出、負責人、推進條件和失敗去向,讓團隊在選擇技術前找出重複處理、證據斷裂、覆核積壓及交付未獲確認等營運缺口。

即使擷取模型讀對每個欄位,整項文件服務仍可能失敗:同一文件被處理兩次、一份結果送錯隊列,系統更可能在目的地真正接收前便顯示完成。生產用智能文件處理不應只圍繞模型準確度設計,而要控制一份可追蹤文件由收件、準備、理解、驗證和覆核,到下游確認、保存及處置的完整生命週期。每次交接都要留下可定位、可解釋及可恢復的狀態,否則局部成功只會掩蓋營運失敗。
設計重點

要把工具組合變成可營運流程,最實用的方法是為每個邏輯階段訂立「階段合約」。合約寫明階段接受甚麼、產生甚麼持久成果、甚麼條件准許推進、失敗時送往哪裏,以及誰對結果負責。收件、預處理、分類、擷取、驗證、路由、人手覆核和保存可以部署在同一服務內,但各自的輸出與控制仍要清楚可見,否則團隊無法判斷錯誤在哪一個交接形成。
收件時應建立穩定文件識別碼,並在獲批准的保存規則下,把收到的原件、必要中間成果、處理版本、驗證結果、路由歷史、覆核紀錄和最終輸出連結起來。這不等於把所有副本無限期保存,而是讓獲授權的人在保存期內回答三個問題:目前哪一個狀態有效、哪項控制改變了結果,以及失敗後應從哪個持久節點安全恢復。
| 階段及負責人 | 可接受輸入 | 持久輸出 | 推進控制及失敗去向 |
|---|---|---|---|
| 收件|渠道及資訊安全負責人 | 獲授權渠道送來的文件、來源資料及處理目的 | 保存原件、文件識別碼、收件憑證、來源資料、重複狀態及初始狀態 | 授權與檔案檢查通過後進入預處理;否則拒收、隔離、要求重交或標記重複 |
| 預處理|文件營運負責人 | 保存原件、文件限制及已批准的轉換設定 | 正規化頁面、原生或OCR文字、版面、質素資料、轉換版本及頁面脈絡 | 質素足夠便進入分類;否則有限度重試、要求重新收件或交專人處理 |
| 分類|分類法負責人 | 正規化頁面、文字、版面及已批准分類法 | 文件或頁面類別、套裝邊界、分類法版本、信心資料及所選擷取綱要 | 已知類別進入擷取;未知、含混或混合類別進入具名隊列 |
| 擷取|綱要及模型負責人 | 已分類頁面及版本化欄位、表格或實體綱要 | 原值、正規化值、類型、遺漏項、處理器版本、可用信心及來源位置 | 成果進入驗證;缺欄、舊綱要或結構錯誤可有限度重試或升級 |
| 驗證|業務規則負責人 | 候選擷取值、來源資料、規則、參考資料及信心政策 | 欄位及文件層面的驗證結果、原因碼、嚴重程度及建議去向 | 合資格者可直通;其餘按原因重試、重新收件、隔離、專人處理或覆核 |
| 路由|工作流程負責人 | 驗證結果、目前狀態、目的地、優先次序及服務政策 | 狀態轉移、原因、目的地、嘗試次數、優先次序及預期確認 | 只准許既定狀態轉移;偵測循環、重複動作、孤兒個案及無聲交付失敗 |
| 人手覆核|隊列及業務負責人 | 原始證據、候選值、來源位置、失敗控制、歷史及獲准操作 | 確認或修訂結果、原因、覆核員身分與時間,以及重新進入流程的狀態 | 確認、修訂、重新收件、升級、拒絕或保留未解決例外 |
| 保存|紀錄、私隱及業務負責人 | 原件與衍生檔、最終輸出、覆核歷史、處理資料及適用政策 | 保存類別、受保護儲存、暫停處置或移交狀態、處置事件及刪除證據 | 按批准規則維持、暫停處置、移交、刪除或把欠缺政策的個案升級 |
這張矩陣不是服務清單,而是跨職能工作坊的核對工具。請營運、資訊安全、私隱、紀錄管理及系統負責人逐格填寫,並要求每個持久輸出都能連回文件識別碼。空白格通常比技術選型更早揭露真正風險:例如只有「出錯便覆核」卻沒有隊列負責人,或寫了「已交付」卻沒有目的地確認。未解決的格子應成為設計決定、風險紀錄或推出前阻擋項。

文件應只經獲授權渠道進入流程,並在任何解析器或模型讀取內容前完成與威脅模型相稱的多層檢查。OWASP 指出,副檔名、上載者提供的內容類型或任何單一驗證都不足以獨立把關。實際合約可包括允許格式、類型及檔案簽章檢查、容量與解壓後大小限制、伺服器產生的儲存名稱、分隔儲存,以及適用的內容掃描;資訊安全團隊仍須決定完整控制組合。
預處理的工作是產生可檢查、可重現的準備包,而不是悄悄改寫唯一副本。旋轉修正、原生PDF解析、OCR、頁面組合、閱讀次序和版面資料都應留下來源脈絡;模糊、昏暗、眩光、內容被截或頁序異常則成為路由證據。質素分析可能誤報,局部眩光亦未必令整頁無法閱讀,因此訊號不能當作絕對判決。若內容根本未被拍攝或已被截去,流程應要求重新收件或記錄例外,不能假裝已修復。

三者必須保持邏輯分明,因為它們回答不同問題:分類判斷這是甚麼文件及頁面邊界在哪裏;擷取依版本化綱要找出欄位、表格或實體;驗證則測試候選結果是否符合已聲明規則。即使部署把分類與擷取放進同一次模型呼叫,輸出仍應分別記錄類別、套裝邊界、分類法版本、所選綱要及可用信心。未知或混合類別要有具名去向,不應被迫套進最相近綱要。
擷取合約應同時保存原始字串與正規化值、聲明類型、表格或實體結構、遺漏項、處理器版本,以及可供核對的頁碼或幾何位置。這些資料讓驗證器分辨「沒有欄位」、「看不清」與「格式不符」,也讓覆核員回到正確來源。惟各工具未必為所有元素提供信心或座標,因此綱要須清楚標明哪些來源脈絡是必要條件,缺少時應走例外路徑而非虛構定位。
驗證通過只表示資料符合已寫下的檢查,不能證明來源文件真實,也不能證明其中陳述在實質上正確。模型信心同樣只是訊號:提高門檻一般會排除更多預測,可能提升精確率但降低召回率。直通處理與覆核門檻須按文件類別、欄位後果、下游用途及代表性標註文件評估,不能照搬供應商示例。涉及法律、臨床、信貸、保險、稅務或其他高後果判斷時,最終權限仍須留給具適當資格的人員。
文件流程的可靠程度,取決於最含糊的那一次交接。

每種結果都應成為狀態機內可命名、可量度及有負責人的去向。直通交付、有限度重試、重新收件、隔離、專人處理、人手覆核和終止例外不能全部塞進一個「錯誤」隊列。每次轉移至少要帶有目前狀態、路由原因、優先次序、嘗試次數、目的地及預期確認,讓營運人員找出循環、孤兒個案、長期飢餓的低優先文件,以及可能造成重複下游動作的重試。
可用的覆核工作包應只向獲授權覆核員提供完成任務所需內容,包括原始頁面、候選值、來源位置、未通過的控制、相關信心訊號、處理歷史及獲准操作。隊列本身亦是控制:必須有負責人、可量度隊齡、足夠處理能力、目標回應時間和未解決個案的升級路徑。若個案無人接手或缺乏證據,人手分支只會把自動化錯誤變成不可見的積壓。
覆核完成後,系統要保存覆核員身分、時間、原因、機器原值、修訂值、最終處置及重新進入流程的結果。人手修訂不應自動視為已批准訓練資料,仍須經質素和管治檢查。交付亦不能以「已發送」作終點:目的地確認接受輸出後才可標記完成;若確認逾時或被拒,流程須記錄具名交付失敗,並以防止重複動作的方式重試或升級。

流程要在擷取及覆核後保持受控,就要把保存、存取、處置、監察和變更管理視為服務的一部分。來源文件、衍生影像、擷取資料、覆核紀錄和營運日誌用途不同,不應自動套用同一保存期或權限。紀錄、私隱、資訊安全、法律及業務負責人須按文件類別、司法管轄區和現行義務,批准元數據、存取、暫停處置、移交、刪除及刪除證據要求;本文不提供通用保存年期。
營運監察要沿文件類別及流程版本切分,至少觀察處理量、目前狀態、各階段延遲、失敗原因、覆核隊齡、修訂模式及下游確認結果。只看整體擷取準確率會掩蓋不同故障:同一延遲可能源於模型、積壓隊列或目的地拒收;修訂率上升亦可能來自新文件版式、舊參考資料或規則變更。每項指標都應連到負責人、服務目標和調查路徑,而非只在儀表板上累積。
任何分類法、預處理方式、模型、擷取綱要、驗證規則或門檻改動,都可能改變下游個案分布,因此應保留版本並以具代表性的文件作推出前評估;測試範圍、批核人及回退準則由本地風險決定。選擇服務或訂立自動化目標前,先用階段矩陣完成一次跨職能審視。若任何階段仍欠負責人、可恢復狀態、可量度服務目標或明確失敗去向,流程便未準備好進入生產。
可用八個邏輯階段規劃:收件、預處理、分類、擷取、驗證、路由、人手覆核及保存。實際部署可以把多個階段放在同一服務,但每個階段的輸入、持久輸出、控制、負責人及失敗去向仍要分明。
分類判斷文件或頁面的類型、套裝邊界及下一步應採用的擷取綱要。擷取則按照該綱要傳回欄位、表格、實體、類型及來源位置;兩者合併執行時,邏輯輸出仍應分開記錄。
人手覆核應是由已界定信心、業務規則、文件質素或後果條件觸發的明確路由,而不是所有錯誤的默認終點。覆核員要取得合適來源證據及清晰權限,隊列亦要有負責人、處理能力、服務目標和升級路徑。
沒有適用於所有文件和欄位的通用數字。團隊須以具代表性的標註文件,按文件類別、欄位後果、下游用途,以及錯誤接受和錯誤拒絕的代價,評估直通處理與覆核門檻。
應分開考慮收到的原件、衍生影像或文字、擷取資料、驗證及覆核歷史、交付結果和營運日誌。保存期、存取、暫停處置、移交、刪除與刪除證據須由相關紀錄、私隱、安全、法律及業務負責人按文件類別和適用義務決定。
本文研究採用了以下資料來源:

我們報道 AI 如何真正落地於企業之中。文章以具名資料來源為起點,清楚區分查證所得與編輯觀點,並依據有文件記錄的編採監控,運用 AI 協助研究及草擬。本刊不能取代個別專家的審閱。

一套為香港營運、流程設計及內部監控團隊而寫的實務方法:先以真實個案繪出現況,分類偏差,逐一檢驗審批目的與授權,訂明交接驗收及復原安排,再把每個步驟歸入刪除、標準化、釐清或保留人手覆核,避免把舊有含糊之處更快地搬入規則、機械人或人工智能系統。

一套給產品經理、業務分析員與流程負責人的實地研究方法:先界定由觸發至交付的工作範圍,再結合近期個案訪談、情境觀察、工作成品、短期日誌及營運紀錄,分辨主觀困擾與反覆出現的流程制約,保留反證與未知之處,最後比較人工智能、規則、責任重整、流程改善、培訓、改善資料與不介入,決定下一個最小測試。

由一個有明確邊界的商業工作流程出發,逐步建立涵蓋日常任務、關鍵邊界、已知失誤與禁止行為的情境評估集,並以可重現案例、合適評分方法、評審校準、預先設定的切片與閘門、持續版本管理和曝露追蹤,以及分開管理的開發集和受保護發布測試,為模型、提示、檢索、工具與政策改動提供可比較而不誇大的發布證據。