先拆解判定依據,再選擇模型
品質檢測常被簡化成影像分類,但現場的判定通常同時依賴多種資訊。影像回答「看到了什麼」,工單、產品規格與檢驗標準說明「這個品項允許什麼」,設備參數與批次紀錄則補充「它在什麼條件下生產」。人工檢驗員還會運用經驗,判斷反光、遮蔽、取像偏移或規格例外。多模態系統的價值,不是把所有資料塞進同一個大型模型,而是讓每種資料在最合適的位置提供證據。
工程團隊應先定義缺陷類型、可觀察特徵、判定規則與處置方式。例如刮痕可能適合物件偵測或分割,標籤內容需要 OCR 與文字比對,包裝是否符合訂單則要查詢 ERP 或 MES。若連人員也無法只看單張照片做決定,模型同樣不應被要求憑單一影像輸出最終答案。先畫出判定流程,通常比先比較模型排行榜更重要。
以共同資料契約串起影像、文字與系統紀錄
多模態檢測最容易失敗的地方,往往不是模型準確度,而是資料無法正確對應。每一次檢測應建立一筆可追蹤的事件,將產品、工單、站點、時間、影像、模型輸出、適用規格與最終處置連在一起。不要只保存一個「合格/不合格」欄位;一旦發生爭議,團隊必須能重建當時模型看到了什麼、套用了哪個版本的規則,以及人工為何改判。
- 影像層:保存原圖、裁切區域、拍攝設備、光源條件與影像品質檢查結果。
- 文字層:將 OCR 結果、缺陷描述、檢驗規範與工單備註分開儲存,並保留原始文字。
- 業務層:透過產品與批次識別碼查詢 ERP、MES、CRM 或 IoT 平台,取得正確版本的規格與製程背景。
- 判定層:記錄各模型分數、規則命中原因、人工覆核結果、處置狀態及版本資訊。
識別碼與時間戳必須在取像端就建立,避免事後用檔名或上傳順序猜測關聯。若產線網路不穩,邊緣端可先保留事件與檔案,再以冪等方式同步;同一事件重送時,不應產生重複檢驗紀錄。這些看似基礎的整合工作,直接決定系統能否稽核與維運。
讓模型提出證據,由流程決定是否放行
模型輸出最好是結構化證據,而不是一段自由生成的結論。視覺模型可以回傳缺陷類別、位置與信心資訊;OCR 回傳文字及辨識品質;規則引擎再比對料號、日期、允收範圍與必要欄位。若使用視覺語言模型解讀複雜情境,也應要求它引用影像區域與規格條文,並限制輸出格式。這能降低答案難以驗證或無法交由下游系統處理的問題。
自動放行、攔截與人工覆核的門檻,應依風險與錯誤成本設計,而不是共用一個信心分數。安全相關缺陷、不可逆製程或高價物料,通常需要更保守的策略;低風險外觀問題則可容許較多自動化。模型信心也不等於實際正確率,必須用接近正式環境的資料校準,並分產品、相機、站點或缺陷類型觀察。
- 自動放行:必要影像齊全、資料品質正常,且多項證據一致支持合格。
- 自動攔截:明確命中可解釋的硬性規則,或缺陷證據足以觸發既定處置。
- 人工覆核:證據衝突、資料缺漏、影像品質不佳、罕見樣態或接近決策邊界。
覆核介面應把原圖、標記區域、規格、模型理由與歷史紀錄放在同一畫面,讓人員快速完成判定,而不是重新搜尋多套系統。人工可以確認、改判、選擇原因或要求重拍;若沒有結構化的原因碼,後續資料只會累積答案,無法累積可用的工程知識。
把可追溯性與回饋機制當成正式功能
上線後要監控的不只平均準確度。工程團隊還需要追蹤影像品質、資料缺漏、人工覆核量、改判原因、各類缺陷的漏失情形,以及產品或設備變更後的分布漂移。模型、提示詞、規格文件、規則與前處理程式都應有版本;任何判定都必須能對應到當時使用的完整版本組合。
人工改判可以成為改善資料,但不能直接視為絕對真值。檢驗員之間可能有尺度差異,規格也可能含糊或已更新。較可靠的做法是定期整理爭議案例,由品質與工程角色共同確認標註準則,再挑選具代表性的案例進入評估集或訓練流程。對已自動通過的項目也要持續抽樣,否則團隊只能看到模型主動送審的問題,看不到沉默的漏檢。
成熟的多模態檢測系統,本質上是一條可觀測的決策管線:模型負責整理證據,規則控制風險,人員處理模糊地帶,企業系統保存流程結果。若牽涉多個產線系統與既有權限,與熟悉整合工作的團隊一起定義資料契約與例外流程,通常能少走不少彎路。
