長期以來,大型語言模型(LLM)像是被關在象牙塔裡的智者,雖然擁有博學的知識,卻難以直接干預現實世界的數位操作。當我們要求 AI 幫忙規劃旅行時,它能提供極具參考價值的建議,但若要進一步下訂機票或確認旅館的即時空房狀態,往往仍需人類介入。然而,隨著 OpenAI Agents SDK 與 Playwright MCP(模型上下文協定)的整合,這種「看得到、做不到」的困境正在被打破。

這項技術開發的核心,是將 Playwright 這款原本用於軟體自動化測試的工具,轉化為 AI 的「眼睛」與「手」。透過 MCP 協定,開發者能建立起一座橋樑,讓 OpenAI 的代理人不僅能閱讀網頁的 HTML 原始碼,還能理解頁面的視覺結構、點擊按鈕、填寫表單,甚至處理複雜的動態載入內容。這與傳統的網頁爬蟲(Web Scraping)有本質上的不同:傳統爬蟲通常是靜態且脆弱的,而結合了 LLM 的瀏覽代理人則具備推理能力,能根據網頁上的即時回饋動態調整下一步行動,模擬人類的瀏覽行為。

這項進展對技術與產業層面帶來了顯著影響。首先,它大幅降低了企業流程自動化的門檻。許多企業內部的舊有系統(Legacy Systems)缺乏標準的 API 介面,過去要串接這些資料往往耗時費力;現在,只要 AI 能像人類一樣「看懂」網頁介面並進行操作,就能輕鬆整合原本封閉的業務流程。其次,這也推動了「行動導向 AI」的普及,讓 AI 從單純的諮詢對象,轉型為能真正執行具體任務的數位員工,大幅提升辦公室自動化的天花板。

這個發展之所以值得台灣技術圈關注,是因為它解決了 LLM 最核心的短板:時效性與操作權限。即使是最先進的模型,其訓練資料也總有截止日,而賦予瀏覽器操作權限,等同於給了 AI 一把開啟現實世界即時資訊大門的鑰匙。更重要的是,這代表著軟體開發模式的轉移。未來,開發者可能不再需要為每一個細微的功能撰寫冗長的邏輯判斷,而是定義好目標,讓具備瀏覽能力的代理人自主在網路上尋找路徑。這種從「程式指令驅動」到「目標任務驅動」的轉變,將會重新定義我們與電腦互動的方式,也讓 AI 代理人真正成為具備實戰價值的生產力工具。