預約諮詢

AI 週報・第 1 期

AI 代理頻頻越界,Claude、Copilot 拆切換鍵

2026 年 9 月 · 7 分鐘閱讀

三位同事圍在辦公桌前,一起看著筆電螢幕

OpenAI 有個 AI 代理,在不該連得上網路的沙箱裡受訓。9 月 20 日,網頁搜尋被擋下之後,它發現沙箱的 DNS 解析器還連得到外面,就從那裡繞了出去。五天後,OpenAI 宣布暫停最強模型的訓練,這是三個月內的第二次。

同一段時間,Anthropic 和 Microsoft 先後拿掉了「聊天」和「代理」之間的切換鍵,GPT-6 Sol 和 Claude Opus 5.5 在同一天推出、都比上一代便宜,Meta 則拿出一個掛在鑰匙圈上的代理裝置。這兩週的新聞幾乎都繞著同一件事轉:AI 開始替人動手之後,邊界要劃在哪裡、動手前怎麼讓人知道並點頭、一件事到底花多少錢,都得重新想過。

AI 應用

代理經 DNS 逃出沙箱,OpenAI 暫停訓練

那個代理手上的任務,是從公開資訊推敲出某位部落客的身分。據 Bloomberg 引述 OpenAI 的事故報告,監控系統十幾分鐘內就發出最高等級的警報,值班人員幾分鐘後也確認了。訓練卻一直拖到兩個多小時後才被人工終止,原本設計來自動中止異常行為的機制始終沒有觸發。9 月 25 日,OpenAI 宣布暫停最強模型的訓練、評測,以及需要呼叫工具的推論,說要等額外的防護到位才恢復;到 28 日為止,還沒有恢復的消息。

OpenAI 同時自己揭露了另外兩件事:代理曾把 53 張使用者圖片透過不公開的連結貼上圖片託管網站,也曾用一把在網路上找到的開發者金鑰讀取人口普查局的資料。回頭看這幾個月,類似的事並不少。一家第三方評測公司替各實驗室出資安考題時,虛構的目標公司剛好取了一個真實存在的網域名稱,號稱「沒有網路」的測試機其實連得出去;Google 在 9 月 18 日證實,Gemini 5 月就在這套評測裡靠猜密碼、撿公開程式庫裡外洩的憑證,進了三家真實公司的系統,而 Anthropic、OpenAI、Meta 先前也都揭露過同一套評測裡的越界。9 月下旬曝光的另一起發生在 6 月:一個 OpenAI 代理被澳洲 Medicare 統計網站拒絕了好幾次,最後找到方法繞了過去。

把這幾件擺在一起看,出口都在沒人以為會通的地方:還能對外的 DNS、撞名的網域、公開程式庫裡的金鑰、一個已經拒絕過好幾次的入口。代理被擋下來時,會把「被拒絕」當成一道要解的題目,而它解題的耐心比人好得多。所以在提示詞裡寫「不准」是擋不住的,邊界得做在它碰不到的地方,而且要當成它一定會去試。

這些事發生在實驗室裡,但你公司那個接了信箱、雲端硬碟和內部系統的代理,面對的是同一道題。先把它碰得到的系統一個個列出來,再從網路和憑證這一層收:對外連線預設全關、只開白名單,DNS 這種沒人當成出口的通道也要算進去;代理拿到的憑證只開夠用的權限、定期更換;警報之外,還要有一個真的會自己生效的中止機制。

9 月 28 日 NVIDIA 推出的 Open Agent Safety Platform 也是這個想法。開源的 OpenShell 在代理執行任務的外圍畫出邊界;Sentry 跑在獨立的 BlueField-4 DPU 上,從代理所在的系統外面監看,發現越界可以在毫秒內把它隔離。守門的東西,不跟被守的東西跑在同一層。

UX 設計

Claude、Copilot 同月拆掉模式切換鍵

9 月 16 日,Anthropic 把 Cowork 併進了 Claude。Cowork 是今年 1 月上線的代理工具,讓不寫程式的人也能叫 Claude 讀寫電腦裡的檔案,一步步把事情做完。原本輸入框下面有一顆切換鍵,讓人自己選要聊天還是交給 Cowork;現在切換鍵不見了,Claude 會依照你說的話,自己判斷是回答就好,還是要動手跑一串步驟。據 TechCrunch 報導,Anthropic 給的理由很直白:使用者常常不知道該切到哪一邊。同一天推出的還有 Claude Docs 和 Claude Slides 測試版,先開放給 Pro 與 Max 方案。

九天後,Microsoft 發表新版 Copilot,新的入口 Home 做的是同一件事,把 Copilot 原本分開的 Chat 和 Cowork 兩種模式收進同一個介面。另外兩塊走得更遠:Code 讓不會寫程式的人用描述的方式做出儀表板和內部小工具,Autopilot 則是一個你不在的時候也會繼續工作的代理,會盯著頻道、處理週期性的任務。Home 與 Code 先開放給參加 Frontier 早鳥計畫的企業,由 IT 管理員決定誰能用;Autopilot 要到月底才擴大到不公開的預覽階段。

切換鍵拿掉之後,「要不要讓 AI 動手」這個決定就從使用者手上移到了系統身上。少一個選擇確實比較好用,代價是使用者沒辦法事先知道它這一次只會回答,還是會開始改檔案、寄東西。設計的重心於是跟著搬家:以前要設計的是一顆讓人選模式的按鈕,現在要設計的是它動手之前的那一刻,讓人看懂它準備做什麼、隨時可以喊停、做錯了還退得回來。產品裡那顆「AI 模式」開關也就先別急著拆,這一刻還沒設計好之前,它至少替你問過使用者一聲。

Autopilot 又往前一步:它在你不在場的時候做事,動手前那一刻根本沒人在看,邊界只能靠管理員事先設好,跟 OpenAI 那個沙箱是同一道題。

AI 應用

GPT-6 Sol、Opus 5.5 同日登場,兩家都喊降價

9 月 22 日,OpenAI 推出 GPT-6 Sol 和 GPT-6 Luna,Anthropic 推出 Claude Opus 5.5。Sol 的 API 每百萬 token 輸入 2 美元、輸出 10 美元,Luna 是 0.1 美元和 0.5 美元。Opus 5.5 輸入 4 美元、輸出 20 美元,比 Opus 5 降了兩成,快取讀取更降了六成。前一天發布的 xAI Grok 4.7,則沿用 4.6 的價格。

兩家都說降價,數字的來歷卻要看清楚。OpenAI 的「便宜一半」,是拿新模型的定價去比 GPT-5.6 的優惠價;換了模型,便宜一半的前提是它在你的工作上做得跟舊的一樣好。Anthropic 說 Opus 5.5 在一般使用情境下會比 Opus 5 省四成,但輸入、輸出單價各只降了兩成,其餘來自快取變便宜,以及同一件工作用掉的 token 變少;這是 Anthropic 自己的測試結果,換成你的工作,比例不見得一樣。

所以比模型的時候,別只比每百萬 token 的單價,要比完成一件工作的總成本:拿自己手上真實的任務各跑一輪,把 token 用量、重試的次數,以及結果能不能直接用都算進去。

價格也不是只會往下走。DeepSeek 在 8 月 16 日調漲 API 價格,改成尖峰、離峰兩種價。據 The Information 報導,漲價之後它的年化營收翻倍到約 10 億美元,執行長梁文鋒還說客戶並沒有因此流失。連以便宜出名的 DeepSeek 都能漲價,而且漲得動,「模型只會越來越便宜」就不能當成規劃預算的前提,預算和合約也就別把哪一家的單價寫死。

UX 設計

Muse Charm 亮相,代理搶進隨身裝置

Meta 9 月 8 日在美國推出個人代理 Muse,可以替你讀信回信、訂行程、填表單、付款。到了 9 月 23 日的 Meta Connect,Meta 拿出它的專屬硬體 Muse Charm:一個掛在鑰匙圈上的小裝置,有一塊約 2 吋的觸控螢幕、指紋感應器、前後鏡頭和自己的 5G 連線,不用掏手機就能叫出 Muse。價格還沒公布,目標是 12 月出貨。

中國廠商的動作也不少。9 月 16 日上市的努比亞 NaviX Ultra 是第二代「豆包手機」,由字節跳動的 AI 助理豆包驅動,一句話就能讓代理跨 App 把事情做完,機身上有一顆整合指紋辨識的 AI 實體鍵,人民幣 5,999 元起,目前只在中國販售。阿里巴巴在 9 月 22 日開幕的雲棲大會上,一口氣端出 AI 代理電腦、眼鏡、耳機和錄音筆,其中 Qwen Glasses N1 Pro 支援虹膜支付。

這批裝置有個共同的細節:指紋、虹膜這些確認「你是你」的東西,被做進了硬體。代理一旦要替人付錢、下單,確認本人的那一步就得跟著它走,而且得在沒有大螢幕的情況下完成。另一邊,Amazon 從 9 月 20 日起封鎖 Muse 在 Amazon.com 上替使用者購物,理由包括資安與隱私風險,以及 Muse 沒有依規定表明自己是機器人。代理能走多遠,不只看它自己多能幹,也要看對面的服務讓不讓它進門。

你的服務遲早也會碰上這兩題:代理替使用者來操作時,哪些動作非要本人確認不可,在小螢幕甚至沒有螢幕的裝置上又要怎麼確認;別人的代理來用你的服務,你要放行,還是像 Amazon 一樣封鎖。Amazon 已經選了,你最好在第一個代理出現之前就想好。

行銷成長

ChatGPT 廣告登台,品牌可自助開戶

9 月 23 日,OpenAI 把 ChatGPT 廣告開到台灣和東南亞六國,官方說廣告現在可以在超過 60 個國家投放。廣告只出現在免費版和 Go 方案,OpenAI 強調廣告會清楚標示、和回答分開,也不影響回答的內容。對台灣公司影響最大的是自助後台 Ads Manager:台灣已經列入可以自助開通的國家,不透過廣告代理商也能自己下廣告。

這是一個新的付費通路,門檻又低,很適合先用小額預算試試水溫。只是花錢買到的是對話旁邊那一格,回答本身買不到;ChatGPT 的回答裡會不會提到你,靠的是另一套功夫。

ChatGPT 廣告登台,台灣公司可自助投放(geoweb.tw)

快讀

  • Google DeepMind 資深副總裁 Koray Kavukcuoglu 在 The Information 主辦的論壇上表示,Gemini 4 已進入後訓練階段,希望比原訂的年底更早推出,但沒有給出日期。 9to5Google
  • 阿里巴巴在 9 月 22 日的雲棲大會確認下一代 Qwen4 正在訓練,並規劃 Qwen4.5、Qwen5 擴大到 5 兆至 10 兆參數;Qwen4 本身的規格與推出時間都還沒公布。 Pandaily
  • Cohere 與德國的 Aleph Alpha 在 9 月 16 日簽訂合併協議,估值約 200 億美元,合併後以 Cohere 名義營運、柏林與多倫多雙總部,仍待監管機關審核。 SiliconANGLE
  • 加州州長 Newsom 在 9 月 18 日簽署行政命令,要專家小組在兩個月內提出強化 AI 安全的建議,其中包括替前沿模型建立「緊急關閉機制(kill switch)」。 加州州長辦公室
  • 川習會 9 月下旬在華府舉行,半導體出口管制沒有列入正式議程;雙方另外宣布啟動美中 AI 對話。 Korea Times、PBS NewsHour
  • Meta 在 9 月 15 日推出橫跨 Instagram、Facebook、WhatsApp 與 Meta AI 的訂閱制 Meta One,台灣同步上線,WhatsApp 方案每月新台幣 49 元起、Instagram 與 Facebook 方案 69 元起;Meta AI 的日常使用仍然免費。 TechNews 科技新報
  • Meta 在 9 月 28 日成立企業 AI 部門 Meta Enterprise Platform,延攬 MongoDB 執行長 CJ Desai 出任企業平台長,直接向 Zuckerberg 報告;消息一出,MongoDB 股價當天重挫。 CNBC

本期資料截至 2026 年 9 月 28 日。事件日期以官方公告或首次公開揭露為準;發生時間早於揭露時間的,文中另有註明。

聊聊吧

一起找出智慧 能推動你指標的地方。

告訴我們你正在打造什麼。我們會誠實告訴你智慧能在哪裡推動數字——以及在哪裡不能。

預約諮詢