Gemini 3.5 Flash:AI 能自己操作電腦了
原片講者:Google DeepMind
Google 更新 Gemini 3.5 Flash,把「電腦操作」變成模型內建的能力——AI 能看懂畫面、自己點擊打字,跨網頁、手機、桌面把事情做完。這篇帶你看懂它能幹嘛。
🔗 馬上試:Gemini →
這是什麼
Gemini 3.5 Flash 現在把 computer use(電腦操作)變成內建工具。過去這能力要靠獨立的模型,現在直接整進 Flash 主架構。AI agent 能視覺化理解介面、做判斷,然後實際點擊、輸入、導覽、抓取資料。
關鍵能力
- 跨裝置操作:同一套能力橫跨瀏覽器、手機、桌面環境。
- 不只函式呼叫:它會「看著畫面」做事,而不是只靠預設好的 API。
- 內建一整排工具:Google 搜尋、地圖定位、檔案搜尋、跑程式碼、URL 內容、函式呼叫,還能組合使用。
- 企業防護:可要求危險或不可逆動作前先人工確認,並在偵測到惡意提示注入時自動中止。
適合誰
想做「會自己辦事」的 AI agent 的開發者和企業——讓 AI 跨系統把流程跑完,而不只是回答問題。用 Gemini API 或 Gemini Enterprise Agent Platform 就能開始。
小結
這代表主流大模型正式把「動手操作電腦」當成標配,AI 從『回答』走向『代你執行』。