精華筆記

· @aihub.tw

AI

Gemini 3.5 Flash:AI 能自己操作電腦了

原片講者:Google DeepMind

0:00 / 0:00

Google 更新 Gemini 3.5 Flash,把「電腦操作」變成模型內建的能力——AI 能看懂畫面、自己點擊打字,跨網頁、手機、桌面把事情做完。這篇帶你看懂它能幹嘛。

🔗 馬上試:Gemini

這是什麼

Gemini 3.5 Flash 現在把 computer use(電腦操作)變成內建工具。過去這能力要靠獨立的模型,現在直接整進 Flash 主架構。AI agent 能視覺化理解介面、做判斷,然後實際點擊、輸入、導覽、抓取資料。

關鍵能力

  • 跨裝置操作:同一套能力橫跨瀏覽器、手機、桌面環境。
  • 不只函式呼叫:它會「看著畫面」做事,而不是只靠預設好的 API。
  • 內建一整排工具:Google 搜尋、地圖定位、檔案搜尋、跑程式碼、URL 內容、函式呼叫,還能組合使用。
  • 企業防護:可要求危險或不可逆動作前先人工確認,並在偵測到惡意提示注入時自動中止。

適合誰

想做「會自己辦事」的 AI agent 的開發者和企業——讓 AI 跨系統把流程跑完,而不只是回答問題。用 Gemini API 或 Gemini Enterprise Agent Platform 就能開始。

小結

這代表主流大模型正式把「動手操作電腦」當成標配,AI 從『回答』走向『代你執行』。

#AI工具#Gemini#Google#AIagent

原片來源:https://gemini.google.com

← 回所有文章