谷歌DeepMind推出手語轉文本功能,拓展人工智能和搜索服務。
Google DeepMind 發佈了一款名爲 SL2T 的手語轉文本模型,它將集成到新款 Pixel 11 的 Gboard 和 Live Transcribe 功能中。.
該 公司稱, 這是首款應用於真正消費產品的手語人工智能技術。
用手機簽名而不是打字
能聽會說的人多年來一直能夠使用語音輸入功能與設備進行對話。.
現在,即使無法用語音輸入進行語音輸入,但可以使用手語的人,也可以通過 SL2T 使用他們的 Pixel 11 設備與互聯網互動、撰寫信息或編輯文檔。.
簽署者也可以將任務交給雙子座。
在實時轉錄功能中,用戶可以在面對面交談時簽名回覆,而不是敲擊鍵盤。.
目前,該模型僅支持美國手語(ASL)到英語的翻譯。谷歌表示,未來該模型將推廣到更多設備,並支持更多語言。.
據報道,模型測試人員表示,用美國手語打字比用英語打字更快、更自然。.
爲什麼人工智能處理手語比處理語音更難?
DeepMind 將手語視爲完整的自然語言,而不是“用手錶達的英語”。
然而,與口語人工智能相比,它的發展一直較爲滯後,這主要是由於兩個挑戰。.
首先,手語有其自身的語法和詞彙,因此係統必須對其進行翻譯而不是轉錄。此外,手語同時通過手、臂、軀幹、頭部和麪部來傳達含義,這對於計算機視覺來說是一個極具挑戰性的難題,需要精確 trac這些動作。.
此前也有人嘗試開發這類解決方案,但大多數都失敗了。其中一種方案——手語手套——失敗的部分原因是它只讀取手形,而忽略了身體的其他部分。SL2T 的設計初衷就是爲了同時處理視覺感知和翻譯。.
該模型如何處理視頻和隱私問題
SL2T 不會將原始視頻素材發送到雲端。其設備端的計算機視覺組件 MediaPipe Holistic 會將手語者的面部、手部、手臂和軀幹映射到幾何座標系中,只有這些座標會被髮送到谷歌的服務器。DeepMind 表示,這樣可以將實際視頻保留在手機上,從而加快處理速度。.
該模型直接將這些地標序列翻譯成文本,跳過了被稱爲註釋的中間標籤。DeepMind 指出,註釋會限制詞匯量,並且會遺漏美國手語所依賴的非手勢標記和空間語法。.
谷歌使用超過 10 萬小時、涵蓋 50 多種手語的數據訓練了 SL2T 模型,其中約四分之一是美國手語 (ASL)。該模型在 FLEURS-ASL 基準測試中獲得了 70 分(BLEURT)。此外,該模型還支持單手和左手手語,並進行了延遲優化,同時還具備防止攝像頭捕捉到非手語動作時出現文字誤讀的機制。.
谷歌圍繞此次發佈會正在構建什麼?
谷歌已成立一個由聾人組織和手語專家組成的AI手語諮詢委員會,以指導該技術的部署,該委員會將共同撰寫一份報告,說明該模型目前能做什麼和不能做什麼。.
接下來,我們將增加更多手語和能夠生成手語而不僅僅是讀取手語的模型。.
消費者版的發佈已經醞釀了一段時間。Android Authority 發現了 手語轉文本選項,此前 DeepMind 曾預告過一款名爲 SignGemma 的手語模型。
此次發佈正值DeepMind經歷一段動盪時期。2026年8月初, Demis Hassabis 從DeepMind首席執行官轉任董事長,Koray Kavukcuoglu接管日常運營,而Gemini應用程序的月活躍用戶已超過9.5億。
最頂尖的加密貨幣專家都在閱讀我們的簡報。想 加入他們?











