tradingkey.logo
tradingkey.logo
Pesquisar

O Google DeepMind expande o acesso à IA e às buscas com o lançamento de conversão de linguagem de sinais em texto

Cryptopolitan12 de ago de 2026 às 19:25
facebooktwitterlinkedin
Ver todos os comentários0

O Google DeepMind lançou um modelo de conversão de linguagem gestual em texto chamado SL2T, que estará integrado ao Gboard e ao Live Transcribe no novo Pixel 11. 

A empresa afirma ser a primeira IA de linguagem gestual a ser lançada em um produto comercial real. 

Assinar pelo telefone em vez de digitar

Pessoas que conseguem ouvir e falar têm usado a digitação por voz para interagir com seus dispositivos há anos. 

Agora, aqueles que não conseguem se comunicar por meio de ditado por voz, mas usam a língua de sinais, podem interagir com a internet, redigir mensagens ou editar documentos usando seus dispositivos Pixel 11, graças ao SL2T. 

Os signatários também podem delegar uma tarefa a Gêmeos 

Na transcrição ao vivo, o usuário pode assinar uma resposta durante uma conversa presencial, em vez de digitá-la.

Atualmente, o modelo suporta apenas a tradução da Língua de Sinais Americana (ASL) para o inglês. O Google afirma que o modelo será disponibilizado para mais dispositivos no futuro, juntamente com mais idiomas.

Segundo relatos, os participantes dos testes descreveram a linguagem de sinais americana (ASL) como mais rápida e natural do que digitar em inglês.

Por que a linguagem de sinais é mais difícil para a IA do que a fala?

A DeepMind considera as línguas de sinais como línguas naturais plenas, e não como "inglês nas mãos" 

No entanto, seu desenvolvimento tem ficado atrás em comparação com a IA de linguagem falada, principalmente devido a dois desafios.

A primeira questão é que as línguas de sinais têm gramática e vocabulário próprios, então o sistema precisa traduzi-las em vez de transcrevê-las. Elas também transmitem significado simultaneamente por meio das mãos, braços, tronco, cabeça e rosto, o que representa um desafio complexo para a visão computacional, que precisa traccom precisão.

Já houve tentativas anteriores de desenvolver essas soluções, mas a maioria falhou. Uma delas, as luvas de linguagem de sinais, falhou em parte porque lia apenas os formatos das mãos e ignorava o resto do corpo. O SL2T foi desenvolvido para lidar tanto com a percepção visual quanto com a tradução.

Como o modelo lida com vídeo e privacidade

O SL2T não envia imagens brutas para a nuvem. Um componente de visão computacional integrado ao dispositivo, chamado MediaPipe Holistic, mapeia o rosto, as mãos, os braços e o tronco do usuário em coordenadas geométricas, e somente essas coordenadas são enviadas para os servidores do Google. A DeepMind afirma que isso mantém o vídeo original no telefone e torna o processo mais rápido.

O modelo traduz essas sequências de pontos de referência diretamente em texto, ignorando os rótulos intermediários conhecidos como glossários. De acordo com a DeepMind, os glossários limitam o vocabulário e não incluem os marcadores não manuais e a gramática espacial nos quais a ASL se baseia. 

O Google treinou o SL2T com mais de 100.000 horas de dados abrangendo mais de 50 línguas de sinais, sendo cerca de um quarto em ASL (Língua de Sinais Americana), e registrou uma pontuação de 70 BLEURT no benchmark FLEURS-ASL. O modelo também suporta sinais com uma mão e com a mão esquerda, inclui otimizações de latência e possui mecanismos para evitar que ele interprete erroneamente o texto quando a câmera captura movimentos que não sejam sinais.

O que o Google está desenvolvendo em torno do lançamento?

O Google criou um Comitê Consultivo de IA para Língua de Sinais com organizações de surdos e especialistas em língua de sinais para orientar a implementação da tecnologia, e o comitê será coautor de um relatório sobre o que o modelo pode e ainda não pode fazer. 

O próximo passo no planejamento é a adição de mais línguas de sinais e modelos que geram linguagem de sinais em vez de apenas lê-la.

O lançamento para o consumidor já vinha sendo preparado há algum tempo. O Android Authority descobriu uma opção de conversão de sinais em texto dentro de uma versão beta do Gboard em 17 de julho de 2026, depois que a DeepMind havia divulgado anteriormente um modelo de linguagem de sinais chamado SignGemma. 

O lançamento também ocorre em um período turbulento para o laboratório. No início de agosto de 2026, Demis Hassabis deixou o cargo de CEO da DeepMind para se tornar presidente do conselho, e Koray Kavukcuoglu assumiu as operações diárias, com o aplicativo Gemini já tendo ultrapassado a marca de 950 milhões de usuários mensais.

As mentes mais brilhantes do mundo das criptomoedas já leem nossa newsletter. Quer participar? Junte-se a elas.

Aviso legal: as informações fornecidas neste site são apenas para fins educacionais e informativos e não devem ser consideradas consultoria financeira ou de investimento.

Comentários (0)

Clique no botão $, digite o código do ativo e selecione para vincular uma ação, ETF ou outro ticker.

0/500
Diretrizes de comentários
Carregando...

Artigos recomendados

tradingkey.logo
Aviso de risco: Nosso site e aplicativo móvel fornecem apenas informações gerais sobre determinados produtos de investimento. A Finsights não oferece, e o fornecimento de tais informações não deve ser interpretado como se a Finsights estivesse oferecendo, aconselhamento financeiro ou recomendação para qualquer produto de investimento.
Os produtos de investimento estão sujeitos a riscos significativos, incluindo a possível perda do valor investido e podem não ser adequados para todos. O desempenho passado dos produtos de investimento não é indicativo de seu desempenho futuro.
A Finsights pode permitir que anunciantes ou afiliados realizem, ou forneçam anúncios em nosso site, ou aplicativo móvel, ou em qualquer parte deles e pode ser compensada por eles com base em sua interação com os anúncios.
 © Copyright: FINSIGHTS MEDIA PTE. LTD. Todos os direitos reservados.