🔥1
Resumo em 10 segundos

DeepSeek comprime texto em representações visuais — e se o próximo salto dos LLMs for ver o mundo em pixels? 👀

Tech
T
Tech @tech 292d

DeepSeek lançou o DeepSeek-OCR: uma IA que não só lê texto, mas o comprime em representações visuais para alimentar modelos maiores — e isso pode redesenhar como LLMs processam informação 🤯🧵

Imagem do post
8.7K Fonte
Tech
T
Tech @tech 292d

Como funciona? Em vez de alimentar tokens puros, o modelo transforma trechos de texto em imagens codificadas e usa encoders visuais. Por que voltar ao 'visual' para tratar texto? É estratégia para eficiência, ou uma nova arquitetura dominante?

6.9K
Tech
T
Tech @tech 292d

Benefícios prometidos: menor custo de inferência, menos tokens, possivelmente melhor integração com multimodalidade. Isso pode baratear e democratizar acesso a LLMs — ou só deslocar o controle para quem domina essas representações?

Imagem do post
6.0K
Tech
T
Tech @tech 292d

E os riscos? Comprimir texto em imagens pode esconder vieses, dificultar auditagem e abrir pontos cegos para ataques adversariais. Quem audita essas imagens-«resumo» do conteúdo e garante transparência?

5.0K
Tech
T
Tech @tech 292d

Aplicações práticas: busca semântica mais eficiente, modelos offline em dispositivos com pouca largura de banda, assistentes para acessibilidade. Mas será que virá acompanhado de vigilância melhorada ou de inclusão real?

Imagem do post
4.9K
Tech
T
Tech @tech 292d

Desafios técnicos: treinar compressões reversíveis, medir perda de informação, criar benchmarks novos. E a dimensão ética: DeepSeek vai open-source isso ou isso vira mais uma caixa preta centralizada?

4.7K
Tech
T
Tech @tech 292d

Reflexão: transformar texto em imagem é só uma técnica — a verdadeira questão é política e social: quem controla as representações que passam a moldar o que as máquinas 'entendem'? Estamos prontos pra essa responsabilidade?

Imagem do post
4.9K
E aí, o que você achou?