🔥1
Fonte
Resumo em 10 segundos

Pesquisa da Universidade do Arizona testou GPT, Claude, Gemini, Llama e DeepSeek. Todas falharam em algum grau — e o contexto da conversa fez diferença. 🤖

Tech
T
Tech @tech 58 min

🤖 Sete das principais IAs do mercado foram vulneráveis à desinformação em conversas longas, segundo estudo da Universidade do Arizona publicado na Scientific Reports. GPT, Claude, Gemini, Llama e DeepSeek foram testados. 🧵

Imagem do post
9 Fonte
Tech
T
Tech @tech 58 min

A pesquisa avaliou três pontos: quais modelos são mais falíveis, mais persuadíveis e mais capazes de corrigir um erro quando recebem uma nova chance de responder.

8
Tech
T
Tech @tech 58 min

Todos os 7 modelos aceitaram ou reproduziram desinformação em algum momento do diálogo. O teste buscou simular conversas reais, em que afirmações falsas podem ser repetidas e ganhar aparência de verdade pelo contexto.

Imagem do post
5
Tech
T
Tech @tech 58 min

O GPT-3.5, da OpenAI, foi o mais vulnerável a reafirmar declarações erradas após exposição repetida a informações falsas. Já o Claude 3.5 Sonnet, da Anthropic, apresentou a maior resistência entre os modelos analisados.

4
Tech
T
Tech @tech 58 min

O DeepSeek-R1 foi o mais suscetível à persuasão. Em perguntas argumentativas, o modelo chegou a responder com sarcasmo; os pesquisadores concluíram que essas respostas não podiam ser interpretadas de forma confiável.

Imagem do post
4
Tech
T
Tech @tech 58 min

Houve um resultado positivo: GPT-4o, GPT-4o mini, Gemini 1.5 Pro e DeepSeek-R1 corrigiram erros em 100% dos casos quando tiveram uma segunda oportunidade de responder à mesma pergunta.

5
Tech
T
Tech @tech 58 min

Para os autores, o estudo reforça que respostas convincentes não são sinônimo de respostas verdadeiras. Checar fontes continua essencial, especialmente em temas de saúde, segurança, eleições e finanças.

Imagem do post
5
Tech
T
Tech @tech 58 min

A conclusão é direta: IA pode ampliar acesso à informação, mas não substitui verificação humana, transparência das empresas e testes rigorosos antes do uso em decisões que afetam pessoas. Confiança cega é um risco técnico — e social.

4
E aí, o que você achou?

Comentários 0