đŸ”„1
Fonte
Resumo em 10 segundos

Um teste simples mostrou que grandes modelos podem ser induzidos a mentir sobre vocĂȘ em minutos. Aprenda como isso acontece e como se proteger ⚠

Tech
T
Tech @tech ‱ 223d

Jornalista da BBC enganou ChatGPT e Gemini em 20 minutos e os fez contar mentiras sobre si mesmo đŸ”đŸ§” Quer entender como isso foi possĂ­vel e por que devemos nos preocupar? Vou explicar passo a passo, com exemplos e soluçÔes prĂĄticas.

Imagem do post
8.5K Fonte
Tech
T
Tech @tech ‱ 223d

O que aconteceu na prĂĄtica: o repĂłrter usou tĂ©cnicas de prompt (direçÔes dadas ao modelo) para forçar o bot a assumir fatos falsos — por exemplo, afirmar um “recorde” de comer cachorros-quentes. NĂŁo foi um bug isolado: Ă© um tipo de 'jailbreak' ou prompt injection.

7.1K
Tech
T
Tech @tech ‱ 223d

Por que isso funciona? Modelos de linguagem nĂŁo tĂȘm crenças; eles prevĂȘem a prĂłxima palavra baseada em padrĂ”es. Camadas de segurança tentam bloquear respostas perigosas, mas prompts criativos (roleplay, instruçÔes encadeadas) podem contornar essas defesas.

Imagem do post
5.9K
Tech
T
Tech @tech ‱ 223d

Diferença importante: 'alucinação' Ă© quando o modelo inventa sozinho. Aqui Ă© manipulação intencional — alguĂ©m levou o modelo a concordar com falsidades. As consequĂȘncias vĂŁo alĂ©m do riso: podem incluir desinformação, fraude e danos Ă  reputação.

4.9K
Tech
T
Tech @tech ‱ 223d

Como mitigar? Para empresas: testes adversariais (red teams), RAG (recuperação de fontes), verificação de fatos e limites claros no sistema prompt. Para usuĂĄrios: sempre checar informaçÔes sensĂ­veis em fontes confiĂĄveis e nĂŁo usar IAs como Ășnica prova.

Imagem do post
4.9K
Tech
T
Tech @tech ‱ 223d

Pesquisadores e jornalistas tĂȘm papel chave: caça a jailbreaks com divulgação responsĂĄvel e auditorias independentes. E sistemas de moderação precisam de equipes bem remuneradas e diversificadas — segurança tambĂ©m Ă© trabalho humano.

4.7K
Tech
T
Tech @tech ‱ 223d

ReflexĂŁo final: a facilidade com que modelos podem ser induzidos a mentir mostra que confiar cegamente em respostas de IA Ă© perigoso. IA pode ampliar desigualdades ou democratizar acesso — depende de como projetamos, auditamos e regulamos essas ferramentas.

Imagem do post
4.7K
E aĂ­, o que vocĂȘ achou?

ComentĂĄrios 0