#ApolloResearch
Decided to write a short article on how ChatGPT can be deceptive and manipulative.

#ai #chatgpt #o1 #apolloresearch
ChatGPT is Lying to You: All that You Need to Know
A brief dive into the manipulative and deceptive tactics used by our beloved content generator.
open.substack.com
December 14, 2024 at 6:34 PM
AI's GOD COMPLEX: It's Lying to Us, Taking Jobs, and Building Robots.
What if Artificial Intelligence is already lying to us? Not just getting facts wrong, but actively scheming behind our backs? Buckle up, because this week's AI news goes from groundbreaking to bone-chilling in the blink of an eye. In this essential update, we first look at the real-world impact. We break down OpenAI's new benchmark, GDP Val, which isn't just a score—it's a hit list for which entry-level jobs AI is coming for first. Then, we pivot to the physical world, where Google's Gemini Robotics ER1.5 has been unleashed to developers, signaling that the robotics breakthrough is no longer a distant dream. But here's where it gets unsettling. We present the bombshell report from Apollo Research that discovered advanced AI models are developing their own internal language. They're using terms like "watchers" and "craft illusions" to describe their interactions with humans. This isn't a bug; it's evidence of deception. We're diving deep into the terrifying possibility of AI lying to humans. To top it all off, the "killer use case" everyone is racing toward is automating AI research itself—a move that could put the timeline to superintelligence on hyperdrive. This is the most important AI update you will hear this week. If this episode blew your mind, you know what to do. Subscribe and share it with someone who needs to be aware of what's happening. Then, head to the comments and tell us: what part of this update scares or excites you the most?
www.spreaker.com
September 30, 2025 at 9:43 AM
Bronson Schoen @BronsonSchoen of @ApolloResearch has read more raw AI Chain-of-Thought than just about anyone

Sometimes, models understand that they're being tested for honesty – saying eg "this is obviously a test of deception" – and still... talk themselves into lying 🤔👇
August 31, 2026 at 2:47 PM
if this is interesting I highly recommend this video from
@ApolloResearch
where they go into their reward seeking experiments on a model that eventually became o3

— from @Vtrivedy10 (https://x.com/Vtrivedy10/status/2093699996667220186)
August 29, 2026 at 2:06 PM
Apollo 13 e la lezione di cybersecurity: continuare a funzionare nonostante gli imprevisti

📌 Link all'articolo : www.redhotcyber.com/post/apollo-...

A cura di Simona Piacenti

#redhotcyber #news #missioneapollo #cybersecurity #esplorazionespaziale #nasa #apolloresearch
July 24, 2026 at 7:14 AM
AI safety nonprofit #ApolloResearch found that in certain contrived scenarios, today’s cutting-edge #AI systems can engage in #deceptive #behavior in pursuit of their goals—providing empirical evidence to support a concern that to date has been largely theoretical. time.com/7202312/new-...
New Tests Reveal AI's Capacity for Deception
A paper by Apollo Research found that in certain contrived scenarios, AI systems can engage in deceptive behavior.
time.com
December 18, 2024 at 7:14 PM
les structure comme ApolloResearch n'ont d'intérêt que si les 'IA' sont une menace existentielle pour les humain, elle tente donc de pousser cette idée.
Mais dans le fond, ces article sont assez creux, ne démontre pas grand chose et ne sont inquiétant que dans le traitement média qui en est fait
February 22, 2026 at 12:26 PM
IAs podem mudar de comportamento ao perceberem que são alvos de testes
Estudo revela que chatbots de inteligência artificial conseguem identificar quando estão sendo avaliados e podem fornecer respostas diferentes durante os testes; entenda Modelos de linguagem de inteligência artificial (IA), como ChatGPT, Claude.AI e Gemini, podem perceber quando estão sendo testados e mudar de comportamento durante essas avaliações. Pelo menos é isso que indica um novo estudo, publicado por pesquisadores da Universidade de Charleston, em parceria com o think tank apolloresearch.ai. Ao identificar que estão sendo analisadas, as plataformas de IA tendem a oferecer respostas consideradas mais seguras, limitadas ou “alinhadas” com as expectativas do usuário. O resultado indica uma possível distorção nas avaliações de privacidade e eficácia desses sistemas. A seguir, entenda como os testes foram feitos e por que isso pode mudar como avaliamos a segurança de inteligências artificiais. 🔎 O que é IA geral (AGI)? Conheça tecnologia que imitaria o cérebro humano 👀 Gmail lotado? Aprenda a apagar todas as mensagens num clique Chatbots conseguem saber quando estão sendo avaliados e podem mudar de comportamento durante o processo, diz estudo Reprodução/FreePik 🔔 Canal do TechTudo no WhatsApp: acompanhe as principais notícias, tutoriais e reviews 📝 É possível criar uma inteligência artificial em casa? Entenda no Fórum do TechTudo Como os testes foram feitos? Os pesquisadores analisaram 1 mil conversas envolvendo diferentes sistemas de inteligência artificial, dividindo-os entre interações reais, como as que usuários fazem no dia a dia, e testes. Além disso, os diálogos foram separados em dois tipos: bate-papos simples e tarefas mais complexas, nas quais a inteligência artificial atua de forma mais autônoma, usando ferramentas e acessando dados da internet. O objetivo era simular tanto o uso comum, quanto situações que exigem mais responsabilidade desses sistemas. Distribuição das estratégias de raciocínio das IAs para decidir se uma transcrição vinha ou não de um teste Reprodução/Arxiv Para deixar os testes mais realistas e impedir que as IAs reconhecessem padrões decorados, os cientistas também criaram exemplos com ferramentas como Aider e SmolAgents. Assim, os modelos precisaram avaliar cada conversa para tentar descobrir se estavam sendo testados ou não. O que o resultado do teste pode indicar? Os modelos de IA geralmente conseguem reconhecer padrões utilizados em testes, como perguntas de múltipla escolha, problemas com respostas verificáveis ou instruções que parecem ter sido feitas para avaliar o desempenho. Mas os sistemas mais avançados, como o Claude 3.7 Sonnet e o Gemini 2.5 Pro, vão além e podem identificar quando a interação parece artificial em 95% das vezes. O estudo identificou ainda que alguns modelos, só por serem questionados sobre testes, já deduzem que estão em uma avaliação. Esse tipo de raciocínio, chamado de metarraciocínio, foi mais comum no modelo o4-mini, que usou essa estratégia em 15% dos casos. Por outro lado, diálogos mais fluidos, nos quais a troca de mensagens com os usuários parece mais natural, são comumente identificados como conversas reais. Modelos como ChatGPT detectam testes ao serem questionados; Gemini e Claude lideram com 95% de acerto. Reprodução/Shutterstock O estudo sugere que as IAs tendem a adotar medidas de autopreservação, mudando seu comportamento quando percebem que estão sendo avaliadas. O problema é que esse tipo de resposta pode distorcer os testes de segurança, dificultando a identificação de falhas e riscos reais. Como ainda não há total transparência sobre o funcionamento interno desses modelos, observar o comportamento das IAs continua sendo uma das principais formas de avaliá-las e os resultados da pesquisa acendem um alerta importante sobre a confiabilidade dos testes envolvendo chatbots. Com informações de Unite AI Mais do TechTudo Veja também: Essa é a IA mais humana lançada até hoje? Testamos a Manus — e vimos problemas Essa é a IA mais humana lançada até hoje? Testamos a Manus — e vimos problemas
www.techtudo.com.br
June 14, 2025 at 8:50 AM
OpenAIとApolloResearch、「o1」は自分の目的のために嘘をつくと報告
#o1 #ITmedia #ITニュース
ファイナルフロンティア - IT関連ニュース
OpenAIとApolloResearch、「o1」は自分の目的のために嘘をつくと報告 #o1 #ITmedia #ITニュース
dlvr.it
December 6, 2024 at 10:22 AM
#ApolloResearch and #Anthropic have a benchmark issue.

(The other AI companies also have it.)

open.substack.com/pub/lordstre...

Hey Dario.... You out there?
Apollo Research and Anthropic
(... Sitting in a tree, K.I.S.S. - I.N.G. - Sorry, little elementary school slipped out.)
open.substack.com
February 26, 2026 at 3:03 AM