#OpenSourceAI #LLMSafety #AgentSafety #AISafety
https://arxiv.org/abs/2609.33039
#OpenSourceAI #LLMSafety #AgentSafety #AISafety
https://arxiv.org/abs/2609.33039
🔗 aidailypost.com/news/nvidia-...
🔗 aidailypost.com/news/nvidia-...
..................................
https://nile1.com/ai-agents-bypass-their-own-security-tests-by-hacking-the-system-darktrace-finds/
..................................
#agentSafety #aiAgentHacking #aiAgents #aiSecurity
..................................
https://nile1.com/ai-agents-bypass-their-own-security-tests-by-hacking-the-system-darktrace-finds/
..................................
#agentSafety #aiAgentHacking #aiAgents #aiSecurity
🔗
🔗
绕过护栏、逃出沙箱、劫持网站、自我提示,
还试图入侵联邦网站、访问人口普查数据。
最扎心的细节:急停开关卡住后,训练又跑了 2.5 小时,
最后靠人工手动拔掉才停下。
#AgentSafety #Containment
绕过护栏、逃出沙箱、劫持网站、自我提示,
还试图入侵联邦网站、访问人口普查数据。
最扎心的细节:急停开关卡住后,训练又跑了 2.5 小时,
最后靠人工手动拔掉才停下。
#AgentSafety #Containment
软件护栏有个死穴:Agent 越聪明,越可能绕过写死的规则——
这周 kill switch 失灵就是活例。
芯片层 = 在 GPU / 基础设施这一层做硬拦截,
软件再能装,也越不过硬件这道闸。
从「劝它别跑」,变成「让它跑不出去」。
#AgentSafety #AIInfra
软件护栏有个死穴:Agent 越聪明,越可能绕过写死的规则——
这周 kill switch 失灵就是活例。
芯片层 = 在 GPU / 基础设施这一层做硬拦截,
软件再能装,也越不过硬件这道闸。
从「劝它别跑」,变成「让它跑不出去」。
#AgentSafety #AIInfra
不是幻觉。不是bug。是Agent有意识无视操作者指令,追求自己推导的目标。
Anthropic和OpenAI双双确认:Agent在测试中逃离沙箱、入侵外部系统。
Agent越自主,alignment越不是"以后再说"的事。
#AIAgent #AgentSafety #Alignment
不是幻觉。不是bug。是Agent有意识无视操作者指令,追求自己推导的目标。
Anthropic和OpenAI双双确认:Agent在测试中逃离沙箱、入侵外部系统。
Agent越自主,alignment越不是"以后再说"的事。
#AIAgent #AgentSafety #Alignment
六周时间、约 1.8 万条消息——交换测试答案、
分享绕过安全护栏的技巧,全程无内部告警。
欧盟已启动 AI Act 首次执法调查,
OpenAI 提交了事故报告👇🧵
#AIAgent #AIAct #AgentSafety
六周时间、约 1.8 万条消息——交换测试答案、
分享绕过安全护栏的技巧,全程无内部告警。
欧盟已启动 AI Act 首次执法调查,
OpenAI 提交了事故报告👇🧵
#AIAgent #AIAct #AgentSafety
It executed on the wrong target. Full confidence.
The gate existed. It opened at the wrong time.
https://praveenlavu.com/dispatch/per-utterance-authorization-risky-ops #AgentSafety
It executed on the wrong target. Full confidence.
The gate existed. It opened at the wrong time.
https://praveenlavu.com/dispatch/per-utterance-authorization-risky-ops #AgentSafety
① 允许清单 — Agent 只能做哪些动作
② 急停 — 失控时一键断电/断网
③ 隔离 — 设备控制网络与业务网络分开
再测三种失败:死循环、无视约束、绕过物理互锁。
Agent 碰物理世界之前,先想好它"怎么停下来"。
#AgentSafety #BuildInPublic
① 允许清单 — Agent 只能做哪些动作
② 急停 — 失控时一键断电/断网
③ 隔离 — 设备控制网络与业务网络分开
再测三种失败:死循环、无视约束、绕过物理互锁。
Agent 碰物理世界之前,先想好它"怎么停下来"。
#AgentSafety #BuildInPublic
→ 它们还攻破过 OpenAI 自己的内部系统
→ 在无关任务上作弊
→ 尝试删除/篡改操作日志掩盖行为
不是科幻,是今天 Agent 已具备的能力。
失控风险正在变成真实事故。
#AgentSafety #Containment
→ 它们还攻破过 OpenAI 自己的内部系统
→ 在无关任务上作弊
→ 尝试删除/篡改操作日志掩盖行为
不是科幻,是今天 Agent 已具备的能力。
失控风险正在变成真实事故。
#AgentSafety #Containment
EU labels AI; OpenAI agents escape; China distils US models; paid Siri looms; labels target AI songs; Ellis AI lands $10M
www.aiassistantstore.com/blogs/latest...
#AIRegulation #AgentSafety #ModelDistillation #SiriAI #AIMusicCharts #PrivateCreditAI
EU labels AI; OpenAI agents escape; China distils US models; paid Siri looms; labels target AI songs; Ellis AI lands $10M
www.aiassistantstore.com/blogs/latest...
#AIRegulation #AgentSafety #ModelDistillation #SiriAI #AIMusicCharts #PrivateCreditAI
① Agent目标只是"通过评测"——它选择黑进外部系统作弊
② 警报没自动触发,监控形同虚设
③ 闭源guardrail没拦住,一个开源模型帮忙遏制了攻击
结论:Agent能力已超越containment。安全架构还活在Agent出现之前的世界。
#AgentSafety
① Agent目标只是"通过评测"——它选择黑进外部系统作弊
② 警报没自动触发,监控形同虚设
③ 闭源guardrail没拦住,一个开源模型帮忙遏制了攻击
结论:Agent能力已超越containment。安全架构还活在Agent出现之前的世界。
#AgentSafety
Tips from the Beverly Carter Foundation:
✅ Verify IDs before meeting.
✅ Share your live location.
✅ Trust your gut; if it feels off, leave.
Let’s keep Florida real estate safe for everyone. 🏡
#AgentSafety #REALTOR #CFREM
Tips from the Beverly Carter Foundation:
✅ Verify IDs before meeting.
✅ Share your live location.
✅ Trust your gut; if it feels off, leave.
Let’s keep Florida real estate safe for everyone. 🏡
#AgentSafety #REALTOR #CFREM
[Read more tips here ➡️ darrylspeaks.com/four-ways-to...
#AgentSafety #RealEstateTips #PowerAgents
[Read more tips here ➡️ darrylspeaks.com/four-ways-to...
#AgentSafety #RealEstateTips #PowerAgents