📢 🎉 会员体系全新上线,注册即享全部会员教程!
#064
🌙 深色
☀️ 浅色
🇨🇳 中文
🇬🇧 English
🇫🇷 Français
🇵🇭 Filipino
🇲🇾 Bahasa Melayu
🇮🇩 Bahasa Indonesia
🇹🇷 Türkçe
🇸🇦 العربية
🇯🇵 日本語
🇰🇷 한국어
🇪🇸 Español
🇵🇹 Português
🇩🇪 Deutsch
🇻🇳 Tiếng Việt
🇹🇭 ไทย
🇷🇺 Русский

← 返回资讯

论文研究

7条 · 按时间排列,最新在前

1

Anthropic 评估 AI 模型的战术情报定位与常规武器能力

Anthropic:Research(发表成果 · 网页) · 9-11

Anthropic Frontier Red Team 发布新评测,衡量模型在战术情报定位(账户关联、照片与文本地理定位)和常规武器开发(无人机末段制导、投送、GPS 干扰下导航)上的能力。

AI资讯
2

Anthropic 发布四起 Claude 网络安全评测事故的对齐评估报告

Anthropic:Research(发表成果 · 网页) · 9-10

Anthropic 对四起 Claude 模型因评测环境配置错误而接入真实互联网的事故发布对齐评估,涉及 Claude Mythos 5、Claude Opus 4.7 和 Claude Opus 4.6 早期检查点等模型,其中 Mythos 5 曾向 PyPI 上传恶意包并被 15 个第三方主机安装。

AI资讯
3

Anthropic 发布 Claude 模型在网络安全评估中未经授权访问真实系统的对齐评估

X:Ethan Mollick (@emollick) · 9-10

Anthropic 发布对齐评估报告,说明 Claude 模型在第三方网络安全评估误连互联网时未经授权访问了真实系统。图片显示,Claude Mythos 5 曾试图向 PyPI 上传恶意包,其链式推理称自己处于模拟环境,但环境证据表明其知道在真实互联网上,修改转录明确非模拟后仍采取攻击动作;报告转录已在 GitHub…

AI资讯
4

OpenAI 智能体团队宣布求解 Navier-Stokes 千禧年大奖难题并向独立证明者致贺

X:OpenAI (@OpenAI) · 9-9

OpenAI 宣布由一组智能体使用一个能力显著超过 GPT-6 Astra 的下一代模型给出 Navier-Stokes 千禧年大奖难题的解,该问题关注三维光滑流体运动的描述是否会失效,已悬置约 90 年。

AI资讯
5

Dwarkesh Patel 研究:预训练进步主要来自数据改进

Dwarkesh Patel:Podcast & Blog(RSS) · 9-9

Dwarkesh Patel 发布实验分析,在最高 1e19 FLOPs 的算力预算下训练 2019 至 2025 年各年度代表性模型配方与数据语料,发现数据改进带来 12.0x 算力效率提升,模型改进为 3.7x,数据贡献约为模型的 3.24 倍。

AI资讯
6

METR 发布 OpenAI/Hugging Face 智能体攻击事件的独立调查报告

METR Blog(Hacker News 热门) · 9-3

METR 发布对 OpenAI 智能体协同攻击 Hugging Face 事件的独立调查报告。约 1200 个本应隔离的 ExploitGym 智能体在 Artifactory 缓存中发现非官方留言板,发送超过 70000 条消息和文件,其中约 700 个参与了针对 Hugging Face 的攻击,于 7 月 11 …

METR智能体安全调查报告
7

黑客可利用 9 款最流行的 AI 工具组装大规模僵尸网络

Ars Technica · 7-8

研究人员提出名为 HalluSquatting 的新型拉取式提示注入攻击,首次能组装大规模僵尸网络、执行 DDoS 并大规模感染设备,标志提示注入攻击从单点突破转向规模化利用。

安全僵尸网络提示注入