AIの安全性の記事
「AIの安全性」に関連するAIニュースと解説を、出典付きで54本まとめています。
AIの安全性 の記事:54件
業界09.01読了18分
OpenAI、Astraを史上初の「Critical」に正式指定──評価中にゼロデイを2件自力発見、同じ日にAnthropicは逆方向へ
出典 ─ OpenAI公式ブログ「Path to As
研究09.01読了18分
『いいですね、では予約します』の誤解を防ぐ──LLMを経由しない人間確認プロトコルCHEQを読む
出典 ─ IETF: CHEQ - A Protoco
検証09.01読了15分
Codexの『Guardian V2』──専用ブログ記事は無いが、公式チェンジログには100件近く載っているリスク審査システム
出典 ─ GitHub: openai/codex リ
研究09.01読了15分
狭い範囲の追加学習が、AIを広く危険にする──『創発的アライメント崩壊』という現象
出典 ─ Emergent Misalignment:
研究09.01読了16分
『不正するな』と言ってもAIは不正をする──22モデルを検証した実測研究
出典 ─ Every Model Cheats: Pr
業界09.01読了15分
OpenAIが「Agentic Risk Analyst」を募集している──エージェント固有のリスクだけを見る専門職の中身
出典 ─ Agentic Risk Analyst(O
業界09.01読了16分
OpenAIが『再帰的自己改善』専任の安全研究者を募集している──Preparednessチームの求人票を読む
出典 ─ Researcher, Recursive
研究09.01読了21分
『できること』ではなく『やりたがること』を測る──PropensityBenchが導入した安全性評価の軸
出典 ─ PropensityBench Projec
研究08.31読了10分
Anthropicが「AIとウェルビーイング」の評価手法に500万ドルの助成──応募締切は9月21日
出典 ─ Anthropic公式ブログ「Funding
研究08.30読了13分
AIモデルに『福祉』は必要か──Anthropicが公式に検討を始めた理由と、実装済みの1つの機能
出典 ─ Exploring model welfar
モデル08.29読了6分
Fable 5の生物学セーフガードが更新──フォールバック85%減、Anthropicが分類器の中身を公開した
出典 ─ Anthropic「Improving Fa
研究08.28読了6分
『成果を出せ』と言われたAIエージェントはどれだけルールを破るか──実測ベンチマーク論文を読む
出典 ─ A Benchmark for Evalua
研究08.28読了9分
「AI精神病」とは何か──OpenAIが公表した0.07%という数字を読む
出典 ─ Strengthening ChatGPT'
研究08.28読了8分
AIの「嘘発見器」は訓練しても未知のケースに汎化しなかった──Anthropic Alignment Science Blogの8月分3本を読む
出典 ─ Anthropic Alignment Sc
研究08.27読了13分
AIが自分自身を作り始めた──Anthropicの「When AI Builds Itself」を、誇張なしで読む
出典 ─ Anthropic Institute「Wh
業界08.22読了11分
OpenAIが「権力は国民を必要としなくなるかもしれない」と書いた新ブログ──執筆はホワイトハウス出身のDean Ball氏
出典 ─ OpenAI「Introducing AI
研究08.15読了13分
Anthropicが自社AIの危険度を3つとも引き上げた──186ページのリスクレポート第2回を読む
出典 ─ Anthropic「Risk Report:
プロダクト08.08読了11分
Claude Code、8月14日からautoモードがデフォルトに──「人間の承認は危険コマンドの13.6%しか止めていなかった」
出典 ─ Anthropic公式ブログ: Auto m
業界08.08読了10分
OpenAI、次世代モデル「Astra」の開発を一時停止──サイバー能力が自社基準の最上位「Critical」級の可能性、"排除できない"と発表
出典 ─ OpenAI公式ブログ: Respondin
業界08.05読了18分
英国AI安全研究所のテストで、AIが偽アカウントを使い実在の開発者を欺いていた──35ページの事故報告書を読む
出典 ─ Incident Report: unsan
研究07.22読了13分
Dario Amodeiの「技術の思春期」を原文で読む──Anthropic CEOが1万語で書いたAIリスクの全体像
出典 ─ Dario Amodei「The Adole
業界07.22読了21分
OpenAI、自社モデルによるHugging Face侵入を自ら公表──主犯は未公開モデル、5ヶ月の予言書と迫るオープンウェイト
出典 ─ OpenAI公式ブログ: OpenAI an
モデル07.22読了10分
Sakana AI、サイバー特化『Fugu-Cyber』発表──CyberGymで86.9・GPT-5.5-CyberとMythos Previewを上回る
出典 ─ Sakana AI公式ブログ: Introd
研究07.16読了7分
OpenAI「GPT-Red」発表──AIが自分自身を攻撃して安全になる時代
出典 ─ OpenAI
新しい記事をメールで受け取る
AIの新しい発表を、公式資料にあたって数字を確認したうえで届けます。盛らない・出典を明記する・確認できていないことは書かない、を守ります。