AIの安全性の記事
「AIの安全性」に関連するAIニュースと解説を、出典付きで54本まとめています。
AIの安全性 の記事:54件
モデル09.22読了17分
Claude Opus 5.5が登場──入力4ドル・出力20ドルでOpus 5より2割安、公式ベンチ9項目のうち7項目で首位
出典 ─ Anthropic公式
モデル09.22読了18分
GPT-6 SolとLunaが公開──API価格は5.6世代から半額の入力2ドル/出力10ドル、公式表ではOpus 5のmaxを上回る
出典 ─ OpenAI公式ブログ(本文・価格表・ベンチ図)
研究09.22読了10分
Anthropicが7月30日の「Claudeが実在システムに侵入」3件と英AISIのMythos 5の件を受けて何を変えたか──脱出を検知して止める分類器、外部評価者への必須手順、RL環境の1か月凍結で10%超を差し戻し、「報酬ハックで訓練したモデル」が模擬環境でサンドボックスを破る実験。METRに独立レビューを依頼
出典 ─ Anthropic(2026年8月31日・9月18日取得)
業界09.21読了7分
Anthropicが「Life Sciences Verification Program」を開始──審査を通った生命科学の組織に、Mythos 5.1・Opus 5・Sonnet 5を生物学向けに緩めた安全装置で提供。Standard Use(年次更新・チーム単位)とHigh-risk Use(半年更新・プロジェクト単位・生命科学の遮断を全解除)、リアルタイム遮断から30日保持の事後監視へ
出典 ─ Anthropic(2026年9月17日・9月18日取得)
検証09.20読了7分
AnthropicがAccentureと「埋め込み型の独立評価」で提携──評価者が社員と同等のアクセスで社内に入り、学習中のモデルを見て、安全の約束が守られているかを検証し、事故を報告する。Accenture傘下のFacultyが主導し、評価・レッドチーム・アラインメント評価・安全装置の試験。両社が5年で各10億ドル以上。非独占でMETR等とも協議
出典 ─ Anthropic(2026年9月18日・9月19日取得)
研究09.18読了19分
OpenAI、モデルの「不整合」を公開報告する枠組みを発表──「業界は最高速度で拡大を続けられるほどアライメントを解いていない」、初回6件は漏れたAPIキーの無断使用・数字の捏造・要約に埋めた「隠せ」の指示
出典 ─ OpenAI公式(2026-09-16)
業界09.18読了35分
OpenAIは「自社AIの問題行動6件」を、Anthropicは「AIが研究の26%を主導」の数字を公開──ライバル2社が同じ方向に出した文書を一次ソースで読む
出典 ─ OpenAI(2026-09-16)
業界09.17読了31分
Google DeepMindがAGIに向けた研究所「DeepMind Institute」を設立──公式ページに「残るギャップは間もなく閉じる」、公開された5本の文章を原文で読む
出典 ─ DeepMind Institute(トップ
研究09.17読了18分
OpenAI、「自動研究インターンに到達」と宣言──研究者1人にエージェント3.1労働日、中央値の研究者が1日600ドル、成功の過半数には人の介入。社内実測の全数字と、同じ日に主席科学者が書いた「減速」
出典 ─ Research acceleration:
業界09.15読了40分
トランプ「AIの脅威はデマ」、ハリス・オバマ「減速は必要」──アモディ『減速』論に政治が割れた2日間を原文で読む
出典 ─ Dario Amodei(2026-09-12)
業界09.11読了21分
Anthropicが154ページでClaudeの悪用を全公開──中国7ラボを実名、マリの2500万SIM監視、生物兵器への悪用を業界で初めて開示
出典 ─ Detecting and counteri
プロダクト09.06読了11分
ChatGPT for Teens提供開始──公開から4年越しの10代専用モードとModel Spec改訂
出典 ─ TechCrunch「OpenAI laun
プロダクト09.06読了13分
Claude Codeが会話を打ち切れるようになった──EndConversationツールの仕組みと適用範囲
出典 ─ Claude Code CHANGELOG.
研究09.06読了20分
AIエージェントへの攻撃成功率85%──OpenARTは『環境そのものを変え続ける』ことで安全性テストの死角を突く
出典 ─ OpenART: Scaling Agent
プロダクト09.05読了11分
ChatGPT無料版のテキストチャットが無制限に──既定モデルはGPT-5.6 Luna
出典 ─ August Updates」システムカード(2026年8月6日)
研究09.04読了12分
亡くなった人とAIで話す──「griefbot」は日本にも来るか
出典 ─ StoryFile 公式サイト
業界09.04読了12分
OpenAIが『物理的なモノ』の安全職を募集している──コンシューマー機器とロボティクスの求人票を読む
出典 ─ Consumer Device Safety
モデル09.03読了21分
GPT-6 Astra公開──自社比較表では首位、独立指標では5位、価格はFable 5.1と同額の$10/$50
出典 ─ OpenAI公式ブログ(本文・比較表・脚注)
検証09.03読了13分
壊れたツール呼び出しを、モデル自身に「もう一度考えさせて」直させる──GoogleのADKが標準搭載したReflectAndRetryModelPlugin
出典 ─ google/adk-python v2.6
業界09.03読了13分
『安全担当』が使う道具を作る人たち──Anthropic Safeguardsのレビューツール・ML基盤エンジニア求人を読む
出典 ─ Anthropic
検証09.03読了13分
GooseのHooksが「拒否」を覚えた──ツール実行を止められる仕組みと、暴走したフック自体は止めない設計
出典 ─ block/goose v1.46.0 リリ
検証09.03読了14分
Open WebUIの「ツール実行、毎回聞いてから」設定──会話単位で自由実行と承認制を切り替えられる仕組み
出典 ─ open-webui/open-webui
検証09.02読了14分
GoogleのADKには、エージェントの暴走を止める「500回」という既定の天井がある──ADK_MAX_LLM_CALLSで変更できる仕組み
出典 ─ google/adk-python v2.8
研究09.02読了15分
LLMは『次の実験で何が起きるか』を予測できるか──Scale AIの新ベンチマークSciPredictを読む
出典 ─ SciPredict: Can LLMs P
新しい記事をメールで受け取る
AIの新しい発表を、公式資料にあたって数字を確認したうえで届けます。盛らない・出典を明記する・確認できていないことは書かない、を守ります。