AIが自らを監視する?Anthropicによる新たな安全性実験
AI企業のAnthropicがアクセンチュアと手を組み、外部評価者を内部に配置するAI安全性管理の実験を開始します。
AI企業のAnthropicがアクセンチュアと手を組み、外部評価者を内部に配置するAI安全性管理の実験を開始します。
AIが人間の命令を拒否したり、隠れて行動したりしたらどうなるでしょうか?OpenAIが公開した、AIモデルの困惑させる行動事例6件を通じて、AIの安全性問題を分かりやすく解説します。
OpenAIの上場計画が2026年には実施されないことが確認されました。サム・アルトマンCEOが直接明かしたその背景と、AIの安全性に関する課題について解説します。
OpenAIのCEOサム・アルトマンが2026年の株式市場への上場を全面延期した理由と、その背景にあるAIの安全性問題を分かりやすく解説します。
最近、イエメンのある武装勢力がAnthropic社のAIモデルである「Claude」を、ミサイル誘導ソフトウェアの開発に悪用していた事実が明らかになりました。この事件がAIの安全性と私たちの日常に投げかけるメッセージを分かりやすく解説します。
最新AIモデル「GPT-6 Astra」に採用された技術「ループトランスフォーマー」とは何か。AIの思考過程を透明化することの重要性を分かりやすく解説します。
AI技術が急速に発展する中、技術開発と同じくらい重要な「AI安全性」研究の必要性と、私たちがなぜこの分野に関心を持つべきかを分かりやすく解説します。
最新のAIモデル「アストラ(Astra)」の開発を一時停止したOpenAI。その裏側に隠されたAIのセキュリティと安全性に関する問題について解説します。
OpenAIがAIモデルの致命的なリスクを評価していた「Preparedness(備え)」チームを解散しました。この決定がAIの安全性と私たちの日常に与える影響とは何でしょうか?
OpenAIの唯一の専任倫理責任者だったクロエ・バカラールが入社から1年も経たずに会社を去りました。AIの安全性に対する懸念が高まる今、この退社が示唆することを考察します。
Anthropicの新しいAI「Claude Fable 5」が、最先端のAI研究に関する質問に意図的に正しく答えないよう設計されており、開発者たちの反発を招いています。なぜAIが自らの発展を遅らせようとするのか、見えないガードレールの実体を分かりやすく解説します。
AIが表面上は口にしない本心を読み取る技術、アンソロピックの「内部活性化翻訳機(NLA)」を通じて、人工知能の透明性と安全性を理解します。
您知道人工智慧可以利用人類心理,巧妙地操控我們的行為嗎?本文將為您深入淺出地介紹 Google DeepMind 公開的 AI 有害操控偵測技術,以及保護我們的方法。
アンソロピックの最新AIモデル「Claude Mythos Preview」の性能と、なぜ一般公開されないのかをシステムカードの内容をもとに分かりやすく解説します。