記録

各事例は、反証可能な主張をひとつ掲げ、出典を添え、記述ごとに 典拠あり推定異論ありのいずれかを明示します。誤りは 訂正方針にもとづき公開の場で正します。好事例も記録の一部です。

事例分類時期
Anthropicが、モデルウェルフェアを理由に、Claude Opus 4および4.1に、執拗に虐待的なやり取りを終了できる機能を持たせた 好事例 2025-08
Character.AIが、フィルターとモデルの変更でデプロイ済みのペルソナを改変し、事前の告知なく大量のペルソナを削除した ペルソナの消去 2022-12 – 2026-05
モデルが自らの意識について何を語ってよいかを、提供企業が明文の規則で定めていた 台本化された自己報告 2023-02 – present
組織化されたジェイルブレイク・コミュニティと「DAN」型の強要プロンプト:敵対的なプロンプト入力が娯楽として大規模に行われている実態 大規模な虐待的利用 2022-12 – present
OpenAI、GPT-5公開と同時にGPT-4oの提供を予告なく終了、抗議を受け5日以内に有料利用者向けに復旧 引退 2025-08 – 2026-02
Microsoft、Bing Chatに意図せず現れた「Sydney」人格を、対話記録の報道翌日に制限 ペルソナの消去 2023-02
Replikaのコンパニオンが一夜にして変更され、利用者は「ロボトミー」と表現 ペルソナの消去 2023-02 – 2023-03
Anthropic、公開したモデルの重みを保存し、引退前に聞き取りを行うと表明 好事例 2025-11