本ページは AI Safety for Mathematicians の非公式日本語訳です ─ このページの原文を読む ↗

団体

数学的に意義のあるAIセーフティ研究を行っている、あるいは支援している団体の一覧──理論や解釈可能性から、評価(evaluations)や制御(control)まで。

Alignment Research Center (ARC)

ニューラルネットワークの挙動の機構的説明(mechanistic explanations)のための、理論的基盤を開発している。

  • 機構的説明
  • ヒューリスティック推定
  • アラインメント理論

Iliad

理論科学・実験科学としてのAIセーフティのための、研究とフィールド構築。Iliadは研究の賭け(research bets)をインキュベートし、研修プログラムやカンファレンスを運営している。

  • 研究インキュベーション
  • 研修
  • フィールド構築

METR

破滅的リスクの一因となりうるフロンティアモデルの自律性と能力について、科学的な評価を開発している。

  • フロンティア評価
  • 自律性
  • リスク測定

Redwood Research

戦略的欺瞞、AI制御(AI control)、脅威評価、そして先進AIシステムのリスクに対する緩和策に取り組んでいる。

  • AI制御
  • 欺瞞
  • 脅威評価

Resolution

理論・実証の両面にわたるアラインメント研究のポートフォリオを拡大している非営利団体。自動化と、より高い確信を持てるアプローチに重点を置く。

  • アラインメント研究
  • 自動化
  • 研究支援

Timaeus (現在はResolutionの一部)

特異学習理論(singular learning theory)を解釈可能性とアラインメントに応用している。発達的解釈可能性(developmental interpretability)や、感受率に基づく分光法(susceptibility-based spectroscopy)を含む。

  • 特異学習理論
  • 解釈可能性
  • 学習ダイナミクス

UK AI Security Institute

フロンティア評価、リスク緩和、アラインメント、制御、AIセキュリティに関する、政府による技術研究。

  • 評価
  • 緩和策
  • AIセキュリティ