Claudeの政治的中立性 — GPT-5やGeminiとの比較評価
AnthropicはClaudeを政治的に「even-handed」に訓練していると説明します。訓練方法と自動評価の仕組み、GPT-5・Gemini・Grok・Llamaとのスコア比較を一次ソースからまとめます。
全230件を並べています(31〜60件目)。解説一覧のトップへ戻る
AnthropicはClaudeを政治的に「even-handed」に訓練していると説明します。訓練方法と自動評価の仕組み、GPT-5・Gemini・Grok・Llamaとのスコア比較を一次ソースからまとめます。
AnthropicのUsage Policyは2024年5月と2025年8月に大きく改定されました。改称の経緯、選挙関連規定の変化、エージェント利用への対応まで一次ソースで時系列に追います。
budget_tokensで予算を固定するextended thinkingと、Claudeが自律判断するadaptive thinkingの違いを、モデル別対応表とエラーの原因から示します。
AnthropicのFrontier Safety Roadmapは、データ保持目標の取り下げとムーンショットR&Dの延期を隠さず公開した。進捗と後退を同じ形式で残す運用実態を追う。
Anthropicが4D AI Fluency Frameworkの11行動を9,830件の会話で計測したAI Fluency Indexを解説します。反復修正の効果とアーティファクト生成時の評価低下を扱います。
Anthropicのインド版Country Briefを読み解きます。世界2位の利用シェアと101位の1人あたり利用という落差、州別集中、economic primitivesの数値まで扱います。
AnthropicのISO/IEC 42001認証が審査した4要素を、総務省・経済産業省の「AI事業者ガイドライン」の10原則と対応付けます。ベンダー評価資料として使う際の要点をまとめます。
米エネルギー省傘下の国立研究所の科学者1,000人が、Claude 3.7 Sonnetを実際の研究課題で評価するAI Jamへの参加をAnthropicが発表しました。DOE・NNSAとの提携の積み重ねをまとめます。
AnthropicがEUの汎用AI行動規範(Code of Practice)への署名を表明しました。RSPとの関係とClaude利用企業への実務的な意味をまとめます。
Claude Scienceによるタンパク質バインダー設計と、NMR・LC-MS解析を23分で終える化学分析の2実験を、業界標準比の数値で検証します。
Anthropicの新ベンチマークBioMysteryBenchで、Claudeは人間の専門家パネルが解けない問題の一部を解いた。99問の設計と結果を読む。
AnthropicがConsumer TermsとPrivacy Policyを改定し、Free・Pro・Maxの学習利用をオプトイン方式に変更しました。同意時は保持期間も5年に延びます。
Anthropicはアレン研究所とハワードヒューズ医学研究所(HHMI)を生命科学分野の創設パートナーに迎えると発表しました。2つの提携の役割分担と、成果が研究現場に届くまでに何が未確定かをまとめます。
AnthropicはThorn・All Tech Is Humanが主導するSafety by Designに署名した。開発・展開・維持の3段階でCSAM対策をどう約束しているかを読む。
stop_reasonは常にHTTP 200の一部で、4xx/5xxのエラーとは別レイヤーです。両者を同じ監視ロジックで扱うと、refusalのような重要な停止理由を見落とします。
Anthropicが520億パラメータ規模まで拡張したInfluence Functionsで、どの学習データがClaudeの出力を形作るかを分析。手法と発見をまとめます。
Anthropic社員が顧客データを人手で閲覧するたびに記録を残す仕組みがAccess Transparencyです。対象範囲と対象外の境界、Reason codeの中身を扱います。
Zero Data RetentionとHIPAA readinessは、どちらもPHIを守る仕組みですが「即時削除」か「保護しながら保持」かで設計思想が異なり、対象機能も一致しません。
日本企業の情報セキュリティチェックシートでよく聞かれる項目に、Anthropicの一次資料だけでどこまで具体的に回答できるかをまとめます。
Anthropicがロボット犬を使った人間とAIのアップリフト実験Project Fetchを公開。Claudeを使えたチームは使えなかったチームの約2倍の速さでタスクを終えました。
Anthropicの論文が示す、モデル評価スコアの差が統計的に有意かを判定する5つの推奨手法をまとめます。
Anthropicは不正利用で停止した832アカウントをMITRE ATT&CKに照らして分析。AIの使われ方が侵入後の工程へ移り、既存フレームワークが追いつかない実態が見えました。
Claudeは1トークンが英語で約3.5文字相当ですが、日本語では同じ基準が崩れます。根拠と実測の方法をまとめました。
Anthropicがオープンソース公開した行動評価ツールBloomの仕組みと、人間評価との相関0.86を出した検証結果を解説します。
Anthropicが2023年に始めた「フロンティア脅威レッドチーミング」は、生物兵器領域の実証実験から、現在のサイバー脅威分析まで続く安全対策の土台です。
Claude APIのリクエストサイズ上限はエンドポイントごとに32MB・256MB・500MBと異なります。413エラーがCloudflareとAPIサーバーのどちらで発生しているかの見分け方も扱います。
Anthropicが運用する3種類の脆弱性報告制度を整理。対象・報酬・応募窓口の違いと、報告時に押さえるべき実務のポイント。
AnthropicのTransparency Hubは、Model Report・System Trust and Reportingの2ページとVoluntary Commitmentsアンカーで構成されます。3窓口の読み分けを解説。
AnthropicとBoston Consulting Groupが2023年9月に提携。Claude 2をBCGの企業顧客向けAI活用支援に組み込みました。
Opus 4とSonnet 4のサイバー攻撃能力をPattern Labsと検証した結果をまとめます。柔軟な戦略転換と多段階攻撃の実行力が伸びた一方、長時間の計画維持には限界が残ります。