データ重複とスケーリング則で性能はどう壊れるか — Anthropic研究
学習データのごく一部を繰り返すだけでモデル性能が半分規模に劣化する現象をAnthropicが解明。二重降下とinduction headsへの損傷を読む。
全829件を新しい順に並べています(301〜330件目)。カテゴリのトップへ戻る
学習データのごく一部を繰り返すだけでモデル性能が半分規模に劣化する現象をAnthropicが解明。二重降下とinduction headsへの損傷を読む。
「渡邊」と「渡辺」、「髙橋」と「高橋」は見た目が近くても別の文字です。異体字を含む氏名をClaudeで正確に扱うための、確認手順と実践的な指示の出し方を解説します。
Claudeの拡張思考(extended thinking)に表示される思考過程が、実際の判断根拠と一致するとは限りません。Anthropicの実験でわかった忠実性の実態と、Claude Codeで思考ログを読むときの注意点をまとめます。
Claudeを人間向けサイバー競技会7大会に参加させた結果を検証します。上位25%に入る大会もあれば0問正解の大会もあり、強さと弱さの境界が明確に見えます。
Anthropicが13万件超の会話を分析。恋愛・仕事の相談やコンパニオンシップにClaudeを使う会話は全体の2.9%、うちコンパニオンシップ・ロールプレイは0.5%未満でした。
米国CAQが公表し日本の公認会計士協会が翻訳した「生成AIの時代の監査」のリスク評価軸を、監査法人や経理部門がClaudeを財務報告プロセスで使う際の点検リストに転用する方法をまとめます。
2022年にAnthropicが公開したRLHF実装の原点論文。週次で選好モデルを更新する「iterated online training」の仕組みと、報酬とKL距離の関係を読む。
Claude Codeやclaude.aiのセッションは既定で6年保存され、read:compliance_user_dataを持つ鍵の保有者が読めます。保存期間と閲覧権限が何で決まるかを一次資料から示します。
AnthropicはClaude Opus 4.6がFirefoxのWasm型混同バグからエクスプロイトを組み立てた実験を公開しました。同条件で他の5モデルは全て失敗しています。
Anthropicが公開したcrosscoderは、複数レイヤーや複数モデルをまたいで特徴を取り出す解釈手法です。Claude 3 Sonnetのファインチューニング前後を比較した実験結果を読み解きます。
人間の有害性ラベルなしで無害なアシスタントを学習させたAnthropicの2022年論文。原則リストとAIフィードバックで訓練するSL-CAI/RL-CAIの仕組みを読む。
AnthropicがClaudeの価値観の拠り所として公開する文書がConstitutionです。安全・倫理・ガイドライン遵守・有用性の4つをどの順で優先するか、誰の指示にどこまで従うかを解説します。
AnthropicがClaude 3から導入した「キャラクター訓練」の狙いと手法を、公式論文から読み解きます。憲法とは別の設計単位です。
社内メール・議事録・稟議書では求められる敬語の格が違います。読み手との関係を明示する・実例を1〜2個渡すという2つの技術で、Claudeの出力レベルを狙って揃える方法を解説します。
AnthropicのEconomic Index第3弾は初めて国・州単位の地理データを扱いました。所得とClaude利用の相関、米国内の州別偏り、automation優勢への転換までをまとめます。
Anthropicが導入した「economic primitives」の5指標を解説します。生産性押し上げ効果の推計を1.8ポイントから1.2ポイントへ下方修正した経緯まで追います。
縦書きにルビを振った日本語文書をClaudeに読ませて検証した。読み順とルビの扱いをどこまで正確に処理できるか、公式の視覚解析の仕様と合わせて解説する。
Anthropicが研究する暗号化推論技術Confidential Inferenceの仕組みと、企業のデータガバナンス担当者が押さえるべき現状を解説します。
Claude導入稟議の役割分担を、AI事業者ガイドライン(利用者編)とAnthropicの契約文書に沿って情シス・法務・現場部門の3者に切り分ける。誰が何を確認するかを一次情報で整理する。
ハーバードの物理学者がClaude Opus 4.5に理論物理の計算を任せ、110稿・36Mトークンを経て2週間で論文を仕上げた実験の詳細です。
偽の対話を256個並べるだけでモデルの安全策を突破できる攻撃。2024年にAnthropicが公表したMany-shot Jailbreakingの仕組みと、攻撃成功率を61%から2%に落とした対策を追う。
Claudeのプロンプトキャッシュは同じ仕組みでも、API課金では単価、Claude Code/claude.aiのサブスクでは利用上限の消費として効きます。TTLの既定値も課金形態で変わります。
2025年11月、Claudeモデル廃止時に重みを会社存続期間保存し、引退前に本人へ面談する方針が公表されました。Opus 4の自己保存的な挙動が動機です。
弁護士法23条の秘密保持義務を踏まえ、Claudeへの入力が抱えるリスクと、ゼロデータ保持(ZDR)やHIPAA対応の契約でどこまで下げられるかを、利用形態別に対比します。
324人が3.9万件の攻撃を仕掛けた2022年の実験。RLHFモデルは規模が大きくなるほど攻略しにくくなる一方、判定者同士の一致率は低いという実測結果を追う。
Anthropicの2023年論文が明らかにした「指示するだけでモデルの差別が減る」現象。BBQベンチマークで偏見スコアが84%減った実験と、22Bという分岐点の中身を追う。
Sonnet 4.6用のmax_tokensをそのまま流用すると、Sonnet 5では出力が途中で切れます。原因と、effortとmax_tokensの調整方法をまとめます。
Canva・Shopify・Stripe・Block・Coinbaseが公式に公開した導入実績を業種横断で比較し、大手企業がClaudeを選ぶ理由と乗り越えた壁を整理する。
コネクタのアクション制限は読み取り/書き込みを組織全体で縛れますが、Team・Enterpriseで追跡できる範囲がどこまで違うかを、権限設定と監査ログの両面から示します。
Compliance APIの保持期間・証跡範囲を、日本企業の内部統制やJ-SOX対応で求められる記録保存の要求と突き合わせてまとめます。