Claude
-
Kimi K3, and what we can still learn from the pelican benchmark#LLM Moonshot AI が2026年7月16日に発表した2.8兆パラメーター推論モデル Kimi K3 のレポートと、Simon Willison によるペリカンベンチマークの有効性と限界の考察。 Kimi K3: 2.8兆パラメーター、初の「open 3T-class モデル」(DeepSeek V4 Pro の1.6Tを超える)、open weight は2026-07-27予定 ベンチ: 4.8 max・GPT-5.5 high には勝るが、Claude Fable 5・GPT-5.6 Sol には負ける Artificial Analysis: 長期知識作業Elo 1547(Claude Fable 5に次ぐ2位)、Arena.ai Frontend Code arena 1位 価格: $3/$15 per Mトークン(中国AIラボ最高値、Anthropic Claude Sonnet シリーズと同水準) 推論effortは"max"の1段階のみ。ペリカン生成で推論トークン13,241消費・計25セント 隠し系統プロンプト約85トークン存在の可能性("hi"で86トークン計上)、漏洩拒否 ペリカンベンチマーク: 21ヶ月経過し品質との相関はほぼ断絶。今も「実際に試した証明」「コスト・推論量の粗い推定」「SVG/空間認識確認」「同一ファミリー内進化比較」として価値を持つ https://simonwillison.net/2026/Jul/16/kimi-k3/ ブログ
-
Claude Opus/4.8#LLM Anthropic社が2026年5月28日に発表したClaudeの最上位モデル agenticタスクでの判断力が向上し、コード欠陥の見逃しが前世代比で約1/4に Dynamic Workflows(数百並列のサブエージェントによる大規模オーケストレーション)に対応 Fast modeが2.5x高速・従来比3x安価($10/$50 per Mトークン)、本体価格は4.7据え置きで$5/$25 Messages APIでタスク途中のsystemエントリ挿入がprompt cacheを壊さず可能に ベンチ: Online-Mind2Web 84%、Super-Agentで全ケース完遂、Legal Agent Benchmarkで初のall-pass 10%超 https://www.anthropic.com/news/claude-opus-4-8
-
Claude Opus/4.6#LLM Anthropic社が2026年2月5日に発表したClaudeの最上位モデル コンテキストウインドウが1Mトークン(ベータ)に拡大、Opus級モデルでは初 長文脈検索でMRCR v2スコア76%を達成し競合(18.5%)を大幅に上回る Terminal-Bench 2.0でエージェンティックコーディング最高スコアを記録 GDPval-AAでGPT-5.2を約144 Eloポイント上回る Claude CodeにAgent Teams機能(並列自律作業)が追加 Adaptive thinking、effort制御(low/medium/high/max)、128k出力トークンなどのAPI機能を搭載 https://www.anthropic.com/news/claude-opus-4-6
-
Claude Fable/5#LLM Anthropic社が2026年6月9日に一般提供を開始したClaudeの最上位モデル。最も要求の厳しい推論と長時間の agentic 作業向け コンテキストウインドウは1Mトークン(デフォルト)、出力は最大128kトークン 価格は$10 / $50 per Mトークン(input / output) adaptive thinking が常時オンで無効化できず、raw な思考過程は返さない https://platform.claude.com/docs/en/about-claude/models/introducing-claude-fable-5
-
Claude Code#Programming #LLM CLIで直接動作する会話型エージェント型コーディングツール Anthropic社が提供しClaudeモデルの利用を前提にする IDEとの統合が可能 https://docs.anthropic.com/ja/docs/claude-code/overview
-
The new rules of context engineering for Claude 5 generation models#LLM Anthropic社が2026年7月24日に公開した、Claude 5世代モデル向けにコンテキストエンジニアリングの前提を見直す記事 Claude Opus 5やClaude Fable 5ではClaude Codeのシステムプロンプトを80%以上削減してもコーディング評価で計測可能な性能低下はなかったと報告 6つの転換を提示: ルールの列挙→モデルの判断への委任、例示→インターフェース設計、事前の全量投入→progressive disclosure、指示の繰り返し→簡潔なツール説明、CLAUDE.mdでの手動メモリ→auto-memory、簡素なスペック→リッチな参照資料 コンテキストの構成指針: システムプロンプトはプロダクト固有の文脈、CLAUDE.mdは軽量なリポジトリ概要と注意点、Skillsはチーム固有の知見、参照資料はスペックやモックアップなどの詳細 コンテキストの簡素化と適正化を自動支援する claude doctor コマンドも紹介 https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models
-
Statement from Dario Amodei on our discussions with the Department of WarAnthropic CEO Dario Amodeiによる、Claudeの米国国防省への展開に関する声明 2つの譲れないセーフガードを提示した 大規模な国内監視にAIを提供しない 完全自律型兵器にAIを提供しない 国防省はこれらの条件撤回を要求し、拒否すれば「サプライチェーンリスク」に指定すると圧力をかけたが、Anthropicは倫理的境界線を維持する方針を表明 https://www.anthropic.com/news/statement-department-of-war
-
Claude is a space to thinkAnthropicがClaudeを広告フリーに保つ方針を表明した記事 AIアシスタントとの会話はセンシティブな情報を含むため、広告モデルとは根本的に相容れない 広告はユーザー支援よりも収益化への誘導というインセンティブの歪みを生む 収益はエンタープライズ契約と有料サブスクリプションから得て、Claudeの改善に再投資 60カ国以上の教育者プログラム、政府パートナーシップ、非営利割引でアクセスを拡大 ユーザー主導のアクション(調査・比較・購入の支援)を通じた商取引は支援する https://www.anthropic.com/news/claude-is-a-space-to-think