今週のAIニュースで最も実用的だったのは、ベンチマークの順位争いよりも、価格や速度、そして実際の使い方に関わる変化です。Anthropicは、安く大量にこなす作業向けの小型モデルClaude Haiku 5.5を公開しました。OpenAIは28日間にわたる毎日のリリースを始め、GPT-6とIntelligent UIをすべてのユーザーに開放しました。xAIはGrok Botを、ほかの企業のモデルにも作業を任せられるアシスタントに変えました。何が変わったのか、費用はどれくらいか、それぞれどこで試す価値があるのかを整理します。
Claude Haiku 5.5は最高性能より低コストを取る
AnthropicはClaude Haiku 5.5を、同社で最も高速でコスト効率の高い小型モデルと位置づけています。狙いは最先端の推論ではなく、要約、データの圧縮、データベースへの問い合わせ、分類といった、繰り返しが多く量の多い作業です。ソフトウェア開発では、より大きなモデルから下りてくる小さな作業を処理する補助役、つまりサブエージェントとして、Sonnet 5.5やOpus 5.5と組み合わせて使うようAnthropicは勧めています。
ベンチマークでは大きなモデルに追いつけませんが、前世代のHaikuからは大きく伸びています。
| ベンチマーク | Haiku 5.5 | Sonnet 5.5 | Haiku 4.5 |
|---|---|---|---|
| GDPval-AA v2.1、知的業務 | 1620 | 1840 | 735 |
| AA-Briefcase v1.1、知的業務 | 1578 | 1824 | 614 |
| OSWorld 2.1、コンピューター操作 | 72.4% | 83.9% | 15.7% |
OpenAIのGPT-6 Lunaは、GDPval-AA v2.1で1437でした。Haiku 5.5はほかに、Humanity’s Last Examでツールなし45.9%、ツールあり57.4%、エージェント型コーディングのテストTerminal-Bench 4.0で39.2%、FrontierCode 1.1と視覚推論のテストChartographyでいずれも46.4%を記録しています。
より興味深いのは、費用あたりの精度です。Claudeでは、答える前にモデルがどれだけ長く考えるかを決めるeffortを、LowからMaxまで設定できます。OSWorld 2.1では、extra-high effortのHaiku 5.5が1回の試行あたり$0.28で精度67.6%に達しました。medium effortのSonnet 5.5は、1回あたり$0.93で66.0%でした。このテストでは、小さなモデルに長く考えさせることで、3分の1以下の費用で大きなモデルに並んだことになります。
| 100万トークンあたりの価格 | Haiku 5.5、10万トークン以下のプロンプト | Haiku 5.5、10万トークン超 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|---|
| 入力 | $0.10 | $0.50 | $1.00 | $2.00 |
| 出力 | $0.50 | $2.50 | $5.00 | $10.00 |
トークンはモデルが読み書きする文章の小さな単位で、料金もこの単位で決まります。キャッシュの読み出しは100万トークンあたり$0.01(10万トークン超は$0.05)、キャッシュの書き込みは$0.125(10万トークン超は$0.625)です。Artificial Analysisの独立したランキングでは、Haiku 5.5は知能指数でKimi k3、GLM 5.3、Grok 4.7より下に位置しますが、1タスクあたりの費用は約$0.21と最も安い部類に入ります。出力量は多く、1タスクあたりの推論トークンと出力トークンの量はSonnet 5.5に次ぐほどです。それでもトークン単価が低いため、総額は安く収まります。
Haiku 5.5が得をする場面
月$20以上の有料Claudeプランを使う人は、チャット画面では引き続きSonnetやOpusを使うことになりそうです。Haiku 5.5が最も生きるのは、トークンの節約が積み重なる場面です。APIによる自動化、Claude Code、エージェント向けのツールがそれに当たります。Anthropicが勧める構成は、大きなモデルが計画と判断を担い、コードの参照や整形のような素早い下位作業をHaiku 5.5が受け持つ形です。

▲ 大きなモデルから小型サブエージェントへの分担
ClaudeにDashboardsとMotionが加わる
Anthropicは、業務データをビジュアルに変える2つのツールも発表しました。Claude Dashboardsは、Google BigQuery、Databricks、Snowflake、SalesforceといったデータウェアハウスやCRMプラットフォームに直接つながり、そこからリアルタイムのダッシュボードを作ります。有料プランでベータとして使えます。同時に、Claude Docs、Slides、Designはベータを終え、Freeを含むすべてのプランで使えるようになりました。
Claude Motionは、プロンプトやアイデアをClaudeの中でアニメーションの解説動画やモーショングラフィックスに変えます。ある例では、2つの駅の間を行き来するシェアサイクルの出発の流れを38秒のアニメーションにしました。現時点でMotionはTeamとEnterpriseプランに限られています。個人向けのPro(月$17 ~ $20)とMax(月$100 ~ $200)の加入者は使えません。つまり、早期アクセスを売りの一つにする月$200のMaxプランでは使えない機能を、月$20のTeamの1席が使えることになります。個人のヘビーユーザーにとっては不可解な判断に見えます。同様のアニメーションはこれまでもJavaScriptやRemotionのようなフレームワークで作れましたが、Claudeの中で直接描けることで、制作の手間はかなり減る可能性があります。
OpenAIの28日連続リリース
OpenAIは、10月4日から28日間、毎日製品の改善かリセットを一つずつ出すと表明しました。最初の1週間で、ユーザーが体感できる変化がすでにいくつも出ています。
GPT-6とIntelligent UI
10月7日、OpenAIはGPT-6とIntelligent UIを、刷新したChatGPTの画面とともにすべてのユーザーに公開しました。Intelligent UIは、長い文章の代わりに、図、タップできるボタン、入力フォーム、インタラクティブなグラフなどの操作要素を回答の中に組み込みます。
- 自転車の組み立て:7段変速の自転車の分解図を示し、フレーム、ホイール、駆動系、ブレーキ、コックピットを個別に表示できる
- 夕食の計画:日曜日のラムのロースト。客1人あたりの肉の重さを計算するツール、材料カード、下ごしらえの予定表を用意する
- 旅行:7日間のイタリアの結婚式旅行。日ごとの服装、イメージカード、インタラクティブな荷造りチェックリストを作る
- 小さなツール:5人で会計を割り勘する計算機をチャットの中で作る
思考の度合いをInstantにして4ストロークエンジンの仕組みを尋ねると、吸気、圧縮、燃焼、排気の各段階を図解した答えがほぼすぐに返ってきます。OpenAI社内のエージェント評価では、GPT-6がより高い精度を出しながら、応答時間を215秒から109秒に縮めています。
速度、承認、会議メモ
- 10月5日:GPT-6 AstraとGPT-6.1 Solの標準の生成速度が、サブスクリプションとパートナーのAPI全体で約50%上がりました。
- 10月6日:ChatGPT WorkとCodexで、サインインしたすべてのアカウントにAuto-reviewが無料で提供されました。権限メニューには、Ask for approval、Approve for me、Full accessの3つの選択肢があります。Approve for meを選ぶと、作業中のエージェントの動きを別のエージェントが見守り、リスクが高そうな操作や意図から外れた操作のときだけユーザーに確認します。長い作業ですべての手順を承認する疲れをなくすことが狙いです。
- Meetingsプラグイン:macOS版ChatGPTデスクトップアプリのProとBusinessのユーザー向けにベータで提供されています。Zoom、Google Meet、Slackの通話中にシステム音声とマイクを取り込み、要約と次にやることをまとめ、メモをChatGPTのメモリーに残すので、後からフォローアップのメールを書いたり計画を更新したりできます。
- 開発者向けプラットフォーム:長い文章の代わりに構造化された判断を素早く返すDecisions APIがパブリックベータになりました。OpenAIはまた、5段階だった利用上限の区分をBuild、Launch、Growの3段階にまとめました。APIの累計利用額が$500に達するとGrowになり、フロンティアモデルで毎分最大4,000万トークン、Lunaで毎分1億8,000万トークンまで使えます。
UltrafastとInstant Steering
10月8日、OpenAIはCodex、ChatGPT Work、APIでGPT-6.1 SolのUltrafastモードを追加しました。標準のSolより最大8倍速く生成しますが、価格もかなり高くなります。
| GPT-6.1 Solの速度 | 標準との速度比 | 100万トークンあたりの入力 | 100万トークンあたりの出力 |
|---|---|---|---|
| Standard | 1倍 | $2 | $10 |
| Fast | 2倍 | $4 | $20 |
| Ultrafast | 最大8倍 | $12 | $60 |
Ultrafastの料金は標準の6倍で、ChatGPTで使うには月$500のProプランが必要です。ユーザー向けのリアルタイムアプリ、対話型のコーディング、デスクトップを操作するエージェントのように遅延が本当のボトルネックになる場合を除けば、この割増料金を正当化するのは難しそうです。
ChatGPT WorkのInstant Steeringを使うと、応答の生成中に方向を変えられます。犬の画像を頼んだ後に狼への変更を入れてSteerを押すと、最初の依頼が終わるのを待たずにすぐ切り替わります。出力がずれ始めた瞬間に軌道を修正できるので、待ち時間と計算資源の両方を節約できます。

▲ 視覚的な画面要素で答えるChatGPT
Grok Botがほかの企業のモデルに作業を振り分ける
イーロン・マスクは、Grok Botが作業ごとに最適なモデルへ処理を送り、そこにはClaude Opus 5.5、Midjourney、Sunoといった外部のモデルも含まれると発表しました。xAIのアシスタントは自社モデルの中にとどまらず、外部のモデルのほうが良い結果を出せそうなときはそちらを呼び出します。現在、最先端のベンチマークではAnthropicのモデルが首位に立っていることから、Claude Opus 5.5を使えることは実質的な強みに見えます。
Grok Botは、Xの投稿を検索し、読み、監視することもできるようになりました。特定の分野で伸びているテーマを追い、反応が集まりつつある投稿を見つけ、エンゲージメントに基づいて投稿の予定を提案します。設計も、DotやMuseのような単一スレッドのアシスタントとは異なります。Gmailにつないで返信の下書きを作るEmail Triageや、業界のニュースや新しい論文を追うResearch Botといった専門エージェントを使い、Chief of Staffエージェントが大まかな指示を受けて適切な専門エージェントに任せます。ある例では、あるアカウントの直近75件の投稿を分析して反応が最も強い時間帯を見つけ、新しい投稿案を作りました。複数の手順からなる事務作業を一つのチャットに詰め込むより、専用のエージェントに分けるほうが柔軟なやり方に見えます。
そのほかに知っておきたいリリース
- Mistral Large 4:学習済みの重みを公開して誰でも動かせるオープンウェイトのモデルで、トークンごとにネットワークの一部だけを使うMixture of Expertsとして作られています。総パラメーター数は1兆で、パラメーターはモデル内部の学習済みの値を指し、トークンごとに520億が動きます。Mistral AIは、中国の研究機関の主要なオープンウェイトモデルと同等の性能だとしています。
- Reflection Beam:総パラメーター5,010億、アクティブ230億のオープンウェイトモデルで、Reflectionによると25兆8,000億トークンで事前学習しました。まだダウンロードはできません。どちらのモデルも、個人のパソコンではなく自前のサーバーを運用する企業向けです。
- Google Playground:文章で説明するだけで遊べる2Dや3Dのゲームを作る実験的なウェブアプリです。米国の18歳以上のユーザーが使えます。
- Google AI Edge Foresight:端末上のモデルで会議を文字起こしして要約するmacOSアプリで、音声もメモもパソコンの外に出ません。
- Gemini Agent:Google Cloudの企業向けエージェントで、長い作業を数時間から数日にわたり文脈を失わずに続け、Google Workspace、Microsoft 365、Slack、Salesforce、Jira、GitHubとつながります。
- SynthID Detector:画像、動画、音声に隠れたデジタル透かしを調べる公開ツールです。対応する提供元の透かし入りコンテンツしか確認できず、すべてのAI生成メディアを見分けられるわけではありません。
- Hark Pro:Figureの創業者ブレット・アドコックが発表したコンピューター操作エージェントで、画面を直接操作して日用品の再注文、経費の領収書の提出、サブスクリプションの解約をこなします。
- Meta Muse:Metaは、Raspberry PiやESP32ボードでMuseを動かすためのハードウェア設計とコードをオープンソースにしました。
- Anthropicの利用ポリシー:研究目的のない、Claudeに対する継続的で不必要な虐待を禁止しました。ふつうの不満の表明や、意図的に弱点を探るレッドチーミング、モデルのテストは対象ではありません。
- 雇用の見通し:ノーベル賞を受けた経済学者ダロン・アセモグルは、今後10年でAIが置き換える人間の仕事は約5%にとどまると見積もっています。この見方は、Microsoft AIのムスタファ・スレイマンが共有した記事で紹介されたものです。ほぼすべての仕事が自動化されるという業界でよくある予測よりも、はるかに慎重です。
今週試したいこと
共通しているのは、同じ仕事をより安く、より速く、より少ない中断でこなす方向への動きです。コンピューター操作エージェントも各社から次々に登場しており、機能が似てくるにつれ、すでに使っているエコシステムが選択の決め手になるかもしれません。
- APIやClaude Codeで繰り返しの作業を動かしているなら、分類、要約、参照といった下位作業をClaude Haiku 5.5に移し、請求額を比べてみましょう。
- ChatGPTでは、計算、予定、仕組みの説明など図があると助かる質問をInstantで尋ね、Intelligent UIが何を作るか確かめてみましょう。
- ChatGPT WorkやCodexに長い作業を任せるなら、Auto-reviewのApprove for meを試してみましょう。リスクの高い操作は引き続きユーザーに確認が戻ってきます。
- Ultrafastは遅延が本当に重要な場面に限って検討し、6倍の料金と月$500のプランを先に考慮しましょう。
- 会議メモのツールを選ぶときは、データがどこに置かれるかで決めましょう。MeetingsプラグインはメモをChatGPTに残し、Google AI Edge ForesightはすべてをMacの中で処理します。