Meta Museは日常のメッセージや定期タスクを追いやすく、OpenAI DotsはSlackやCodexと組み合わせたときに自然に機能しました。違いが最もはっきり表れたのは、人が手を貸す必要があった場面です。Dotsは一部の作業で適切なコンテキストを見つけるのに助けが必要で、任せたタスクを意図したプロジェクト内にとどめることにも手間取りました。一方、Museには記憶やスケジュールを確認できる場所がわかりやすく用意されていました。どちらも常駐型のクラウドエージェント、つまり会話をまたいで作業を続け、スケジュールに沿ってタスクを実行できるエージェントですが、強みが出たワークフローは異なります。

メッセージを送り、返信を追う

Dotsは職場でのやり取りをすっきりこなしました。Slackとネイティブに接続すると、チームチャンネルで依頼を受け取り、処理中であることを示したうえで、Slackのスレッドに返信しました。共有チャンネルでは、チームメンバーがメンションでエージェントに呼びかけることもできました。すでにSlackで連携しているチームにとって価値があったのは、答えそのものだけではありません。返信が、依頼の始まった会話にひも付いたまま残ったことです。

MuseはWhatsAppを通じて同様のメッセージタスクをこなしました。スマートフォンから送ったメッセージには数秒以内に返信があり、その会話はMuseのデスクトップ版ダッシュボードにも表示されました。このやり取りの間、デスクトップ側の表示は閲覧専用で、スマートフォンの会話とダッシュボードが返信先として競合しないようになっていました。Museはほかの話題をサイドチャットに分け、すべての議論を一つの長い履歴に詰め込まないようにもしていました。

これらはまったく同じタスクではありません。Slackではチームでの共同作業を、WhatsAppではスマートフォンとデスクトップをまたぐ個人の会話を試しました。どちらのエージェントもこのやり取りを完了しました。選ぶ基準は、返信をどこに届けたいかです。同僚が追えるチームのスレッドなのか、中央のダッシュボードで確認できる個人メッセージなのかによって決まります。

返信スレッドを形づくる抽象的なチームのメッセージと、デスクトップの会話パネルに映るスマートフォンのメッセージ

▲ チームのスレッドと同期する個人メッセージ

コンテキストと定期作業を整理する

記憶の扱い方は2つのエージェントで異なりました。Museは編集可能なMEMORY.mdとSOUL.mdのファイルを公開していました。これはMarkdownファイル、つまり簡単な書式を付けたプレーンテキストの文書で、一方には長く保持する事実や好みを、もう一方にはエージェントの人格と対話のルールを記します。これにより、Museに何を覚えさせ、どう応答させるかを確認・変更できる場所が直接用意されていました。ただし、それだけで記憶したすべての事実が正しいと確かめられるわけではありません。

Dotsは既存のChatGPTの記憶を自動で取り込み、そのうえで独自のコンテキストを築きました。ある試行では、最初に古い情報を持ち出しました。Codexの記憶とローカルファイルを指し示すと、より関連の深い資料に向かうようになりました。すでにそれらのツールで仕事をしている人にとっては、この連携で同じ設定を繰り返す手間を省けます。ただしこの結果からは、引き継いだコンテキストをエージェントが継続的な作業に使う前に確認が必要なこともわかります。

プロジェクトの整理では差がより鮮明でした。既存のCodexプロジェクト内でブレインストーミングを頼まれたDotsは、任された作業をそのプロジェクトの下にまとめず、全体のRecents欄に別々の会話スレッドを作りました。タスクがどこに属するかについての説明も一貫しませんでした。現実的な対処は、エージェントが指示どおりの場所に整理したと思い込まず、プロジェクトを確認して生成されたスレッドを手作業で整理することでした。

スケジュールでも同じような違いが見えました。Museは定期ルーティンと30分ごとに実行されるHeartbeatを表示し、接続したメールとGoogle Docsの確認について実行ログも備えていました。承認が必要な操作を確認できるApprovals欄もありましたが、その時点で保留中の承認はありませんでした。Dotsは米国中部時間の午後8時に設定した毎日の計画ルーティンに対応できましたが、繰り返しタスクを管理するには、Dotsのメイン画面ではなくCodexやChatGPT Workの予定タスクの管理画面を探す必要がありました。ルーティンが予定に入っていることと、あとでどこから編集するかの両方を確かめておくべきです。

確認ポイント付きの整った定期タスクのタイムラインと、手作業での整理が必要な散らばったプロジェクト会話カード

▲ 定期作業とプロジェクトの整理

成果物とモデルの性能

どちらのエージェントも、文書、ダッシュボード、プレゼンテーション、PDF、コードといった成果物を作れました。Museは成果物をArtifactsライブラリにまとめており、その例にはダッシュボードやPDFがありました。ポッドキャスト作成機能もあり、3分間のニュースブリーフィングを定期的に作る設定もできました。こうしたインターフェースの例は成果物の見つけ方や設定方法を示すもので、同じ依頼から作った2つの完成品の品質を同条件で比べたものではありません。

Dotsには別の作業手段もあり、GPT Liveによる音声通話や、ブラウザー、ターミナル、ローカルファイルを備えた接続先のコンピューター環境へのアクセスが用意されていました。こうしたアクセスは開発者のワークフローに合いますが、任せたタスクがどうなったかを確認する必要がなくなるわけではありません。Dotsの電話機能の公開デモでも期待した応答が返らなかったため、音声機能があるだけで毎回の通話が成功すると考えるべきではありません。

公表されているモデルのベンチマークは参考になりますが、上記のワークフローの結果とは別物です。DotsはGPT-6 Astraで、MuseはMuse Spark 1.3で動いています。トークンとは、モデルが処理・生成するテキストの小さな単位です。

指標 GPT-6 Astra Muse Spark 1.3
ターミナル・コーディングのベンチマーク 59% 33%
SaaS自動化のベンチマーク 68% 58%
専門業務の評価、GDPval-AA 1,542 1,672
出力生成速度 毎秒51トークン 毎秒184トークン

Astraは掲載したコーディングと自動化の指標で上回り、Spark 1.3は掲載した専門業務の評価で上回ったうえ、テキストの生成も高速でした。ただし、いずれのスコアも、特定のメッセージや定期タスク、プロジェクトの引き継ぎが正しく整理されるかどうかを決めるものではありません。

どのワークフローから試すべきか

Muse Freeは月額$0で週に最大1億トークンまで使えるため、個人のメッセージや定期タスクを低コストで試せます。Dotsには、最初のdotを含む月額$100からのChatGPT Proが必要です。この価格差が最も効いてくるのは、Codex、ChatGPT、Slackでの作業にすでにつながっている場合ではなく、エージェントを新しくワークフローに取り入れる場合です。

まずは内容をよく把握しているタスクから始めます。普段使うチャンネルでメッセージを送って返信がどこに表示されるかを確認し、続けて繰り返しタスクを予定に入れ、その編集画面を探します。Museでは、確認できる記憶ファイルと予定タスクのログを見直します。Dotsでは、引き継いだ記憶が最新かどうか、Codexに任せた作業が意図したプロジェクトに入ったかどうかを確かめます。個人のルーティンにはMuseのほうが監督しやすいと考えられ、既存の開発者向けワークスペースにはDotsのほうが合います。ただし、そのコンテキストとタスクの置き場所をだれかが確認することが前提です。