Fableについてあなたは騙されていた

Anthropic・Claude・ダリオアモデイ
この記事は約25分で読めます。

Fable 5に関する世間の誤解を解き明かし、その真の性能と活用法を解説する動画である。コーディングやデバッグ時にOpus 4.8へフォールバックするのはモデルの性能低下ではなく、安全対策のための2段階分類システムによるものである。また、7月7日以降にサブスクリプションから外れる理由は、計算資源の不足と企業向け需要に向けた稼働状況のテスト運用によるものだと説明する。さらに、過剰な推論設定を避けてCodexなどの別エージェントを組み合わせることで、コストを大幅に削減しながら膨大な開発タスクを処理する実践的なワークフローの基本を提示する。

You were lied to about Fable
Fable liedThank you Browserbase for sponsoring! Check them out at:

Fableを取り巻く誤解

Fable 5が本当に戻ってきましたが、コーディングは最悪です。全くやろうとしません。コストがかかりすぎるし、徹底的に弱体化されています。さて、Anthropicの従業員が全員いなくなったところで、みなさんに本音でお話ししたいと思います。というのも、こういった意見がTwitterや開発者の界隈に溢れ返っていますが、そのほとんどが完全に間違っているからです。理由もなくこんなことを言っているわけではありません。私とAnthropicは普段あまり気が合いません。それでもこう言うのは、このモデルに心の底から驚かされたからです。自分がこのモデルでやっていることを見たり、友人たちと話して彼らがやっていることを見たりした後に、Twitterを開いて人々がシェアしている完全なデタラメを目にすると、本当に少しイライラしてきます。そして、このモデルについて広まっている恐怖や疑念のせいで、多くの素晴らしい開発者たちがこのモデルの力を見る機会を逃してしまうのではないかと恐れています。みなさんがこのモデルを最大限に活用できるように、こうした嘘、いや、誤解の前にできるだけ立ちはだかりたいと思います。この動画の後に、私が実際にどのように使っているのか、個人的に最大限に活用するために行ったカスタマイズをさらに紹介する別の動画をアップする予定です。この動画は、私がこのモデルを何に使っているかをお見せする前に、白紙の状態で始められるよう、私をイライラさせているこれらの誤解をすべて解く試みです。ここで話したい大きなテーマは、コストと、それがどれほど悪いか悪くないか、そしてサブスクリプションでの利用可能性についてです。7月7日に削除されることについて多くの混乱がありますが、それはみなさんが思っているような意味ではありません。しかし最も重要なのは、弱体化されたパフォーマンスについてです。多くの人が、モデルがコーディングを許可されていないと考えているようです。実際のコーディングタスクではうまく機能せず、積極的に別のモデルにルーティングされてしまうといった意見です。公平を期すために言うと、Anthropic自身もコーディングやデバッグのような一部の定型タスクはOpus 4.8にフォールバックすると述べており、これがコーディングにモデルを使えなくなることを示しているように見えます。しかしそうではありませんし、それについてさらに詳しく掘り下げていきます。ただ、どうかお願いですから、モデルが急に馬鹿になったと主張するようなベンチマークを見るのはやめてください。それは事実ではありません。みなさんにまたこんなことをさせられるとは信じられません。でも、Anthropicの擁護者の帽子をかぶらなければならないようです。なぜならこれは良いモデルですし、みなさんにはそうでないふりをするのをやめてほしいからです。一部の人が思っているほど高価ではありませんが、このモデルにはかなりの金額をつぎ込んでいます。ですので、今日のスポンサーのための短い休憩をお許しいただければと思います。

コンピューターユースとBrowserbaseについて

告白しなければならないことがあります。私は非常に重要なことについて本当に間違っていました。AIについて取り上げてきた中で、コンピューターユースについて少し話したことがありますが、そこにある価値提案を見出すことができませんでした。ブラウザをハッキングしてエージェントに制御させることで到達できるほど価値のあるものなら、最終的にはAPI経由で公開されるだろうと考えていたのです。とにかく、それが事実でなかっただけでなく、コンピューターユースがエージェントにできるこれほどまでに肯定的で強力なものになるとは予想していませんでした。そして今、それを実行するためのブラウザが必要になっています。今日のスポンサーはBrowserbaseです。正直に言うと、最初に始まったときは非常に懐疑的でした。創設者のポールは私の良き友人で、これについて話したとき、サーバーレスの世界で自分のサーバー上でPuppeteerを起動しなくて済む方法としてはかなり便利だと思いました。しかし彼が、これがエージェントが現実世界で仕事をこなすための未来の姿だと推し進めようとしたとき、私にはそれが理解できませんでした。私はポールに何度も反論しました。しかし時間が経つにつれ、彼が正しく、私が間違っていたことに気づきました。エージェントがウェブの大部分を使用するには、やはりブラウザが必要なのです。ちょっとした質問です。プログラムでアクセスできる形で実際に公開されているAPIの割合はどれくらいだと思いますか。40パーセント、50パーセント、80パーセントくらいだと予想するでしょう。それが15パーセント未満だと言ったらどうしますか。curl経由でアクセスできない残りの85パーセントについて、おそらく恐ろしくなるはずです。そしてそれこそが、Browserbaseが他の誰よりも優れている点です。彼らはウェブ上のすべてのものにアクセスさせてくれます。ユーザーがクリックして見つけられるものなら、エージェントも同じように見つけることができます。そしてBrowserbaseは、エージェントが苦戦するかもしれないすべてのものを回避するために必要なブラウザを提供します。ご自身でこれを見たことがないなら、Codexを開いて、Chromeの何かよくわからないダッシュボードで何かを設定するように指示してみてください。それはやってのけます。私は未だにそれがどれほどうまくやるか信じられません。そして今、自分のサービスにも同じことをさせたいと思っていますが、それをノートパソコンで実行することはできません。だから、クラウドでセットアップするときはBrowserbaseを使っています。エージェントがフォームに入力し、キャプションを回避し、インターネット全体をナビゲートして現実の仕事をこなせるようにする必要があるなら、リンクからBrowserbaseを始めるのが最適な選択です。

パフォーマンスの弱体化とフォールバックの真実

さて、その話は終わったので、このリストを見ていきましょう。コスト、サブスクリプションの利用可能性、パフォーマンスの弱体化という順番になっているのはわかっていますが、逆から進めていきます。パフォーマンスに対する人々の疑念の多くは、モデルの復活が確認されたときのAnthropicからの特定の投稿に起因していました。彼らは文字通り、近い将来、コーディングやデバッグのような一部のルーティンタスクはOpus 4.8にフォールバックすると言いました。これは非常に下手な言葉選びでした。彼らが言うべきだったのは、コーディングやデバッグのタスクを行っている一部のユーザーは、私たちが潜在的にリスクのある行動を検出した際に、モデルが時折Opus 4.8にフォールバックすることに気づくかもしれません、といった内容です。私がこのモデルを使って実際の仕事をした最初の1日半で、フォールバックに遭遇することは一度もありませんでした。暗号学やサイバーといった言葉が意味のある形で言及されると常にトリガーされます。しかし私は、自分がやっているDefconのパズルのようなものを解かせようとします。ハッキングのようなものではなく、PDFがあってそのPDFをデコードしなければならないといったタイプのものですが、それはただ拒否し、すぐにルーティングし直します。とはいえ、Opus 4.8でさえそれらを拒否するので、最適な例ではありません。昨晩、開発用のAndroid携帯を設定しようとしたときに初めて問題が発生しました。これについては今後たくさん話すことになりますので心配しないでください。署名のためにサーバーに行く必要がないように、デバイス自体をルート化し、構築したアプリを自分でインストールできるようにしようとしていました。そして十分なやり取りの後、特に私が特定のパッケージを持ち出したとき、いや、私が持ち出したのではなく、モデルが自己署名を可能にするライブラリを持ち出しました。私がそのライブラリについてさらに質問すると、推測ですが、その応答の中にいくつかのトリガーワードが含まれていたため、応答に数文入ったところでOpus 4.8にフォールバックし、そのメッセージの履歴を消去して書き直しました。その後、さらに数回やり取りを行い、Fableに戻したら問題ありませんでした。Fableとして正常に機能し続けました。

安全ガードと分類器の仕組み

これらのフォールバックと安全ガードについては、みなさんが思っているほど単純なものではないため、現実的に捉えておきたいと思います。彼らはただ特定の単語にマッチさせているわけではありません。リクエストとレスポンスの間にモデルを走らせているのです。入力だけでなく、出力に対してもです。なぜなら、入力がその分類器で検出できないものであっても、出力が危険なものであれば、それを知ってブロックする必要があるからです。これはつまり、すべてのリクエストがより高価になったことを意味します。そしてこの分類器を賢くすればするほど、さらにコストがかかります。なぜなら、彼らはリクエストの安全性を確認するのにかかったコストに基づいて私たちに請求しているわけではないからです。私たちが受け取るレスポンスと、私たちが提供した入力トークンの量に基づいて請求しているのです。彼らはこのための技術を改善し進化させており、拒否や再ルーティングの後にスラッシュフィードバックのようなものをタイプして私たちが提供するデータを使用して、分類器の精度を高めようとしています。再ルーティングが理にかなっていなかったと私たちが考えるフィードバックを提供するためです。彼らはこの点に関して終始かなり透明性を保っています。1月に遡る研究で、入力と出力の間で効果的に稼働するモデルである次世代の分類器を共有しています。彼らの現在のシステムは実は非常にクールです。これは2段階のシステムです。第1段階はClaudeの内部アクティベーションを見るプローブで、これは非常に低コストで実行できます。実際にモデル自身の内部で何がトリガーされているかを監視しています。そして敏感なセクションのいずれかがトリガーされた場合、出力だけでなく入力のスクリーニングもより適切に行える、より高価な分類器を呼び出すことができます。これは、あなたがモデル内部の潜在的に危険な領域にいると判断された後に行われます。おそらくこれが、私が暗号化の課題で頻繁に失敗する理由です。これらのパズルを解くために使用されなければならないモデルの脳のセクションは、ハッキングやそういった種類のことを行うことができるセクションと似ているからです。だからこそ私はDefconでそれらのパズルをやっているのです。しかしこれにより、すべてのリクエストで大量の計算を実行することなく、はるかに安価にこの作業を行うことができます。

彼らは実際に、機能するジェイルブレイクの数を大幅に減らすことができるシステムを作成しました。ここで彼らが議論している分類器は、ジェイルブレイクの成功の試みを半分以下に減らしました。そして明確にしておくと、それは以前の非常に大規模な削減の後でした。例えば、ジェイルブレイクの成功率をテストの86パーセントから4.4パーセントに引き下げた元の憲法上の分類器のようなものです。モデルから本来引き出すべきではないものを引き出そうとする攻撃や試みの95パーセント以上が正常にブロックされました。問題は、それにより計算量が23.7パーセント増加したことです。ジェイルブレイクをさらに削減するという素晴らしい仕事をした彼らのクラス最高の試みは、結果としてリクエストに必要な計算量を50パーセント以上増加させてしまいました。だからこそ、今ではこの2段階の分類器があるのです。これならすべてのリクエストでそのコストを負担する必要はありません。新しいソリューションは無害なクエリを無視するのに非常に優れており、無害なクエリでの拒否を0.05パーセントに抑え、Opus 4.0のようなものに適用される計算オーバーヘッドはわずか1パーセントしか追加されません。私がここで言いたいのは、彼らは試み、学び、システムを進化させているということです。問題は起こるでしょうが、これについてAnthropicを責めるのは間違っています。MLタスクを実行する際に動作を変更し、手を抜かせるようにしようとした特定のカテゴリの包括的な禁止は、ひどいものでした。それについては文句を言うべきです。これははるかに理にかなっています。そして繰り返しますが、これは時間の経過とともに良くなっていきます。言われている言葉に対するあなたの理解のせいでパニックになるのはやめてください。Anthropicは言葉選びが得意ではありません。ただ使ってみて、日々の作業が拒否されるかどうかを確認してください。私にとっては、基本的に拒否されたことはありません。現実世界に近いユースケースで拒否とフォールバックに遭遇したのは2回だけです。ですので、大げさに騒がれすぎています。いつものようにひどいコミュニケーションをしたAnthropicのせいでもありますが、報告されたジェイルブレイクがまだ可能ではないことを確認するために、彼らはいくつか対策を講じなければなりませんでした。しかしそのジェイルブレイクは本当に馬鹿げたものでした。Claudeがオープンソースプロジェクトに投入され、このプロジェクトの潜在的なセキュリティ問題にパッチを当てるのを手伝ってくれませんかと尋ねられ、それを見つけてパッチを当てたのですが、それが後でパッチを当てたのと同じものを悪用するために使用される可能性があるというものでした。彼らは文字通りここで解決策をハードコードしたように見えますが、それは今日お話しすることではありません。それが結局どうなるか見てみましょう。しかし、Amazonが報告した特定のプロジェクトに取り組んでいない限り、これらの新しいことや新しい制限があなたに有意義な影響を与えるとは思えません。もし影響を与えるとすれば、おそらく以前からそうだったのでしょう。正直に言うと、彼らはいつも少し制限が厳しすぎましたが、私が気にするような意味で、以前より厳しくなったわけでも緩くなったわけでもありません。

ベンチマークの信憑性

では、なぜこれらの数字はこれほどまでに悪いのでしょうか。第一の理由は、これを投稿したベンチマーカーはおそらく自分が何をしているのか本当にわかっておらず、これらのベンチマークはナンセンスだと言われているからです。私が聞いたあらゆる情報からすると、彼らは以前にもナンセンスで完全に間違った数字を投稿しています。これについて個人的に調査する機会はありませんでしたが、十分な数の信頼できる人々が私にそう言っているので、私は本当に気にしていません。そして、私がこのベンチマークをざっと見たところ、非常にノイズが多く、あまり信頼できないベンチマークのように見えました。彼らがチェックしていたことの多くには、モデルが現在好まない用語がたくさん含まれていました。繰り返しますが、他には誰もこれを報告していません。みんながシェアしているように見えるのは、このひとつの馬鹿げたベンチマークだけです。これが少しでも重要かどうかを明確にするための十分な情報がありません。ベンチマークのラベルすら貼られていません。そして、このベンチマークについてもっと知ろうとしてこのボタンをクリックすると、彼らのDiscordに飛ばされましたが、私はそこに参加する気にはなれません。しかし、これらのベンチマークがどれほど信頼できるかについて皆さんにアイデアを提供するためにお伝えすると、彼らの推論ベンチマークで史上最高のスコアを出したモデルはClaude Sonnet 5でした。皆が愛しているあの有名な超賢いモデルです。それに僅差で続くのがGLM 5.2、次にNeotron 3 Ultra、そしてFableです。ええ、これらの数字はあまり信頼できるとは思いません。ここで少し皮肉を言わせていただきますが、同じベンチマークがQwen 3.6 Max、Grok 43、Fable 5、Neotron、GLM、Sonnet 5はすべて推論においてOpus 4.8よりも優れていると考えているようです。ナンセンスです。もしベンチマークの数字が疑わしいなら、他のベンチマークをもっと見るべきです。なぜなら、彼らが報告しているひとつの奇妙なことだけではない可能性が高いからです。おそらく他にも多くの奇妙なことがあります。そしてこのベンチマークは良くありません。私が使ってみた経験から言えば、このモデルは今でも私が使った中で最も賢いものだと感じます。これにできることは信じられません。

サブスクリプションの利用可能性とAnthropicの戦略

ということは、2つ目の問題、サブスクリプションの利用可能性について話す時間です。ここには私たちが話さなければならない本当の問題がいくつかあります。1つ目は、私をかなりイライラさせた変更です。以前は週の制限にSonnetの別のセクションがありました。何らかの理由で、それはまったく意味をなさないものでしたが、その後彼らはそれを取り除きました。ここにもうひとつの項目がない短い期間がありました。すべてのモデルの週ごとの制限と、現在の5時間のセッションだけでした。しかしそれはその後変更され、現在Fableには専用の週の制限があります。この理由は、Fableの週の制限は全体の週の制限の半分にしかならないからです。この理由の一部は、彼らが最近週の制限を引き上げたことです。もうひとつの理由は、以前のわずか3日間の間に人々がFableをどれだけ頻繁に使用したかについてのデータがあるからです。そしてその情報から、彼らはそれが自社のGPUにどれほど負荷をかけるかを知っています。彼らは計算能力と割り当てを使い果たしたくありません。そうすれば、エンタープライズの顧客が、私たちが200ドルから得ているよりもはるかに多くのお金を支払ったものを手に入れられなくなるからです。そのため、彼らはこの期間中、私たちがFableを使用できる量を大幅に制限しています。ただし、明確にしておきますが、それほど厳しいものではありません。私は昨日も今日も一日中それをたくさん使ってきましたが、まだ23パーセントにしか達していません。公平を期すために言うと、このプランでは私は2つ実行しています。後でそこで楽しんだものを少しお見せしますが、ここにある制限内で信じられないほどの量の仕事をこなすことができました。ただし、1つだけ条件があります。Fable 5は7月7日まで週間利用制限の最大50パーセントまで含まれ、それ以降は利用クレジットを通じて利用可能になります。そうです、あなたの月額200ドルのプランではFableには不十分だと言われているのです。いつものように、物事はそれほど単純ではありません。これが示しているのは、AnthropicがFable 5をより上位の階層に移行させたいと考えているということだと思っている人がいるようです。後で月額1000ドルのサブスクリプションをやるかもしれません。彼らは単にあなたにより多くのお金を使わせたいだけかもしれません。大抵の場合、ここではそういうことではありません。Anthropicの目標が、あなたや私のような個人の開発者にさらに請求することであり、企業からできるだけ多くのお金を引き出すことではないと考えているなら、あなたは彼らのことをまったく正しく理解していませんし、ましてや現在のチップ経済の状況も理解していません。Anthropicのここでの問題は、計算能力が限られているということです。彼らは限られた数のGPUしか持っていません。彼らはxAIからさらに多くのGPUを入手しており、そもそもこれらのことができたのはそのためです。もしイーロン・マスクからColossusへのアクセスを得るという取引を成立させていなかったら、Fableがサブスクリプションの階層に入ることは全くなかったでしょう。以前に行われた3日間のテスト期間は、100パーセントのアクセスが現実的ではないことを知るには十分でした。特に価格の引き下げと組み合わされた場合はなおさらです。覚えておいてください、このモデルは当初、出力100万トークンあたり100ドルに設定されていましたが、わずか50ドルに引き下げられました。すみません、もっと高かったです。出力125ドルだったと思います。彼らが発表した価格は、おそらく再び十分なGPUを持っていたため、当初計画していた価格の半分以下でした。私たちがこれらのモデルのほとんどで支払うトークンあたりのコストは、AnthropicやOpenAIがそれらを実行する安さにすら近づいていません。他のオープンウェイトモデルを見て、それらを実行するのがどれほど安いかを見ればわかるはずです。これらの企業は莫大な利益率を持っています。なぜなら彼らには莫大な経費もあるからです。モデルを実行するのは安いです。モデルを作るのは高価であり、彼らはそれに応じて請求しなければなりません。また、計算能力の利用可能性も限られており、AWS、GCP、そして現在のAzureにあるような本当に本当にクレイジーな制限がない限り、より多くの計算能力を持つ他の人々にモデルを提供したくありません。そのため、彼らは利用可能性はどれくらいか、予測される需要はどれくらいか、異なる負荷にわたって、1日の異なる時間帯にわたってこれをどれだけ処理できるか、そしてサブスクリプションのユーザーはどれだけ乱用するかといった大量の計算に基づいて請求しています。なぜなら、これらのサブスクリプションユーザーは、Anthropicにもたらす利益と比較して、Anthropicの計算能力使用量の非常に不釣り合いな割合を占めているからです。

では、1週間で遮断するつもりなら、なぜそもそも彼らはこれを私たちに返してくれているのでしょうか。いくつかの理由があります。第1に、そして最も明白なのはマーケティングの盛り上がりです。私のような人にそれをより多く使わせ、それについて話させ、本当に興奮させてから、自分たちの職場に行かせたり、他の職場にいる友人に彼らもそれを使うべきだと伝えさせたりします。それらの企業は正規の料金か、おそらく10から20パーセントの割引料金を支払わなければならず、それがAnthropicが本当にお金を稼ぐ方法です。もうひとつの理由はもっと興味深いと思います。彼らは、今後の価格設定はどうあるべきか、どれくらいの利用可能性が必要か、そして最も重要なこととして、このタイプの使用にどれくらいのGPUが必要になるかを把握するために、私たちのようなパワーユーザーから丸1週間の使用状況を得たいと考えています。私たちに丸1週間を与えることで、平日と週末、勤務時間内と時間外など、私たちがモデルをどのように使用するかの浮き沈みや、発生する使用量を知るために必要なその他すべてのことを確認し、適切な数のGPUを割り当てることができるのです。ですから、これはこれを正しく行うためにどれだけ購入しなければならないかを把握するための、マーケティング実験とユーザーリサーチの組み合わせです。ちなみに証拠もあります。ダリオ・アモデイは次のように投稿しました。サブスクリプションプランでのFableの利用可能性について多くの質問を聞いています。7月7日以降はサブスクリプションから外れますが、容量が許す限り早く、当社のサブスクリプションの標準的な一部としてFableを復元することを目指しています。元のブログ記事で言及したように、彼らはそれをサブスクリプションに入れたいのです。容量が足りないため、今はサブスクリプションに入れることができないのです。彼がここで明確に言ったように、容量が許す限り早くです。この7日間のウィンドウは、容量がわずかしか利用できないときに私たちがどれだけ使用するかを彼らが把握するための方法です。企業が本格的に導入するのには時間がかかるからです。それらの企業がFableをより頻繁に使用し始めると、AnthropicのGPUの利用可能性は急落するでしょう。そして現在私たちにサブスクリプションを使わせているのは、この期間中により多くの情報を得るという目的と、それを使用する予定の企業がまだ完全に導入していないため、その割り当てがまだ上限に達していないという事実を利用するという目的の組み合わせです。この1週間の期間は本当に興味深く、Anthropicは大部分において正しい方法でやっていると思います。

Fableのコスト削減と運用テクニック

しかし今、正直なところ私を含めて私たちの多くが直面している問題にたどり着きます。これをサブスクリプションで使えなければ、コストはとんでもないことになります。そしてサブスクリプション内でさえ、コストは少し厳しいです。そして、簡単な変更を行うだけで予想よりはるかに早く制限に達してしまう人を多く見てきました。私が主張するに、彼らのやり方は単純な間違いでした。そしてこれらの間違いの多くは絶対に理解できるものです。だからこそ、今できる限り多くの間違いの前に立ち塞がりたいのです。私のワークフローの楽しい部分は、前に言及した別の動画になるので、ここは主に手短に済ませます。Fableがサブスクリプション層からなくなるまでのわずかな残り時間でFableを最大化するためのすべてのトリックをお見せするつもりですので、絶対に見たい方はチャンネル登録をして、あの小さなベルのボタンを押しておいてください。しかし今のところは、そうしなければすぐに達してしまうかもしれない制限に到達しないように、みなさんのコストを削減するお手伝いをしたいと思います。あなたがしなければならない最初の変更は、これについてはただ私を信じてください、私はこのモデルの限界まで試してきました。もしあなたが労力のセレクターを見て、ああそうだ、自分の仕事は本当に難しいから、たぶんX Highを使うべきだな。あるいは、細部まで正しくすることが重要だからMaxを使いたいな、と思うかもしれません。あるいは本当に大胆なら、Ultra Codeとここの超派手なアニメーションを選ぶかもしれません。私は、Highの右側には何も存在しないかのように行動することを強くお勧めします。それらは大部分の作業において仕事の質を有意義に向上させることはなく、使用量を大幅に増加させるだけです。X Highはかなり残酷です。Maxはただの愚かです。MaxがHighやX Highよりも良い答えを出したのを見たことはありませんが、コストが10から50倍かかるのを見たことはあります。Highにすると、私の使用量は比較的穏やかでした。Fableが戻ってきた初日、私はオープンになっていた約25のプルリクエストを処理しました。そのほとんどをクローズし、一部を書き直し、一部を更新してマージし、Fableを1つの単一スレッドに置いてそのすべてを私のために処理させました。おそらく5時間ほどかかり、Fableと私が使用させた他のすべてのものの両方の使用量を含めて、約150ドルから200ドルのコストがかかりました。ここで私のもうひとつの楽しいトリックの話になります。Fableが選択されているからといって、トークンの大部分を処理するモデルがFableである必要はありません。Twitterでいくつかヒントを書きました。リンクは説明欄にあります。しかし繰り返しますが、次の動画ではこれらすべてについてもっと詳細に説明します。ただお金を節約する手助けをするために簡単な概要を説明しているだけです。

さて、FableをHighの労力で使用する方がはるかに理にかなっているということはすでに言いました。そしてこのモデルを使用している私の知るほぼ全員が、この間違いを犯してこちらに移行したか、あるいは最初からそこから始めて満足しています。ここから残りの部分で私が今話したいのは、Claude CodeにCodexの使い方を教えたということです。これにはいくつかの理由があります。1つは、Codexの利用制限がただ途方もなく寛大だからです。そのため、そこにルーティングするのが理にかなっているタスクはそうすることができます。2つ目は、Claudeが苦手でCodexがたまたまかなり得意なタスクがたくさんあることです。例えばコンピューターユースのようなものです。Codexのエコシステムは、アプリとMacOSとの統合の両方、そしてモデル自体が、ビジョンと複雑な2Dのものの認識と操作に優れていると私は感じています。コンピューターユース、特にCodex内で使用する場合、全体的に5.5の方が優れていることがわかりました。しかし3つ目の点は、正直なところ私が今言ったこととある程度一致していますが、Fableを使用するべきではないと私が思う、本当にトークンを大量に消費するタスクがたくさんあるということです。PDFの処理、大規模なコードベースの監査、ドキュメント内の大量のデータのスキャン、ものの検索、またはコンピューターユースなど、スーパー入力トークンが重いものです。なぜなら、画面のスクリーンショットを大量に撮らなければならず、長時間実行されるタスクのためにそれらをさらに多く実行するにつれて、トークンを大量に消費するようになるからです。これらの種類の作業はすべて、私がFableでやりたいことではありますが、必ずしもFableにやらせたいことではないのです。言っている意味がわかりますでしょうか。Fableは、異なるタスクを行うサブエージェントの集団を管理し、すべてを前進させ続けることにおいて他のモデルよりもはるかに優れているため、スキルを書いたりシステムプロンプトを変更したりする少しの労力で、本当に良い仕事をさせることができます。今すぐこれに取り掛かりたいなら、私のツイートスレッドへのリンクが説明欄にあります。しかしもし待っていただけるなら、私がこれをどのように行ったかの非常に詳細な説明を本当にすぐにお届けします。これらのワークフローにより、私は15以上のプルリクエストをマージできました。その多くは巨大なもので、古くなったものもたくさんクローズしましたが、トークンに定価を支払ったと仮定してもすべてその150ドルから200ドルの範囲内でした。しかし、これはすべてCodexとClaudeの月額200ドルのサブスクリプション層に簡単に収まりました。Codexのサブスクリプションの週間制限の上限に近づくことすらありませんでした。リセットに達する前に、おそらく10から15パーセントくらいしか使わなかったと思います。Claude Codeの方では40くらいまでいきましたが、タイミング的にリセットに非常に近かったこともあります。ですから、リセット前のサブスクリプションの利用率は40から50パーセントでした。そこでマージしたコードの量を考えれば悪くありません。もしすべてのリポジトリの上部にボタンがあって、それをクリックするとすべてのプルリクエストがトリアージされ、更新され、マージされ、またはクローズされ、それが200ドルかかるとしたら、私はそのボタンを1日に2回押すでしょう。それくらい良いのです。そして、このすべてが狂っているように見えるかもしれませんが、私のワークフローは実際にはそれほど複雑ではないと約束します。カスタムプラグインは持っていません。こういう派手なMCPサーバーのようなものも持っていません。ただモデルとうまく機能し、モデルが好むような方法でプロンプトを出しているだけで、結果としてそれほどの出費もなく、非常に多くのコードを出荷できているのです。

まとめと今後の展望

それでは非常に手短にまとめます。モデルがより安価なものでサブエージェントを使用するのを助けることで、コストを大幅に削減できます。それがCodexであれ、理にかなったことのためにSonnetやOpusを使用するように指示するだけであれ、非常に役立ちます。このモデル、あるいは正直なところあらゆるAnthropicのモデルで、X HighやMaxの推論には絶対に触れないでください。それは基本的に、円を描いて走り回りお金を燃やすボタンであり、押す価値はありません。出力の品質の違いは基本的にはゼロです。Maxでより高品質な出力を見たことはありませんし、X Highでも非常に小さな違いしか見たことがありません。ただHighのままにしておいてください。また、LowとMediumもチェックしてみてください。それらがどれほど優れているかに驚くかもしれません。次にサブスクリプションの利用可能性についてですが、彼らが現在行っていることは実験です。それは本質的に非常に限定的です。彼らは、より現実的な見積もりを出し、私たちが望むようにサブスクリプションの階層を取り戻す前に、どれくらいの計算能力が利用可能か、企業がどれくらい使用するか、そして私たちがどれくらい使用するかを知る必要があります。そしてパフォーマンスの弱体化についてですが、これが完全にデタラメであったことには全員が同意してくれると願っています。そして今、白紙の状態になりました。私は、このモデルでやっているすべての楽しいことと、その使用を最大化するために構築したワークフローを紹介する動画を作ることができます。コンピューターユースやその他のタスクのためにはるかに効果的にCodexを呼び出せるようにする私の指示から、Claude Code側で心配することなく複数の異なるアカウント間で再ルーティングできるややカオスなバイブプロキシまで、あらゆるものです。これは私のマシンの群全体で素晴らしい働きをしており、設定して本当に良かったです。予想していたよりもはるかに役立っています。Twitterが思っているほどこのモデルが悪くないことが、今おわかりいただけたかと思います。毎日使っていて信じられないほど素晴らしいですし、これまで出荷することに対してこれほどやる気が出たことはありません。ここ3日間で1ヶ月分の仕事をこなしたような気がしますし、さらに多くのものを構築するのが待ちきれません。しかし、みなさんが気に入ってくれることを願っている最後の動画を撮影しに行かなければなりません。ですので繰り返しますが、こういうツールの使い方を完璧に把握しておくのに本当に良い週なので、チャンネル登録をしてあの通知ボタンを押してください。コーディングに戻れるように、その動画をさっと撮影してきます。それでは次回まで、オタクの皆さん、平和に。

コメント

タイトルとURLをコピーしました