米Anthropicは10月7日、小型の大規模言語モデル「Claude Haiku 5.5」を公開した。前の版の「Claude Haiku 4.5」と比べ、10万トークン以下の要求では料金を最大9割下げた。同社は、実際の業務にかかる費用は平均で約75%減ると見込む。9月22日の「Opus 5.5」、28日の「Sonnet 5.5」に続き、約束していた5.5世代の3モデルがこれでそろった。上位モデルの料金も一部下げ、価格競争に正面から加わった形だ。
入力100万トークン0.1ドル、前の版の10分の1
APIのモデル名は「claude-haiku-5-5」。同社のサービスのほか、Amazon Web Services、Google Cloud、Microsoft Azureでも使える。
料金は、10万トークン以下の要求なら入力100万トークンあたり0.1ドル、出力は同0.5ドル。Haiku 4.5の入力1ドル、出力5ドルの10分の1になる。同じ入力を再利用する「キャッシュ」の読み出しは100万トークンあたり0.01ドルだ。10万トークンを超える要求は入力0.5ドル、出力2.5ドルで、値下げ幅は5割にとどまる。まとめて処理する「バッチ」なら、さらに半額になる。
「9割」がそのまま「75%」にならない理由について、同社は文章をトークンに分ける仕組みを新しくした影響を挙げる。同じ作業でもトークンの数がやや増えるという。料金表の値下げ幅と実際の請求額の下がり方が違う点は、導入を考える企業にとって見落とせない。
同時に、中位モデルのSonnet 5.5もキャッシュ読み出しの料金を100万トークンあたり0.2ドルから0.1ドルへ半分にした。同社は、AIエージェントの典型的な使い方で約2割の節約になるとしている。

性能は大幅に向上、操作系の指標で差
同社の測定では、性能も大きく伸びた。パソコンの画面を操作して作業をこなす力を測る「OSWorld 2.1」で、Haiku 5.5は72.4%を記録した。Haiku 4.5の15.7%から4倍以上になる。端末での作業を測る「Terminal-Bench 4.0」では、Haiku 4.5の0%に対し39.2%だった。ただしこれは推論を最大まで使った設定での値で、中程度の設定では約20%になる。
競合と比べると、米OpenAIの小型モデル「GPT-6 Luna」は、OSWorld 2.1で48.9%、Terminal-Bench 4.0で16.4%だった。どちらもHaiku 5.5の方が上回る。一方、同じAnthropicのSonnet 5.5は、それぞれ83.9%、70.6%で、Haiku 5.5との差は残る。これらの数値は同社の発表によるもので、独立した検証はまだ限られる。
速さについて、同社はHaikuを「標準の速度では最も速いモデル」と位置づけるが、1秒あたりの出力量などの具体的な数値は示していない。先行して使った企業からは、応答までの時間が半分になった、3割以上短くなったという声が出ている。
価格はGPT-6 Lunaと並ぶ
入力0.1ドル、出力0.5ドルという料金は、GPT-6 Lunaの基本料金と同じ水準だ。ただし、長い入力には差がある。Haiku 5.5は10万トークンを超えると料金が上がるが、Lunaの割増は27万2000トークンを超えてからになる。長い文書をまとめて読ませる使い方では、Lunaの方が安くなる場面もある。
用途として同社が想定するのは、文書の要約や情報の分類、データベースへの問い合わせ、上位モデルが進める作業の一部を担う役割などだ。最大100万トークンの文脈を扱える。上位モデルが計画を立て、Haikuが大量の細かい作業を安く速くこなす。企業向けの業務で、こうした分担の土台になるモデルと位置づけている。
同社は合わせて、個人向けの上位プラン「Max」やチーム向けプランの利用者に、毎月100〜500ドル分のAPIの利用枠を配ると発表した。開発用のSDKには、ブラウザーやパソコンを操作する機能を試験的に加えた。悪用を防ぐため、サイバーセキュリティに関わる用途の制限はHaiku 4.5より厳しくしたという。
安さが導入の決め手に
小型モデルの値下げは、AIエージェントの普及と深く関わる。エージェントは1つの依頼を片付けるまでに何度もモデルを呼び出すため、1回あたりの料金の差が積み重なって大きな額になる。OpenAIも9月末、上位モデルに迫る性能を5分の1の価格で出すと発表したばかりだ。
性能の高さを競う段階から、同じ作業をどれだけ安く速くこなせるかを競う段階へ、各社の重心は移りつつある。利用する側にとっては、料金表の数字だけでなく、自社の作業で実際に何トークン使い、いくらかかるのかを試して比べることが、これまで以上に大切になりそうだ。

コメントを残す