要約
- 9月10日発表の Inference は、支払ったセッション中にモデルやアプリを HTTP で利用できるサービスだ。実行後に終了する従来の計算ジョブとは異なる。
- 同社は予約した時間枠全体をノード運営者の請求対象としている。リクエストを処理した瞬間だけの課金とは読めない。
GPU を確保しても、仕事が自動的に埋まるわけではない。Ocean Network の Inference が分かりやすくするのは、専用ハードウェアを一定時間予約する費用である。その時間からどれだけ有効な結果を得られるかまでは、予約だけでは決まらない。
9月10日の公式発表によると、モデルや AI アプリは支払ったセッションの間、HTTP 経由でアクセスできる。公式文書も、一度実行して終了する計算ジョブとの違いを説明している。設定済みパッケージはモデル、エンジン設定、必要なハードウェアを組み合わせ、自分で構成する場合には調整項目が増える。モデルを動かす経路では OpenAI 互換 API、サービスやテンプレートではブラウザー画面を提供するという。これは供給者の説明であり、あらゆるモデルやクライアントの互換性を検証した結果ではない。
料金を読む際の単位は、処理件数ではなく予約枠だ。発表は、確定前に総額を表示し、コンテナ起動前に資金を預託し、ノード運営者が予約時間全体に相当する金額を受け取ると説明する。時間の延長も可能としている。サイトのトップページも予約した枠に対して課金し、その終了後は課金しないとしている。待機時間が自動返金される、あるいはリクエスト処理中だけ支払う、という意味にはならない。途中終了時の返金条件や、起動過程のどこから課金されるかは、今回の資料では具体的に確定していない。
掲載されている H200 の開始価格は1時間2.16米ドルである。実際に成立した総費用込みの見積もりでも、希望構成の空きがある証拠でもない。同社の比較表も、各社のインスタンス仕様が異なると注意している。開始時の無料時間は販促であり、継続利用の採算を示すものではない。この価格だけで、トークン課金より常に安いとは言えない。
選択したモデルを制御できることも売り文句だ。同社はセッション専用のハードウェアを用い、中央のルーティング層で別のモデルに差し替えないとする。管理画面ではログ、残り時間、延長や再起動の操作を提供すると説明している。運用を把握する手掛かりにはなり得るが、性能測定、分離の監査、同一回答の保証ではない。サイトには Beta の表示も残る。
継続稼働には別の裏付けが必要になる。5月25日の技術記事は、計算ジョブの監視、障害検出、開発者による別ノードでの再実行を扱い、長い処理にはチェックポイントを勧めている。開始前にノードが利用不能なら課金しないという例は、Inference の途中障害に対する返金保証ではない。バッチ処理を再実行できることから、常時接続のエンドポイントや状態、処理中の要求が透過的に引き継がれるとも判断できない。
本稿ではアカウント、ウォレット、モデルの接続先を実際に利用していない。有効な提供時間、途中終了、補償、推論サービスの復旧は、利用予定の仕事に即して確かめるべき事項として残る。
会員向け解説
プロフィールの詳細
適切な会員レベルでログインすると、解説全文と出典メモをご覧いただけます。
Strategic Circle 限定
Strategic Circle
すべての読者に公開されています。参加してログインすると プロフィール解説 を閲覧できます。
Strategic Circle に参加Leadership Alliance 会員限定
Leadership Alliance
対象となる IP 資産の所有者・管理者向けです。ログインすると Leadership Alliance の解説を閲覧できます。
Leadership Alliance に参加
