要約

  • 9月10日発表の Inference は、支払ったセッション中にモデルやアプリを HTTP で利用できるサービスだ。実行後に終了する従来の計算ジョブとは異なる。
  • 同社は予約した時間枠全体をノード運営者の請求対象としている。リクエストを処理した瞬間だけの課金とは読めない。

GPU を確保しても、仕事が自動的に埋まるわけではない。Ocean Network の Inference が分かりやすくするのは、専用ハードウェアを一定時間予約する費用である。その時間からどれだけ有効な結果を得られるかまでは、予約だけでは決まらない。

9月10日の公式発表によると、モデルや AI アプリは支払ったセッションの間、HTTP 経由でアクセスできる。公式文書も、一度実行して終了する計算ジョブとの違いを説明している。設定済みパッケージはモデル、エンジン設定、必要なハードウェアを組み合わせ、自分で構成する場合には調整項目が増える。モデルを動かす経路では OpenAI 互換 API、サービスやテンプレートではブラウザー画面を提供するという。これは供給者の説明であり、あらゆるモデルやクライアントの互換性を検証した結果ではない。

料金を読む際の単位は、処理件数ではなく予約枠だ。発表は、確定前に総額を表示し、コンテナ起動前に資金を預託し、ノード運営者が予約時間全体に相当する金額を受け取ると説明する。時間の延長も可能としている。サイトのトップページも予約した枠に対して課金し、その終了後は課金しないとしている。待機時間が自動返金される、あるいはリクエスト処理中だけ支払う、という意味にはならない。途中終了時の返金条件や、起動過程のどこから課金されるかは、今回の資料では具体的に確定していない。

掲載されている H200 の開始価格は1時間2.16米ドルである。実際に成立した総費用込みの見積もりでも、希望構成の空きがある証拠でもない。同社の比較表も、各社のインスタンス仕様が異なると注意している。開始時の無料時間は販促であり、継続利用の採算を示すものではない。この価格だけで、トークン課金より常に安いとは言えない。

選択したモデルを制御できることも売り文句だ。同社はセッション専用のハードウェアを用い、中央のルーティング層で別のモデルに差し替えないとする。管理画面ではログ、残り時間、延長や再起動の操作を提供すると説明している。運用を把握する手掛かりにはなり得るが、性能測定、分離の監査、同一回答の保証ではない。サイトには Beta の表示も残る。

継続稼働には別の裏付けが必要になる。5月25日の技術記事は、計算ジョブの監視、障害検出、開発者による別ノードでの再実行を扱い、長い処理にはチェックポイントを勧めている。開始前にノードが利用不能なら課金しないという例は、Inference の途中障害に対する返金保証ではない。バッチ処理を再実行できることから、常時接続のエンドポイントや状態、処理中の要求が透過的に引き継がれるとも判断できない。

本稿ではアカウント、ウォレット、モデルの接続先を実際に利用していない。有効な提供時間、途中終了、補償、推論サービスの復旧は、利用予定の仕事に即して確かめるべき事項として残る。