Resumen

  • El lanzamiento del 10 de septiembre incorpora servicios accesibles por HTTP durante una sesión pagada, frente a trabajos que se ejecutan y terminan.
  • El proveedor explica que el operador cobra por toda la ventana reservada, no únicamente por los instantes con peticiones activas.

Una GPU reservada puede seguir esperando trabajo. Esa diferencia importa en Inference, la nueva oferta de Ocean Network: conocer el precio de una sesión dedicada permite acotar la reserva, pero no garantiza que cada minuto comprado produzca algo útil.

El anuncio del 10 de septiembre describe modelos y aplicaciones disponibles por HTTP durante el periodo pagado. La documentación los distingue de los trabajos de cómputo que se ejecutan una vez y finalizan. Los paquetes preparados combinan modelo, motor y requisitos de hardware; el modo personalizado abre más decisiones de configuración. Los flujos de modelos ofrecen una API compatible con OpenAI, mientras que servicios y plantillas pueden presentar una interfaz web. Son capacidades descritas por el proveedor, no pruebas realizadas con todos los clientes o modelos.

La unidad comercial es el intervalo reservado. Según el anuncio, el coste total aparece antes de confirmar, los fondos pasan a depósito antes de arrancar el contenedor y el operador puede reclamar el importe de toda la ventana. Existe la posibilidad de ampliarla. La portada del servicio también vincula el cobro con el tiempo reservado y señala que termina al agotarse ese periodo. No equivale a pagar solo mientras se atienden solicitudes ni a recuperar automáticamente los minutos ociosos. Las fuentes citadas no establecen aquí una regla de reembolso por cierre anticipado o el punto exacto de inicio de la facturación durante la puesta en marcha.

Ocean Network anuncia H200 desde 2,16 dólares por hora. Es una tarifa publicitada, no una cotización integral ejecutada ni disponibilidad comprobada para cualquier configuración. Su propia comparación advierte de diferencias entre las especificaciones de las instancias. Las horas gratuitas del lanzamiento tampoco determinan el coste recurrente. No hay base para declarar que el alquiler por tiempo gana siempre a una API facturada por tokens.

La propuesta añade control sobre lo elegido. El proveedor afirma que el modelo seleccionado se ejecuta en hardware dedicado durante la sesión, sin una capa central que lo sustituya por otro. La página de gestión, según su descripción, muestra registros, tiempo restante y opciones para ampliar o relanzar. Esa visibilidad puede facilitar la operación; no acredita aislamiento, velocidad de respuesta ni resultados idénticos. El sitio aún muestra la etiqueta Beta.

La continuidad exige otra comprobación. Un artículo técnico del 25 de mayo trata la vigilancia de trabajos de cómputo, la detección de fallos y la posibilidad de que el desarrollador vuelva a lanzarlos en otro nodo. Recomienda guardar puntos de recuperación para tareas largas. El ejemplo de no cobrar si el nodo no está disponible antes de empezar no demuestra una devolución durante una sesión Inference. Tampoco prueba que un endpoint persistente conserve estado y peticiones pendientes al cambiar de máquina.

Para este análisis no se abrió una cuenta, se conectó una cartera ni se probó un modelo. El tiempo de servicio aprovechable, las compensaciones, el cierre anticipado y la recuperación de la inferencia en vivo siguen siendo cuestiones por verificar.