Resumen

  • Hay que separar cobertura amplia de razonamiento robusto, memoria, acción y adaptación.
  • La evaluación requiere tareas inéditas, condiciones cambiantes, coste de fallo y réplica independiente.

La IA general describe capacidad entre dominios, no excelencia en una tarea. Los modelos actuales parecen amplios porque una interfaz alcanza muchos patrones aprendidos, pero esa amplitud puede caer ante reglas nuevas, contexto ausente o acción prolongada. Desarrolladores y compradores deben publicar límites, controles de contaminación, recursos y consecuencias del error. La siguiente evidencia es una evaluación independiente con trabajo realmente desconocido, incluidas solicitudes que el sistema debe rechazar o devolver. La etiqueta debe seguir a la transferencia y al control demostrados, no adelantarlos.

Fuentes