• Tumblr y WordPress.com están actualmente en conversaciones para proporcionar datos de usuarios a empresas de IA como OpenAI y Midjourney.
  • The New York Times está actualmente demandando a OpenAI por supuestamente utilizar sus extensos archivos sin permiso para entrenar chatbots

El uso de datos extraídos de Internet se ha convertido en un tema polémico, ya que las empresas aprovechan el contenido público para entrenar sus potentes modelos generativos. Esta práctica ha desencadenado batallas legales, ya que organizaciones como The New York Times yGetty Imageshan expresado su preocupación por el uso no autorizado de su contenido.

Batallas legales por el uso de datos

Uno de los casos destacados involucra a OpenAI, que actualmente enfrenta una demanda de The New York Times por supuestamente utilizar los archivos del periódico sin permiso para entrenar chatbots. En respuesta, OpenAI ha acusado a The Times de recurrir a tácticas cuestionables para demostrar sus afirmaciones. De manera similar, Getty Images ha emprendido acciones legales contraStable Diffusionpor infracción de derechos de autor relacionada con el uso de su contenido visual.

Las implicaciones de que los sistemas de IA aprovechen el trabajo de periodistas, músicos y fotógrafos van más allá de las disputas legales. La búsqueda de grandes cantidades de datos de entrenamiento ha generado preocupación por la posible explotación de los creadores de contenido en línea. Según informes, plataformas como Tumblr y WordPress.com han estado en conversaciones para vender datos de usuarios a empresas de IA como OpenAI y Midjourney, lo que plantea interrogantes sobre la privacidad y la propiedad de los datos.

Lea también:El chatbot Bard de Google obtiene la actualización Gemini Pro a nivel global

Alianzas para compartir datos

Mientras que algunas entidades han optado por litigios, otras han elegido forjar alianzas. TheAssociated Pressha licenciado una parte de sus archivos a OpenAI, mientras que Shutterstock firmó un acuerdo de seis años con la empresa de IA para proporcionar acceso a su extensa biblioteca de fotos, vídeos y música.

Reddit, conocida por su abundancia de contenido generado por usuarios, recientemente llegó a un acuerdo con Google, otorgando al gigante tecnológico acceso a su API para el entrenamiento de modelos de IA. Este movimiento subraya el valor de las contribuciones de los usuarios a las plataformas y las consideraciones éticas en torno al uso de datos.

Lea también:OpenAI lanza la tienda GPT para chatbots de IA personales sin necesidad de programación

Prácticas generalizadas de entrenamiento de datos

La práctica generalizada de entrenar modelos de IA con datos públicos de Internet trasciende los acuerdos específicos mencionados en el artículo. Una investigación reciente de TheWashington Postdescubrió un tesoro de datos extraídos de diversas fuentes, incluidos foros en línea, plataformas de crowdfunding y sitios de redes sociales. Empresas como Meta, anteriormente Facebook, también han aprovechado las publicaciones públicas de sus plataformas para mejorar las capacidades de IA.

El debate sobre la propiedad y el consentimiento de los datos sigue sin resolverse. Los creadores de contenido, ya sea en blogs especializados o en plataformas de redes sociales populares, se enfrentan a la posibilidad de que su trabajo se convierta en una mercancía para fines de entrenamiento de IA. El equilibrio entre la innovación y las prácticas éticas de datos es crucial para moldear el futuro del desarrollo de la IA y su impacto en los ecosistemas digitales.