O gigante da tecnologia Tencent realizou seu Hi Tech Day e a conferência Digital Open Things 2023 no Centro Nacional de Convenções da China, em Pequim, no dia 14 de dezembro, com o tema "A inteligência emerge e abre todas as coisas". Jiang Chunyu afirmou que o desenvolvimento da IA na China precisa urgentemente de conjuntos de dados treináveis e de alta qualidade. Jiang revelou que um livro branco sobre governança de dados de IA será publicado em breve para estabelecer um sistema de métodos e regras nessa área.
A China acelera sua transformação digital e supera a exclusão digital, com forte apoio à aplicação de novas tecnologias como dados, computação em nuvem, inteligência artificial e computação quântica. O gigante da tecnologia Tencent realizou o Hi Tech Day e a conferência Digital Open Things 2023 com o tema "A inteligência emerge, o digital abre todas as coisas", no Centro Nacional de Convenções da China, em Pequim, no dia 14 de dezembro, convidando grandes nomes de todas as áreas para discutir a tendência da inteligência artificial.
Durante a conferência, Jiang Chunyu, diretor do departamento de Cloud Data e Blockchain da Academia Chinesa de Pesquisa em Informação e Comunicação, fez um discurso sobre o tema "A governança de dados da IA gera reflexão". A grande base de dados de alta qualidade é o próximo objetivo evolutivo. "Não há muitos conjuntos de dados treináveis e de alta qualidade no mercado, especialmente no contexto chinês, onde muitos dados de alta qualidade estão ocultos.
Precisamos urgentemente passar por um modelo comercializável e aberto, ou determinar qual modelo pode liberar os dados e ser usado por todos." Jiang Chunyu, diretor do departamento de Cloud Data e Blockchain da Academia Chinesa de Pesquisa em Informação e Comunicação. Desde 2018, a IA geral lidera a onda tecnológica. Todas as partes se dedicaram totalmente e investiram dinheiro no treinamento de grandes modelos, criando uma enorme tendência competitiva. No entanto, Jiang Chunyu acredita que o desenvolvimento nacional deve se concentrar na melhoria dos dados, não apenas em quantidade, mas também em qualidade.
A China, como potência natural de dados, em vez de focar na lacuna entre algoritmos e computação que não é tão grande entre as partes, os enormes custos da "involução" do domínio, em vez de melhorar a qualidade dos dados, poderiam trazer melhores resultados. Ele listou para o público os conjuntos de dados em larga escala, diversificados e de alta qualidade necessários para o treinamento de grandes modelos: GPT-1 há quatro ou cinco anos exigia 4,8 GB de dados de alta qualidade, GPT-2 estava com 40 GB, GPT-3 com 570 GB, e este ano, a Meta lançou um grande modelo cuja base de dados atingiu um tamanho impressionante de 4.000 GB.
Jiang expressou sua preocupação: "Não há muitos conjuntos de dados treináveis e de alta qualidade no mercado, especialmente no contexto chinês, onde muitos dados de alta qualidade estão ocultos. Precisamos urgentemente passar por um modelo comercializável e aberto, ou determinar qual modelo pode liberar os dados e ser usado por todos." Leia também: Amazon Q AI assistant: AWS lança uma abordagem revolucionária de consulta de dados. Jiang Chunyu: A gestão, segurança e proteção de dados devem ser estabelecidas urgentemente. Jiang levantou três problemas no desenvolvimento atual da indústria: A qualidade dos dados é geralmente tendenciosa.
Para transformar conjuntos de dados de baixa qualidade em alta qualidade, Jiang destacou a necessidade de estabelecer um sistema integrado de engenharia de dados e operações de P&D DevOps. Da entrega de P&D, operação e manutenção de dados à exploração de valor, uma cadeia de produção de dados completa ou cadeia de suprimentos é formada para que os dados possam ser entregues de forma ordenada e progressivamente conectados para formar uma prova de produção publicada, o que é diferente do processamento tradicional de dados estruturados do passado.
Ele também alertou as empresas presentes a não investir muito tempo no treinamento de modelos antes que a melhoria da qualidade dos dados seja concluída, pois um treinamento pode custar dezenas de milhões de dólares sem resultado. Surpreendentemente, sua equipe está organizando a metodologia e o quadro de métodos de treinamento de IA, completando um livro branco sobre governança de dados de inteligência artificial e estabelecendo um sistema de métodos e regras nessa área. Problemas de segurança e privacidade.
Jiang afirmou: "Há um grande número de problemas de segurança e privacidade envolvidos em todo o processo de treinamento, incluindo direitos de aplicação, violações na coleta de informações pessoais, transmissão insegura de dados, falsificação de dados e armazenamento e transmissão inseguros de modelos. Além disso, há também problemas como ataques do tipo Prompt e violações de conteúdo gerado.
Para garantir a proteção da privacidade e segurança ao longo do ciclo de vida na produção, uso e operação dos modelos, precisamos dominar uma variedade de tecnologias, estabelecer regras apropriadas e configurar as capacidades de auditores e supervisores como um todo. É uma área totalmente nova que requer atenção e investimento para enfrentar os desafios evolutivos da segurança e privacidade dos dados." Gestão de conteúdo gerado e sintético. Mesmo os dados sintéticos não podem ser uma fraude. Portanto, a medição da veracidade e exatidão é particularmente crítica. Além disso, a detecção e prevenção de nocividade também é uma tarefa urgente.
Atualmente, muitos modelos em grande escala são relatados precisamente devido a problemas no conteúdo gerado, como assédio, violência e discriminação. Esses problemas precisam ser controlados de forma eficaz.
Separadamente, os requisitos de autenticidade e exatidão podem ser enquadrados por regras; os requisitos de geração de conteúdo, mecanismos de monitoramento e avaliação de autenticidade podem ser realizados por detecção automática de identificação e filtragem de conteúdo combinada com verificação manual; e a prevenção de problemas de nocividade pode ser gerenciada de forma eficaz pelo uso de restrições de regras, previsão em linha, avaliação empírica de privacidade e testes de ataque de privacidade.

