Технологический гигант Tencent провёл 14 декабря в Национальном конгресс-центре Китая в Пекине свой день Hi Tech Day и конференцию Digital Open Things 2023 под девизом «Интеллект зарождается и открывает всё». Jiang Chunyu заявил, что развитие ИИ в Китае остро нуждается в качественных обучающих наборах данных. Jiang сообщил, что вскоре будет опубликована белая книга по управлению данными ИИ, чтобы установить систему методов и правил в этой области.

Китай ускоряет цифровую трансформацию и преодолевает цифровой разрыв, активно поддерживая внедрение новых технологий, таких как данные, облачные вычисления, искусственный интеллект и квантовые вычисления.

Технологический гигант Tencent провёл Hi Tech Day и конференцию Digital Open Things 2023 на тему «Интеллект зарождается, цифровые технологии открывают всё» в Национальном конгресс-центре Китая в Пекине 14 декабря, пригласив ведущих специалистов из разных областей для обсуждения тенденций развития искусственного интеллекта.

На конференции Jiang Chunyu, директор департамента Cloud Data и Blockchain Académie chinoise de recherche sur l'information et la communication, выступил с докладом на тему «Управление данными ИИ вызывает размышления».

Большая высококачественная база данных — следующая эволюционная цель.

«На рынке не так много качественных обучающих наборов данных, особенно в китайских условиях, где многие качественные данные скрыты. Нам срочно нужна коммерциализируемая и открытая модель или определение модели, которая сможет высвободить данные и сделать их доступными для всех».

Jiang Chunyu, директор департамента Cloud Data и Blockchain Académie chinoise de recherche sur l'information et la communication.

С 2018 года общий ИИ возглавляет технологическую волну. Все стороны вложили значительные средства и инвестировали в обучение больших моделей, создав огромную конкурентную тенденцию. Однако Jiang Chunyu считает, что национальное развитие должно сосредоточиться на улучшении данных, не только в количестве, но и в качестве. Китай, как естественная держава данных, вместо того чтобы сосредотачиваться на разрыве между алгоритмами и вычислениями, который не так велик между сторонами, а также на огромных издержках «инволюции» в этой области, мог бы получить лучшие результаты, повышая качество данных.

Он перечислил для аудитории масштабные, разнообразные и высококачественные наборы данных, необходимые для обучения больших моделей: GPT-1 четыре-пять лет назад требовал 4,8 ГБ качественных данных, GPT-2 — 40 ГБ, GPT-3 — 570 ГБ, а в этом году Meta выпустила большую модель, база данных которой достигла ошеломляющих 4 000 ГБ.

Jiang выразил обеспокоенность: «На рынке не так много качественных обучающих наборов данных, особенно в китайских условиях, где многие качественные данные скрыты. Нам срочно нужна коммерциализируемая и открытая модель или определение модели, которая сможет высвободить данные и сделать их доступными для всех».

Читайте также: Amazon Q AI assistant: AWS представляет революционный подход к запросам данных.

Jiang Chunyu: необходимо срочно установить управление, безопасность и защиту данных.

Jiang выделил три проблемы в текущем развитии отрасли. Качество данных в целом оставляет желать лучшего. Чтобы превратить некачественные наборы данных в качественные, Jiang подчеркнул необходимость создания интегрированной системы инженерии данных и операций R&D DevOps. От передачи R&D, эксплуатации и обслуживания данных до реализации ценности формируется полная цепочка производства или поставки данных, чтобы данные могли поставляться упорядоченно и постепенно связываться, образуя опубликованное производственное доказательство, что отличается от традиционной обработки структурированных данных в прошлом.

Он также предупредил присутствующие компании не вкладывать много времени в обучение моделей до завершения повышения качества данных, поскольку такое обучение может стоить десятки миллионов долларов без результата.

Удивительно, но их команда в настоящее время систематизирует методологию и структуру методов обучения ИИ, дополняет белую книгу по управлению данными искусственного интеллекта и устанавливает систему методов и правил в этой области.

Проблемы безопасности и конфиденциальности.

Jiang заявил: «Во всем процессе обучения задействовано большое количество проблем безопасности и конфиденциальности, включая права на применение, нарушения при сборе личной информации, небезопасную передачу данных, фальсификацию данных, а также небезопасное хранение и передачу моделей. Кроме того, существуют такие проблемы, как атаки типа Prompt и нарушения сгенерированного контента.

Чтобы обеспечить защиту конфиденциальности и безопасности на протяжении всего жизненного цикла производства, использования и эксплуатации моделей, мы должны овладеть различными технологиями, установить соответствующие правила и в целом настроить возможности аудиторов и супервизоров. Это совершенно новая область, требующая внимания и инвестиций для решения эволюционных задач безопасности и конфиденциальности данных».

Управление сгенерированным и синтетическим контентом. Даже синтетические данные не могут быть мошенничеством. Поэтому особенно важна оценка достоверности и точности. Кроме того, обнаружение и предотвращение вредоносности также является неотложной задачей. В настоящее время многие крупные модели отмечаются именно из-за проблем в сгенерированном контенте, таких как домогательства, насилие и дискриминация. Эти проблемы должны эффективно контролироваться.

Отдельно требования к подлинности и точности могут быть оформлены правилами; требования к генерации контента, механизмам мониторинга и оценке подлинности могут быть реализованы с помощью автоматического обнаружения, идентификации и фильтрации контента в сочетании с ручной проверкой; а предотвращение вредоносности может эффективно управляться с помощью ограничений на правила, прогнозирования линии, эмпирической оценки конфиденциальности и тестов на атаки конфиденциальности.