- Интеллектуальный анализ данных (data mining) — это подобласть компьютерных наук, объединяющая множество методов статистики, науки о данных, теории баз данных и машинного обучения.
- Применение интеллектуального анализа данных включает профилирование и сегментацию клиентов, анализ покупательской корзины и обнаружение аномалий.
У интеллектуального анализа данных нет единственного изобретателя. Он развивался постепенно благодаря вкладу исследователей и практиков из разных областей. Его становление объединяет достижения статистики, машинного обучения, искусственного интеллекта и компьютерных наук. В этом материале вы узнаете о ключевых фигурах и важных вехах истории интеллектуального анализа данных.
Истоки интеллектуального анализа данных
Джон Тьюки(1915–2000): американский статистик, чей вклад вразведочный анализ данных(EDA) стал революционным. Разработанные им методы обобщения и визуализации данных заложили основу для последующих методов интеллектуального анализа данных. Работы Тьюки подчёркивали важность выхода за пределы сырых данных, чтобы понять их структуру и скрытые закономерности.
Ранний вклад в статистические методы
По мере развития интеллектуального анализа данных он всё сильнее опирался на статистические методы для анализа и интерпретации данных.Джером Фридман, Роберт Тибширани и Тревор Хасти: эта тройка статистиков значительно продвинула область благодаря работам по методам классификации и регрессии. Разработанные ими алгоритмы, такие как деревья классификации и ансамблевые методы, включая бустинг, стали базовыми компонентами современного интеллектуального анализа данных. Их труд заложил теоретические основы многих методов извлечения информации из данных.
Читайте также:5 ключевых рисков интеллектуального анализа данных, о которых стоит знать
Читайте также:Что такое интеллектуальный анализ данных и почему он важен для бизнеса
Появление машинного обучения
Артур Сэмюэл (1901–1990): его часто называют автором термина «машинное обучение». Работы Сэмюэла в 1950-х годах над алгоритмами, которые совершенствуются благодаря опыту, заложили основу многих методов интеллектуального анализа данных. Его исследования по созданию программ, способных учиться на данных, сыграли решающую роль в формировании алгоритмов, используемых сегодня в интеллектуальном анализе данных.
Системы баз данных и ассоциативные правила
В 1990-е годы произошли значительные достижения в системах баз данных и алгоритмах, что сильно повлияло на практику интеллектуального анализа данных. Ракеш Агравал, Томаш Имелински и Арун Свами: эти исследователи разработали алгоритм Apriori — пионерский метод поиска ассоциативных правил в больших базах данных. Их работа позволила компаниям и исследователям обнаруживать связи между переменными в наборах данных, например выяснять, какие товары часто покупают вместе. Это достижение стало краеугольным камнем интеллектуального анализа данных, особенно в анализе покупательской корзины.
Современный интеллектуальный анализ данных: оформление дисциплины
По мере развития интеллектуального анализа данных предпринимались усилия по формализации и стандартизации методов и методик. Цзявэй Хань и Мишлен Камбер: их влиятельный учебник «Data Mining: Concepts and Techniques» стал обязательным пособием в этой области. Работы Ханя и Камбер помогли обобщить и систематизировать методы и приложения интеллектуального анализа данных, сделав их доступными и студентам, и практикующим специалистам. Их вклад дал всестороннее описание методов интеллектуального анализа данных и лучших практик.

