KDD расшифровывается как Knowledge Discovery and Data Mining — «извлечение знаний и анализ данных». Конференцию проводит профессиональное сообщество ACM SIGKDD; первые мероприятия этого направления проходили ещё в конце 1980-х, а полноценная конференция KDD существует с 1995 года. За это время область, которая когда-то занималась в основном поиском закономерностей в больших массивах данных, постепенно вобрала в себя машинное обучение, рекомендательные системы, нейронные сети и значительную часть того, что сегодня называют искусственным интеллектом.

KDD 2026 проходит с 9 по 13 августа в Международном конференц-центре Чеджу. Первые два дня были отданы семинарам, учебным занятиям и специализированным секциям, а 11 августа началась основная программа конференции. Утро открыл Джефф Дин, главный научный сотрудник Google и один из людей, стоявших за целым рядом ключевых технологий современной вычислительной инфраструктуры. Его доклад был посвящён тому, как искусственный интеллект пришёл к нынешнему состоянию и какие технологии могут определять его развитие дальше.

Дин начал не с чат-ботов. В его программе — архитектуры нейронных сетей, распределённое обучение огромных моделей, специализированные процессоры для машинного обучения и способы сделать обучение и работу ИИ быстрее и дешевле. Это довольно точно показывает отличие профессиональной повестки от массовой: пользователь видит окно, куда можно написать вопрос, а исследователь видит за ним огромную систему из данных, вычислительных центров, алгоритмов обучения, памяти и программной инфраструктуры.

После вступительного доклада отдельную часть программы посвятили Южной Корее. Здесь ИИ рассматривается уже не как отдельный цифровой продукт, а как технология, которая постепенно входит в промышленность, производство микросхем, поиск, электронную коммерцию и другие отрасли. Организаторы собрали выступления крупных корейских компаний, чтобы показать не лабораторные эксперименты, а то, как ИИ внедряется в существующую экономику.

Но, пожалуй, одна из самых интересных частей сегодняшней программы получила предельно простое название — Data Day, «День данных».

Его организаторы предлагают вернуться к вещи, которая на фоне гонки больших моделей стала почти незаметной: любой искусственный интеллект зависит прежде всего от данных, на которых он учился и с которыми продолжает работать.

В последние годы внимание было сосредоточено главным образом на моделях: сколько у них параметров, насколько они велики, какие архитектуры используют и какие результаты показывают в тестах. Между тем хорошая модель, обученная на плохих, неполных или искажённых данных, остаётся плохой системой. А когда ИИ начинает работать не в демонстрации, а в медицине, бизнесе, промышленности или праве, качество исходной информации становится не менее важным, чем мощность самой модели. Именно поэтому организаторы Data Day предлагают относиться к данным не как к сырью, которое «просто есть», а как к отдельному предмету науки и инженерии.

Один из сегодняшних докладов посвящён, например, визуальной памяти персонального ИИ-помощника. Идея выглядит просто: человек постоянно видит тысячи предметов, мест и людей, но забывает большую часть увиденного. Персональный ИИ теоретически мог бы, с разрешения владельца, сохранять визуальные воспоминания и отвечать позднее на вопросы вроде: «Где я видел этот предмет?» или «Как называлась книга, которую я заметил несколько дней назад?»

Но за такой почти бытовой функцией возникают сложные технические задачи. Нельзя бесконечно сохранять всё, что видит камера. Нужно понять, что стоит запомнить, как выделить интересы конкретного человека среди огромного количества случайных изображений и как потом за секунды найти нужный эпизод в накопленной памяти. Представленные на конференции экспериментальные системы как раз пытаются решать эту задачу — превращать поток изображений не просто в архив, а в доступную ИИ память.

Другая тема — надёжность ИИ при работе с документами. Современная языковая модель уже может прочитать договор, медицинскую запись или сфотографированный счёт и довольно убедительно объяснить их содержание. Но «довольно убедительно» совершенно недостаточно, если речь идёт о суде, лечении или финансовом решении.

Поэтому исследователи обсуждают уже не только способность модели прочитать документ, но и способы проверить каждый этап её работы. Один из подходов — вместо одного огромного ИИ, которому поручается задача целиком, использовать несколько специализированных агентов: один извлекает информацию, другой сверяет её со структурой документа, третий проверяет результат. Такая система сложнее, зато её ошибки легче обнаружить и объяснить.

Ещё одна важная тема Data Day — изменение самого представления о данных для ИИ-агентов.

Классическое машинное обучение во многом строилось на принципе «чем больше данных, тем лучше». Но автономному агенту недостаточно прочитать миллионы текстов. Он должен научиться действовать: получить задачу, выполнить несколько шагов, увидеть результат, понять ошибку и попробовать другой путь.

Поэтому единицей обучения постепенно становится не отдельный текст или картинка, а целая траектория действий: состояние системы, решение агента, совершённое действие, полученный результат и оценка этого результата. Для следующего поколения ИИ всё важнее становится не просто big data — большие данные, — а right data: именно те примеры, на которых система способна научиться правильному поведению.

И заканчивается сегодняшний Data Day вопросом, который несколько лет назад мог показаться почти провокацией: не сделают ли ИИ-агенты профессию специалиста по данным ненужной?

Если модель сама способна написать программу, собрать данные, построить статистическую модель, провести анализ и подготовить отчёт, университетам приходится заново отвечать на вопрос, чему вообще следует учить будущего дата-сайентиста. Организаторы конференции формулируют проблему ещё жёстче: если бы человеку сегодня было 18 лет, стоило бы ему по-прежнему тратить годы на изучение data science — или выбирать совсем другую профессию?

Ответа конференция пока не даёт. Но сам вопрос хорошо показывает, насколько изменилась отрасль.

При этом KDD 2026 не сводится к обсуждению будущего профессий. 12 августа программа продолжится отдельными днями, посвящёнными ИИ в образовании, здравоохранении и технологиям машинного рассуждения. Параллельно будут идти исследовательские секции по применению ИИ в науке, новым наборам данных и методам проверки моделей.

И в этом, пожалуй, KDD сейчас особенно интересна. Публичный образ искусственного интеллекта в последние годы почти полностью заняли большие языковые модели и разговорные интерфейсы. На профессиональной конференции картина значительно шире: специалисты обсуждают, где брать правильные данные, как хранить память, как проверять решения системы, как применять ИИ в науке и медицине и что делать, когда программы начинают выполнять уже не отдельные команды человека, а длинные последовательности действий.

Чат с ИИ — лишь та часть этой системы, которую мы видим на экране.