About what machine learning is and how to work with Big Data, how the programs created by experts allow, for example, to find a breakdown in complex technical systems in time, ” Yevgeny Burnaev , Kand, told us. physical. Sciences, Associate Professor of the Skoltha Center for Scientific and Engineering Technologies for Tasks with Great Data (SKOLTECH Center FOR COMPUTATIONAL AND DATA-Intensive Science and Engineering), Head of the ADVANED DATA ANALYTICS in Science And Engineering. In 2017, Eugene became a laureate of the Moscow Government Prize for young scientists, the presentation ceremony took place in the Kremlin on February 5, 2018. Talked by Natalia Demina . The full version of the interview (in *.pdf and in the paper version is published abbreviated).
“In your opinion, your profession based on the analysis and processing of Big Data, is the profession of the future?”
- I am very careful about all such slogans. In the history of mankind, there were different periods of hobbies by some field of knowledge when they said that nuclear physics or astronautics was “our everything”, but then these areas became something natural. The volume of information is growing, on its basis you can do a lot of useful things, including automation and optimization of some processes and production. It is difficult for me to predict whether the need for this will grow exponentially, but what it will grow is for sure.
- Is the demand for your examination is growing?
- Now yes, and very quickly. We are actively working on creating courses for Skoltech. There are many industrial customers who are interested in people who come to them and tell what Big Data, machine learning, neural networks are. Everyone says: “Big Data”, but they don’t understand what it is. Like, Big Data, come and put order.
- And who will appear at the exit after such a course of training?
- Managers who understand how to properly manage the project with the involvement of machine learning, what kind of tasks machine learning can solve for what tasks - its use will not pay for itself. Sometimes during the discussion of the project with the customer you have to not only work out the technical specifications, but also form the customer, explain what data analysis is. But it would be more correct to form a layer of the managerial link, which already initially understands what can be done with methods of data analysis.
In addition, we have the possibility of teaching the most modern topics - now deep training and neural networks, blockchain, wireless sensory networks for monitoring tasks and the Internet of things, processing data of remote sensing data, etc., are very popular. All these areas are important for engineers and now a lot of applications are built on such technologies.
In addition, in our center there is a second direction that “complements” data analysis and machine learning technologies - namely, mathematical modeling.
- How was the search for a calling? What did you dream about in childhood?
- As a child, I dreamed of different, like all children. I had a certain tendency to accurate sciences - both to mathematics and physics. The main impetus in the right direction was given to me by my father, who at one time graduated from MEFI. He is a physicist, an expert in the field of rapidly occurring chemical processes. My grandmother, a graduate of the chemical faculty of Moscow State University, also took an active part in choosing the direction of study. Although I studied at a regular school, but, fortunately, we had a very good teacher of mathematics, T. A. Lepyokhina.
- You are a Muscovite, not a Muscovite?
- It so happened that I graduated from school in Volgograd, although I was born in Moscow and now I live in Moscow. To choose from-to continue the training in the Physics, it was again influenced by a teacher of mathematics, who by that time had several students and the son studied at the MIFT; With the latter, I somehow met and listened to his stories about the MIPT-and thought, well, Fizteh, why not. In addition, I liked that at the faculty that I eventually gathered to go, there was a fairly complete mathematical program, which included special courses at the level of the MSU MSU, and the course of general physics.
I went to the MIPT Olympics, where I immediately received a full score. Then he went for the sake of interest even to the physical faculty of Moscow State University, went there, was going to go to take exams and to the MHCAM of Moscow State University, but at that moment something did not work out with documents, I had to go somewhere behind them, and I decided that if I entered the Moscow Institute of Physics and Technology, it was so to be.
- The education that you received, where did you give the best and give now?
- At that time in Moscow there were few places where they would not just be taught pure mathematics or engineering sciences, but would give an education in the field of applied mathematics with a bias in data analysis. We can say that I was more self -figured. When I went through general courses in the physical education, I began to deal with the topic related to the analysis of signals using vyvyl-transformation. I did not even have a scientific director of the bachelor's work, because the topic was relatively new, and I did not find anyone in the MFTi who could become them (SCHEEL. STR. Computation center of the Russian Academy of Sciences Nikolai Olenev and the dean of the faculty of management and applied mathematics of MIFTI, Alexander Shaninin, helped me with organizational issues, for which many thanks to them). I myself was engaged in this topic and successfully defended the bachelor's diploma.
Then it became clear that I did not have enough knowledge, and I began to attend specialized courses by probability and random processes on the MHMAT MSU, since they underlie the methods of signal analysis. In the end, I realized that I was interested in mathematical statistics, data analysis and their applications. There I met my future leader of the dissertation by Academician of the Russian Academy of Sciences Albert Nikolayevich Shiryaev .
When the time of graduate school came, he suggested that I do "the task of speedy detection of disorder." Its essence is that in real time there is a random process, and the moment of changing its random properties is necessary. Currently, this task is extremely in demand. If some complex technical system is considered, then you need to find in time that its behavior has changed: it can be a harbinger of the future malfunction.
Maybe you have heard such a term - “Industrial Internet of things” - this is now a popular topic, because technical and software systems are becoming more and more complicated. The same aircraft has a huge number of different units, nodes. And untimely replacement of nodes/elimination of breakdowns leads to financial losses; I'm not talking about security - this is a separate question. If your part was not taken on time and in the system you manage-whether it is a thermal power plant, a plane or an IT service that provides users for some services-it has a failure, then it costs money and reputation. Business is trying to find solutions that would help prevent such malfunctions.
Now in many technical systems there are sensors that measure various physical indicators-vibration, temperature, pressure, etc. If something begins to make up in the system, then certain harbingers appear in these data that there will soon be a problem, breakdown. And, analyzing the statistical behavior of these signals, you can single out these harbingers.
In the candidate dissertation, I investigated theoretical aspects of the task of the speedy detection of disorder; He defended himself quickly. After defending the dissertation, I began to cooperate with Professor Alexander Bernstein , who at that time worked as head. Laboratory of Isa RAS, and his colleagues. And then a new scientific topic has already appeared related to the project from Airbus.
In this project, it was already necessary not to analyze the time series and signals, as in a candidate dissertation, but to solve the tasks of predictive modeling, that is, to build models that would predict the dependence of some parameters (for example, the lifting force of the wing of the aircraft) on others - for example, on the geometry of the wing and the parameters of the flight mode.
Initially, in predictive modeling, mathematical models based on the “first principles of physics” were used. They described physical processes and phenomena with complex differential equations in private derivatives with boundary conditions. The methods for solving such equations are very laborious - this applies to both the calculations themselves and the preparation of the source data and the calculation nets, which significantly reduces the possibilities of using such models in the design of complex objects. And this is a clear drawback at the preliminary design stage, when a large number of solution options are considered and the price of error is especially high.
However, if a certain database has been accumulated during the calculated simulations, as well as real experiments (for example, in an aerodynamic pipe), then the so -called metamodel (or surrogate model, Surrogate Model) can be built using it using methods of data analysis and car training.
As a rule, this kind of metamodel has a significantly higher computing efficiency compared to the source sources of data. Due to this, an engineer can evaluate significantly more product design options and compare them among themselves in order to choose the most promising ones.
Another important example of the use of metamodels in practice is the prognostic management of production systems and economic processes, usually described by a large number of parameters (industrial production of sugar from sugar beets, automated adjustment of the credit procedure parameters, etc.).
So, for example, the effectiveness of the process of extraction (diffusion) of sugar-sand depends on the shape of the beet chips, its quality, sugar content, pH, the temperature of the supplied chips and water, on the distribution of temperatures inside the diffuser, etc. At the same time, to minimize costs and reduction of losses, the choice of optimal values of production parameters is necessary. It is obvious that even an experienced technologist is not able to keep track of the whole variety of control influences, environmental conditions, their interdependencies and the impact on production efficiency.
Accordingly, metamodels built according to the data accumulated as a result of the operation of production plants and underlying the recommendation systems significantly facilitate the technologist to solve its main tasks to choose the control parameters of the production process (a kind of “second opinion”) and reduce costs and improve the quality of products.
However, as it turned out later, the tasks of predictive modeling are closely related to the topic of my candidate dissertation. The fact is that the construction of metamodels allows you to identify the relationship between the parameters of the system in normal operation, and in the future by comparing the identified relationships with the current results of telemetry removed from the sensors in real time, to detect abnormalities and spreading in the operation of the system. Thus, a combination of methods for predictive modeling and speedy detection of discords allows you to implement effective applications in the so -called predictive service.
Methods of predictive maintenance are used for the speedy detection of anomalies and significant changes (breakdowns) in the operation of mechanisms and complex technical systems, for example, such as an auxiliary power plant of a passenger aircraft. The main purpose of this approach is to adjust the technical condition or complete replacement of the mechanisms before the identified changes are critical for the operation of individual components or the system as a whole. The diagnostic capabilities of the methods of intellectual predictive service have increased significantly in recent years. This was done due to the improvement of sensory technologies for observation and the development of new algorithms for processing the collected information.
As a result, I am engaged in the development of methods for solving the problems described above, as well as their industrial applications.
- Are you one of the main people who helped Airbus speed up their production processes?
- To call me the main thing - this, of course, would not only be wrong, but also dishonest towards my colleagues; For example, the setting of the tasks I have solved was formulated by academician Alexander Petrovich Kuleshov ... True, after the successful defense of the dissertation, I worked as the head of the laboratory of intellectual analysis of data and predictive modeling at the Institute of Information Problems (IPPI RAS). As a result of the successful implementation of a number of projects for Airbus, the Russian SPI-OFF IPPI RAS-the Datadwans company was organized, where I, as the head of the data analysis group, introduced a number of methods of surrogate modeling and optimization into industrial practice; The industrial implementation of these methods formed the basis of the Pseven Core program library (earlier Macros) and were subsequently used in various engineering projects for companies such as IHI, SAFT, Airbus, Astrium and others. In particular, this software library was used to solve the problems of modeling and optimizing the design of a passenger aircraft and, according to Airbus engineers, made it possible to reduce the temporary costs of modeling at the preliminary design of the aircraft by 10%.
- How does this kind of software library arrange and what can be done with its help?
-For example, we need to optimize the structure of the composite plate of the Formula-1 Bolid, which protects the rider from side clashes. There is a set of parameters that determines the thickness of various layers of the plate, their type. The specific design of the plate corresponds to each set of parameters. To measure its strength, you can make a prototype and conduct an experiment. However, this requires significant money and time.
Another option is to use mathematical modeling for a given plate structure and evaluate its strength using labor -intensive calculations. In this case, quite a lot of time will be spent, and the result of the calculation, of course, will not quite accurately reproduce the real processes occurring during the deformation of the composite.
The task of the engineer in this case is to find a plate design in which the mass of the plate will be as low as possible and at the same time its strength will satisfy the specified safety requirements. The main problem is that even a specialist in this subject area is physically difficult to keep in his head the way to target characteristics, in this case, the mass and strength are affected by the simultaneous change in more than two or three parameters.
If we increased the value of one parameter, the value of the other was reduced, etc., then how will this affect the properties of the product? At the same time, an engineer cannot check too many hypotheses - each requires either a real experiment or physical modeling, which is not so accurate. It is the computer and data analysis that help to “feel” an effective combination of parameters, which corresponds to a product with a more effective design.
If we have a certain initial database containing the values of the input-output (“input”-the values of the input parameters setting the design of the product; “output”-the values of the output characteristics that define the corresponding properties of the product) and obtained during field and/or computational experiments, then according to this database you can build a forecasting model that approximate non-linear dependencies between the parameters, distinguish the input. Parameters that significantly affect the predicted characteristics.
Using a constructed forecast model instead of resource -intensive field/computing experiments, you can quickly choose promising combinations of input parameters and check in practice only these solution options. Further, on the basis of the obtained assessments using mathematical methods of planning the experiment, a plan for field/computational experiments is built and the process is repeated. At the same time, the construction of a forecast model requires the development of new mathematical methods of machine learning for the consolidation of projection data (in this case, the data of field and computational experiments). Thanks to these methods, you can build forecast models and easily monitor how all numerous input parameters affect the properties of the product.
At the same time, we note that the methods developed can be used to solve engineering problems of this type that arise not only when modeling composite plates, but also when working on tasks from completely different areas - for example, in the task of optimizing the composition of the cream. In this task, initially there was a small database of the conducted experiments, during which, for different compositions of the cream, estimates were made of how the cream affects the skin, how well it bleach, how toxic it and TP. A predictive model was built on this set of data, and with its help it was possible to choose a more successful composition of the cream.
Of course, when working on such tasks, one must have knowledge from the corresponding subject area. Поэтому при работе над соответствующим проектом желательно наличие эксперта, который заранее скажет, какие входные параметры наиболее важные, проверит соответствие математической постановки оптимизационной задачи реальным запросам заказчика, и т.п.
Например, эксперт может сразу подсказать, что прогнозную модель надо сразу строить в зависимости от площади изделия, а не от длины и ширины изделия, взятых по отдельности. Понятно, что если выборка данных достаточно представительная, то методы машинного обучения потенциально смогут «вытащить» из данных такого рода зависимость. Однако, если подобное априорное знание учесть заранее, то это позволит построить более робастные и точные прогнозные модели за меньшее время.
Теперь вернемся к разговору о методах машинного обучения и об алгоритмической библиотеке, которую мы развивали. Чтобы решать прикладные задачи, подобные описанным выше, нужно решать набор взаимосвязанных задач анализа данных. Взаимосвязанных в том смысле, что решение одной задачи анализа данных может быть, в некотором смысле «входной информацией» для следующей за ней задачей.
Например, вы снижаете размерность данных (делаете новую параметризацию описания вашего объекта, которая будет содержать меньше параметров и будет менее избыточной). При этом вы должны предложить такую параметризацию, которая далее позволит получить прогнозную модель как можно более высокого качества. Здесь появляется уже специальная поставка задачи снижения размерности, и это является толчком к развитию новых методов машинного обучения.
В той алгоритмической библиотеке, которую компания «Датадванс» сейчас активно индустриализует и продает, речь идет о наборе базовых процедур, позволяющих решать инженерную задачу «в комплексе». Инженер обучен решению задач в своей конкретной предметной области, – он знает про закон какого-нибудь растяжения, но шаг в сторону, и он может уже что-то не знать. Что уж говорить про знание каких-то тонкостей методов машинного обучения.
Инженеру наши математические трудности неинтересны, ему нужно получить результат, улучшить эффективность работы изделия. Соответственно, автоматизация применения базовых процедур анализа данных, специально заточенных под требования задач индустриальной инженерии, и является основной целью данной библиотеки. Как следствие, одной из важных проблем, которую мне и моей команде пришлось решать при создании библиотеки, была разработка такого интерфейса взаимодействия с пользователем, который был бы основан на простых и понятных инженеру понятиях.
Например, автоматическое решение о том, какой же именно метод на каком шаге использовать при анализе данных, должно зависеть от ответов на какие-то содержательные и понятные инженеру вопросы: содержат ли данные шум или нет? Имеет ли расположение таких-то точек данных специальную структуру? находятся ли они на решетке? and so on.
Если учитывать такие особенности, то это позволяет решать задачи анализа данных гораздо эффективнее. Сейчас для построения предсказательных моделей в различных областях популярны нейросети, алгоритмы их обучения тоже можно было бы использовать и при решении задач индустриальной инженерии. Однако, инженер соответствующий результат вряд ли примет, потому что, скорее всего, он не будет удовлетворять требованиям прикладной области.
Например, ожидается, что зависимость выходной характеристики будет изменяться линейно при изменении того или иного параметра, а из-за того, что нейросетевая модель очень сильно нелинейная, то её прогноз также будет значительно нелинейным и его поведение будет иметь какие-то артефакты. Прорешав большое количество задач инженерного плана, мы примерно поняли, какие особенности у этих задач, что действительно нужно индустрии. Мы сумели формализовать это знание, сделав над библиотекой алгоритмов надстройку «верхнего уровня», которая формализует эти требования в понятных инженеру терминах, а затем переводит их в алгоритмический язык, выбирает наиболее подходящий метод или их комбинацию, а также автоматически задает параметры алгоритмов обучения моделей.
Сейчас компания «надстроила» над разработанной алгоритмической библиотекой графический интерфейс и успешно занимается его продажей, ведь не все инженеры любят и хотят программировать.
— А насколько в вашей работе нужно знать программирование? Вы сами программируете?
— Программирую мало, на это просто нет времени, а раньше да, конечно, программировал.
— На каких языках?
— Как человек научного склада, я начинал делать какие-то вычислительные эксперименты в Matlab'е, а потом, когда в районе 2008 года для анализа данных начал активно использоваться Python, перешел на этот язык программирования. У меня есть команда, с которой я обговариваю, какую функциональность надо реализовать, объясняю коллегам как должны быть устроены алгоритмы и их вычислительная реализация.
Что касается промышленной реализации, то в случае упомянутой выше библиотеки pSeven Core это было устроено следующим образом: мы делали большое количество вычислительных экспериментов, разрабатывали прототип алгоритма на Python, а его вычислительно эффективную реализации на C++ в спин-офф компании делал специально обученный человек, вместе с которым мы потом встраивали алгоритм в библиотеку и разрабатывали документацию.
Я сейчас вернулся к тому, что мне кажется наиболее важным и интересным, и это бОльше академические исследования, но я по-прежнему много работаю с индустриальными приложениями, взаимодействую с различными компаниями. На задачах от них можно, во-первых, проверить разрабатываемые мною методы, а, во-вторых, индустриальные приложения являются потенциальным источником новых постановок задач анализа данных. Тем более, что в Сколтехе активно поощряют сотрудничество с индустрией.
— Ваш научный руководитель академик А. Н. Ширяев — ученик Колмогорова. Вы чувствуете, что находитесь в одном рукопожатии от Колмогорова?
— С Альбертом Николаевичем я много общаюсь, бывал не раз у него в Комаровке (дом в поселке недалеко от г. Королёва, бывшая дача А. Н. Колмогорова. — Ред. ). Я прочитал дневники Колмогорова, которые Альберт Николаевич подготовил и издал. Кроме того, я читал некоторые исходные материалы. Я думаю, что это оказало на меня определенное влияние — Колмогоров был, конечно, человеком незаурядным. Он внес вклад в самые разные области математики, а в некоторых был первопроходцем. При этом у него есть прикладные работы. Это хороший пример для подражания.
— В лекции на «Постнауке» вы рассказывали про колмогоровскую сложность [1].
— Это один из основополагающих концептов, который позволяет лучше понять, что вообще происходит с тем, что мы называем вероятностью, случайностью.
— А насколько редко встречается сочетание хорошего ученого и хорошего организатора? Можно ли этому научиться, или это врожденный талант — уметь организовывать?
— Я бы сказал, что я организатор поневоле. Бывают такие направления исследований, при которых можно сидеть одному в кабинете и решать какие-то задачи. Но я, к счастью или к сожалению, занимаюсь исследованиями, в результате которых получается алгоритм, который надо проверять на данных и применять его для решения индустриальных задач. Если ты участвуешь в прикладном проекте, в построении реальных информационных систем, то их сложность такова, что без команды не обойтись. Поэтому я волей-неволей такую команду организовал и ею управляю.
У меня, смею надеяться, это получается. Я не думаю, что такого типа вещам можно научиться; одно из двух — либо ты можешь это делать, либо нет. Дело в том, что все люди разные, у кого-то одни представления, как должна быть устроена работа, у кого-то другие. Помимо того что я человеку объясняю чисто формально, что надо сделать, приходится быть немного психологом и говорить с коллегами не только о работе. Хороший руководитель может увидеть, что его сотрудник сегодня «не в себе», настроить его на правильный лад, чтобы в команде было «боевое слаживание». Без этого работа просто не пойдет.
— А в чем главные секреты хорошего руководства?
— Я бы сказал, что с людьми надо общаться, люди должны в тебе видеть лидера. Если я говорю, что задачу надо решать таким-то образом, но не могу объяснить почему, не могу повести людей за собой, то команда распадется. Потом, в коллегах надо прежде всего видеть людей, со всеми их достоинствами и недостатками, не относиться к ним как к неким винтикам — подай-принеси, сделай то, сделай это. У меня был опыт общения с разными руководителями. Некоторые из них подходят к людям формально, это плохо работает и в перспективе приводит к разрушению коллектива.
— Что самое неприятное в вашей работе?
— Пожалуй, это вопросы, связанные с бумагами, когда надо писать какие-то заявки на гранты, ТЗ или отчеты.
— А что самое увлекательное?
— Математические исследования, решение новых задач, взаимодействие с коллегами. Приезжаешь на конференцию, а там новые люди, работающие в твоей области, и ты с ними общаешься, получаешь новую информацию, узнаешь о новых подходах. Мне это приносит большое удовольствие, я испытываю настоящий драйв.
— Если говорить о Сколтехе, то какие достоинства или недостатки вы видите в этом проекте?
— Идея Сколтеха здравая. В Сколтехе много различных научных направлений и соответствующих департаментов — есть центр разработки новых производственных технологий и материалов, центры биоинформатики, нефтегазовых технологий и т. п. Я расскажу о центре научных и инженерных вычислительных технологий для задач с большими массивами данных, в котором работаю. У нас есть три основных ключевых показателя (KPI). Первый — это работа со студентами, которая предусматривает разработку и ведение курсов лекций.
В Сколтехе — магистратура, поэтому слушателям читаются не базовые предметы типа математического анализа, а продвинутые курсы в рамках соответствующей специализации. Например, лично я читаю курс лекций по современным методам машинного обучения и курс лекций по байесовским методам машинного обучения. В такого рода курсах, безусловно, есть и базовая часть — ставшие уже классическими модели и методы. Однако значительную часть курса я посвящаю новым результатам, рассказываю о том, что недавно появилось в науке, что я узнал, сотрудничая с индустрией. Кроме чтения лекций я также руковожу дипломными работами магистрантов.
Второй KPI, по которому оценивают мою работу в Сколтехе, — это подготовка и публикация научных статей в рецензируемых журналах, участие в профильных общепризнанных конференциях.
Еще один KPI — взаимодействие с индустрией. В Сколтехе есть проектный офис, который помогает в поиске проектов. Его сотрудники находят наукоемкие индустриальные проекты, в которых нужна серьезная математика и IT-технологии. Мы не «программируем сайты», мы нужны там, где требуется высокая квалификация в математике и computer science, в анализе данных и машинном обучении.
Если благодаря проекту может получиться новый и потенциально востребованный продукт, то можно заняться индустриализацией полученных результатов.
При выходе на стадию индустриализации нужно учесть много прикладных аспектов — для этого мы привлекаем дружественные компании, которые могут взять на себя инженерную и техническую части работы. Я же, как профессор Сколтеха, отвечаю за научную, методологическую составляющую, за разработку алгоритма, постановку задачи, перевод «хотелок» бизнеса на математический и инженерный язык. После того как алгоритм сделан и успешно протестирован, можно начать работать над продуктом для рынка.
В Сколтехе есть возможность получить начальное финансирование, что называется посевные деньги, для того чтобы сделать прототип. Можно создать коллаборацию с другими компаниями, организовать стартап, оформить патент на технологию. В Сколтехе это поощряется, а система Сколково предоставляет необходимые для этого инструменты.
— Насколько это трудно — совмещать фундаментальные и прикладные исследования? Не противоречит ли одно другому?
— Если бы я занимался только доказательством теорем, наверное, противоречило бы. А поскольку у меня такая область, что сегодня можно сделать что-то на бумаге, а завтра-послезавтра уже внедрить в производство, то особого противоречия и нет. Конечно, мне требуются и соответствующие ресурсы, и помощь людей, которые знают, как правильно составить договор, учесть какие-то юридические и экономические аспекты.
— Уже много лет говорят, что российской науке не хватает «цепочки», взаимосвязи между фундаментальной наукой и приложениями. Как вам кажется, Сколтех помогает эту проблему решить?
— Многое зависит от области исследований. Если мы говорим о теоретической математике, то там может и не быть приложений. Но теоретическая математика необходима, она задает некоторый уровень, тренирует экспертов, к которым всегда можно обратиться по каким-то тонким вопросам, — я считаю, что без такой подпитки и экспертизы всё остальное зачахнет. Необходим уровень, с которым вы себя соизмеряете. Что же касается остальных дисциплин, будь то разделы экспериментальной физики, биологии и т.п., там везде возможны приложения. И я не вижу проблем в построении всей цепочки от чистой науки до выхода продукта на рынок, было бы желание. Приходится больше трудиться.
— Этому надо учиться? Вы этому учите?
— Лично я этому не учу, потому что у меня есть конкретный набор учебных дисциплин, за которые я отвечаю. Что касается Сколтеха, то здесь есть специализированные курсы, на которых слушателям рассказывают, что такое инновация, как сделать прототип, как организовать стартап, как построить команду, какими качествами должен обладать ее лидер, как составить план разработки и сформировать техническое задание.
У меня много практического опыта в этих вопросах, так что мне это не требуется, но вот студентам такое обучение очень полезно. Когда ты планируешь какую-то работу (если речь идет о разработке), то нужен план; нужно каждую неделю собираться и его корректировать — что успели, что не успели, рисовать соответствующие графики, определять последовательность задач. Даже для небольших команд подход «да мы и так всё в голове держим» обычно не работает.
К сожалению, для молодых ребят это не всегда понятно. Они не всегда могут найти правильные инструменты, методики правильной организации работы. Какое-то хорошее начинание, хорошая идея может быть просто загублена, потому что люди изначально неправильно сформировали команду и выстроили рабочий процесс. Соответственно, в Сколтехе такого рода вещам обучают.
Конечно, если у людей есть желание, то они всё это освоят и сами, но если им уже рассказали, какие подходы и инструменты есть, и как ими пользоваться, то разумный человек возьмет всё это на вооружение, и у него будет больше шансов на успех. И в этом смысле программа обучения в Сколтехе постоянно совершенствуется.
— Какой горизонт будущего вы видите в Сколтехе? На сколько лет вперед вы можете планировать? (Если полагаться на информацию, что финансирование в Сколтехе есть до 2022 года).
— Я об этом серьезно не думал, но с теми тенденциями, которые сейчас есть, по крайней мере, «вокруг меня», я могу предположить, что всё будет нормально. Сейчас активно отстраиваются исследовательские центры, формируются команды, активно идет работа с индустриальными заказчиками и работа академического плана. Пишутся заявки на различные гранты и субсидии, чтобы было дополнительное финансирование именно на академическую работу. Сильные ребята действительно хотят что-то делать и не собираются просто «ждать у моря погоды».

— Какие задачи решает ваш центр? Сколько в нем научных групп?
— Грубо говоря, у нас есть два направления: моделирование, основанное на «первых принципах физики», и моделирование на основе данных из разных источников, с использованием методов прикладной статистики, анализа данных и машинного обучения. У сотрудников нашего центра, особенно у моей группы, накоплен большой опыт работы по второму направлению.
Как я уже говорил, мы много занимались решением инженерных задач — например, строили модели для прогнозирования аэродинамики крыла самолета для новой геометрии поверхности. При этом мы использовали данные из разных источников: среди них данные полномасштабных аэродинамических экспериментов и данные вычислительных экспериментов с физическими моделями. Для этого мы применяем такие инструменты машинного обучения, как transfer learning (повышаем скорость и эффективность обучения модели, учитывая уже имеющиеся результаты обучения на данных, собранных при сходных условиях) и domain adaptation (повышаем точность прогноза модели для данных, отличающихся от обучающей выборки).
Другой важный пример — прогнозирование урожайности по данным дистанционного зондирования. Для России таких данных мало, а, допустим, для Канады, где климат схож с нашим, данные накоплены; я имею в виду, естественно, не только и не столько спутниковые снимки Земли, сколько детальную информацию о том, какие сельскохозяйственные культуры и на каких полях растут, состоянии почв и т. д. Если построить прогнозную модель урожайности на основе этих данных и потом ее откалибровать по небольшому количеству российских данных, это позволит сделать прогноз урожая и в России, а это важно для нашего сельского хозяйства.
В нефтегазовой отрасли мы тоже видим интересные задачи, там тоже есть широкое поле для приложений, позволяющих повысить эффективность этого сектора.
Наш центр также занимается различными аспектами интернета вещей, разрабатывает подходы к анализу данных о состоянии почвы, поиску новых химических соединений и их использованию в медицине и другими актуальными проектами.
Анализом данных о состоянии почвы занимается команда Ивана Оселедца , у них есть совместный проект с компанией «РусАгро». Почвоведы выезжают на специальные «тестовые» поля, берут пробы земли и изучают, как меняются состав и свойства почвы в зависимости от использованных удобрений. Всё это важно для повышения плодородия и урожайности земель.
Дизайн новых химических соединений позволяет оптимизировать их растворимость, токсичность, «заточить» лекарства под определенные цели. Такого рода задачи находятся на стыке биологии и медицины, с одной стороны, и вычислительной математики, с другой. Приходится обрабатывать большие базы результатов как реальных экспериментов, так и вычислительных на основе трудоемких в построении физических моделей. Последние используются для оценки свойств химических соединений, которую можно значительно ускорить благодаря машинному обучению.
— А вы друг с другом взаимодействуете, проводите какие-то общие конференции? Как вы обмениваетесь информацией?
— У меня с коллегами общий центр, наши кабинеты на одном этаже, и я каждое утро прохожу и со всеми здороваюсь. Тут-то и начинается взаимодействие — мы обсуждаем различные задачи, возможные подходы к ним. Есть общие проекты. Например, с Иваном Оселедцем мы разрабатываем ядерные методы машинного обучения: Иван — известный специалист в области вычислительной математики и знает, как за счет различных аппроксимаций ускорить матричные вычисления; а я хорошо понимаю, как адаптировать такого рода подходы, чтобы построить более эффективные ядерные методы.
С Максимом Фёдоровым , директором центра, мы взаимодействуем по поводу задач хемоинформатики; с Виктором Лемпицким , известным экспертом в области компьютерного зрения, применяем генеративные модели для сегментации изображений и обработки 3D-данных: эта область важна и для медицины, и для распознавания образов, и для создания беспилотных автомобилей…
Я лично много занимаюсь методами быстрого обнаружения изменений свойств больших потоков данных. Среди приложений — некоторые задачи кибербезопасности, прогнозирования поломок технических систем. Специалисты нефтегазовой области уже начали понимать важность подобного рода методов, и мы с ними активно сотрудничаем.

— Когда вы набираете магистрантов и аспирантов, то каких молодых ребят ищете? На что обращаете внимание?
— При приеме в Сколтех мы принимаем экзамены по математике, английскому плюс проводим очное собеседование. Это своего рода фильтр, который позволяет отобрать тех, кого надо. А если ко мне приходит аспирант и спрашивает, могу ли я стать руководителем его диссертации, то я смотрю на его диплом, разговариваю с ним, обсуждаю его интересы и планы на ближайшее будущее.
Я ищу хороших магистров, аспирантов. Хорошие — это те, у кого хорошая математическая подготовка уровня Физтеха, мехмата или физфака МГУ. Ребят, которые могут и в математике разобраться, и правильно «поставить» вычислительный эксперимент. А в целом, я в первую очередь смотрю, что человек может, а не откуда он пришел.
В моей научной группе география учебных заведений, где аспиранты заканчивали бакалавриат и/или магистратуру, достаточно широкая. Например, у меня есть аспирант, закончивший бакалавриат в Саратовском гос. университете, у него – отличные результаты, недавно съездил с докладом по мотивам принятой статьи на передовую конференцию SIGIR в США, попасть на которую весьма непросто.
Причины, по которым люди идут в аспирантуру, разные. Кто-то хочет потом остаться в науке, и в таком случае наличие ученой степени – обязательно условие. Кто-то хочет во время обучения в аспирантуре получить «твёрдые» базовые знания по выбранной специальности, научиться не только использовать методы машинного обучения, но и разрабатывать новые и решать нестандартные задачи, чтобы потом сделать хорошую карьеру.
— А где ваши студенты проходят практику?
— Я и мои коллеги сейчас активно привлекаем аспирантов и постдоков для участия в прикладных проектах Центра. Наши проекты служат для них своего рода испытательным полигоном. В этом смысле студенты видят, как устроены настоящие прикладные проекты, и что необходимо для решения индустриальных задач.
Между пятым и шестым курсом у студентов есть летняя практика, на которой студенты работают в той или иной компании и занимаются наукоёмкими проектами. Есть некоторый набор компаний (и этот набор постоянно расширяется, мы ведем переговоры с заинтересованными компаниями), в них выбираются какие-то задачи, которыми могут заниматься студенты с учетом их профиля подготовки в Сколтехе. Летняя практика длится порядка двух месяцев, студенты получают соответствующее денежное «довольствие» от института и могут сосредоточиться на решении прикладной задачи. Естественно, мы жестко мониторим ситуацию, чтобы это были наукоёмкие задачи, полезные для основной деятельности компаний, а не «перекладывание бумажек».
— Отправляете ли вы студентов в западную аспирантуру? Есть ли в этом необходимость? И где они пишут свои Ph.D. work?
— Они пишут свои диссертационные работы в России, под руководством профессоров центра Сколтеха. Но в части диссертаций и дипломных работ иногда задействованы и со-руководители из других университетов, в том числе и западных. Недавно один мой дипломник проходил стажировку в компании Philips, занимался детектированием объектов по термальным камерам.
Суть задачи в том, что в помещении установлено два вида камер – термальная и обычная; если в комнате не очень хорошее освещение, то за счет данных с термальной камеры можно улучшить точность, например, детекции человека в комнате. Соответственно, дипломник разрабатывал алгоритм, который позволял за счёт учёта данных от этих двух типов сенсоров улучшить точность детектирования объектов. В итоге, получилась хорошая дипломная работа с полезным индустриальным приложением.
Другой аспирант, стажировавшийся в той же компании, но в другом её отделе, занимался разработкой алгоритмов обнаружения аномалий для анализа различных данных пользователей, использующих некоторую продукцию компании. У него были получены определенные результаты и в настоящее время он готовит статью к публикации. В этом смысле Сколтех поддерживает такого рода контакты, стимулирует студентов к тому, чтобы не замыкаться в себе.
—А вы сами задумывались поехать на работу за рубеж?
— В разные периоды жизни на этот счет у меня были разные мысли. К счастью, так сложилось, что у меня есть интересная работа в России, при этом я довольно много езжу по миру. Например, недавно за месяц у меня было две поездки в США. Сначала я летал с докладом на одну из передовых конференций Artificial Intelligence and Statistics (AISTATS), а через некоторое время – посетил небольшой воркшоп, посвященный памяти М. Бравермана, раньше работавшего в ИПУ, а потом уехавшего в США. Он был одним из патриархов машинного обучения и получил многие значимые результаты.
— Возможно ли создание киберчеловека или искусственного интеллекта, равного человеческому или даже его опережающего?
— На данном этапе, мне кажется, нет. Надо понимать, что русский термин «искусственный интеллект» и английский artifcial intelligence различаются по значению. Русский — подразумевает создание именно чужеродного интеллекта, чего-то типа системы Skynet и Терминатора (из одноименного фильма). Английский же означает скорее компьютерную программу, которая выполняет ограниченный набор интеллектуальных функций согласно некоему алгоритму.
Есть много приложений, где требуются действия, которые человек не может делать быстро, точно, и в этом смысле программы, анализирующие данные, отлично научились заменять людей. Я думаю, что через какое-то время мы будем еще теснее взаимодействовать с такими системами. У нас будет больше электронных помощников, совершающих рутинные операции, дающих нам какие-то полезные рекомендации.
Допустим, врач устал, к концу рабочего дня не увидел затемнение в легком, а компьютер может врачу «дать подсказку». Понятно, что такого рода функции очень полезны, но это не то, что обычно вкладывают в понятие «искусственный интеллект». Такого рода системы будут только развиваться. А появится ли когда-нибудь человекоподобный робот, которого сложно будет отличить от человека? May be!
— Вы верите в то, что можно встроить электронную систему в мозг человека?
— Возможно, такое произойдет. Но опять-таки, тут возникает масса проблем, начиная от законодательных и моральных и заканчивая чисто техническими: как должна быть устроена электроника, чтобы ее можно было встроить в мозг человека? Много ли вы найдете людей, которые захотят, чтобы им в голову что-то встроили? Вот, например, по сути, уже существуют технические возможности для построения беспилотных самолетов. В реальности пилоты управляют самолетом около минуты, и даже эти действия мог бы выполнять автопилот. Однако вряд ли люди обрадуются, если узнают, что в кабине никого нет, — они просто не полетят на таком самолете. А вы говорите — внедрить человеку в голову какую-то железку. Может быть, когда-нибудь, когда будет пройден некий психологический барьер… Мне сложно прогнозировать.
— У вас нет ощущения какого-то «стеклянного потолка»? Вы полностью реализовались здесь, или вам было бы лучше в Кремниевой долине?
— Мы сейчас говорим об истории — как могла бы складываться моя жизнь — в сослагательном наклонении, которого история не терпит. На данном этапе пожалуй что никаких упомянутых вами ощущений не испытываю. При этом если бы я работал за рубежом, то баланс между более академическими проектами и индустриальными приложениями, наверное, распределился бы по-другому. В России тоже есть «точки роста» и возможности реализовать себя, при этом в более устоявшейся западной системе такие возможности не всегда легко найти.
Евгений Бурнаев
Talked by Natalia Demina
Фото Сколтеха