Блог Ивана Новоселова
Нейропоиск

Два мира цифровой вселенной: Анатомия поисковых систем и нейросетей
Введение
Интернет, каким мы его знаем сегодня, держится на двух китах, которые на первый взгляд кажутся совершенно разными явлениями. С одной стороны — поисковые системы, ветераны цифрового пространства, которые уже четверть века служат главными вратами в мировую информацию. Google, Яндекс, а также стоящая особняком Википедия формируют основу нашего взаимодействия со знаниями. С другой стороны — нейросети, стремительно ворвавшиеся в нашу жизнь новые игроки, которые меняют само представление о том, как можно создавать и обрабатывать контент.
Это противостояние или, скорее, сосуществование двух эпох. Одна эпоха — индексация и поиск того, что уже создано человеком. Другая эпоха — генерация нового, создание того, чего раньше не существовало. Чтобы понять, куда движется цифровой мир, необходимо детально разобрать анатомию этих двух явлений, их бизнес-модели, внутреннее устройство и логику взаимодействия с пользователями, рекламодателями и государством.
Часть первая. Поисковые системы: стражи врат информации
Глава 1. Google: империя рекламы и данных
Google начинался как исследовательский проект двух студентов Стэнфорда, Ларри Пейджа и Сергея Брина, которые придумали способ ранжировать страницы по тому, сколько других страниц на них ссылаются. Сегодня это корпорация с квартальной выручкой, приближающейся к ста миллиардам долларов, и капитализацией, исчисляемой триллионами.
Финансовая модель Google строится на простой, но гениальной идее: делать основные сервисы бесплатными для пользователей, а зарабатывать на рекламе. Компания продаёт доступ к вниманию своей многомиллиардной аудитории. Когда вы вводите запрос в поисковую строку, рядом с органическими результатами выдачи появляются рекламные объявления, помеченные специальным образом. Рекламодатели платят за каждое нажатие на такое объявление, и эта модель, названная pay-per-click, приносит львиную долю доходов Google.
Однако реклама на собственном поисковике — лишь вершина айсберга. Google зарабатывает также на размещении объявлений на сайтах партнёров через свою сеть AdSense. Миллионы владельцев сайтов по всему миру размещают у себя рекламные блоки, и Google автоматически подбирает под каждую страницу релевантные объявления. Часть дохода от кликов получает владелец сайта, часть забирает Google. Это создало гигантскую экосистему, в которой рекламные деньги распределяются по всей сети.
Но главный актив Google, который позволяет делать рекламу такой эффективной, — это данные. Каждый ваш запрос, каждый клик, каждое видео на YouTube, которое вы смотрели, каждое место, куда вы проложили маршрут в Картах, — всё это обогащает бездонное хранилище информации о ваших интересах, привычках и намерениях. Эти данные позволяют показывать рекламу с пугающей точностью: вы ищете новые кроссовки, и через несколько минут реклама обувного магазина преследует вас на всех сайтах, которые вы посещаете.
При этом Google последовательно утверждает, что не продаёт личные данные пользователей напрямую. Компания продаёт не ваше имя и адрес, а возможность показать рекламу определённой категории людей. Рекламодатель платит за доступ к аудитории «мужчины 25–35 лет, интересующиеся бегом и живущие в Москве», но не получает ваши персональные данные. Эта тонкая грань позволяет компании балансировать между эффективной монетизацией и требованиями приватности.
Внутреннее устройство Google напоминает устройство гигантского живого организма. Основу составляет поисковый робот, который непрерывно путешествует по интернету, скачивая новые страницы и обновляя информацию о существующих. Гигантский индекс, распределённый по тысячам серверов по всему миру, хранит копии миллиардов страниц. Алгоритм ранжирования, который держится в строжайшем секрете и постоянно совершенствуется, определяет порядок выдачи для каждого запроса.
Организационная структура Google включает бесчисленное количество команд, каждая из которых отвечает за свой продукт или направление. Тысячи инженеров работают над улучшением поиска, разработчики мобильных приложений совершенствуют интерфейсы, специалисты по машинному обучению создают алгоритмы, которые понимают не только слова в запросе, но и стоящий за ними смысл. Отделы продаж взаимодействуют с рекламодателями, помогая им эффективно расходовать бюджеты. Юристы и специалисты по комплаенсу следят за соблюдением законодательства в десятках стран, где работает компания.
Отношения Google с государственными регуляторами складываются непросто. Антимонопольные расследования в США и Европе, многомиллиардные штрафы за нарушение конкуренции, споры о налоговой оптимизации — всё это стало привычным фоном существования корпорации. Однако масштабы бизнеса таковы, что даже крупные штрафы, исчисляемые сотнями миллионов долларов, не наносят серьёзного ущерба, воспринимаясь скорее как издержки ведения бизнеса.
Глава 2. Яндекс: российский техногигант с человеческим лицом
Яндекс часто называют «российским Google», но это упрощение скрывает глубокие различия между двумя компаниями. Яндекс вырос в другой культурной и рыночной среде и приобрёл уникальные черты, позволяющие ему успешно конкурировать с глобальным гигантом на домашнем рынке.
Финансовая модель Яндекса, как и у Google, базируется на рекламе, но структура бизнеса значительно диверсифицированнее. Поиск и реклама остаются основным источником дохода, принося стабильную выручку. Доля Яндекса на российском поисковом рынке превышает шестьдесят семь процентов, что создаёт мощный финансовый фундамент для развития других направлений.
Однако Яндекс давно перестал быть просто поисковиком. Сегодня это огромная экосистема, включающая сервисы электронной коммерции, доставки еды, такси, развлечений и облачных технологий. «Яндекс Маркет», «Яндекс Еда», «Яндекс Лавка», «Яндекс Такси», «Кинопоиск», «Яндекс Музыка» — все эти сервисы интегрированы в единое пространство, скреплённое подпиской «Яндекс Плюс».
Такая диверсификация не случайна. Рекламный рынок хоть и стабилен, но имеет пределы роста. Создавая экосистему сервисов, Яндекс получает возможность зарабатывать на транзакциях, подписках и комиссиях, а также собирать ещё больше данных о поведении пользователей. Знание о том, что вы ищете в интернете, куда ездите на такси, что заказываете в ресторанах и какие фильмы смотрите вечером, позволяет создавать невероятно точный профиль потребителя.
Внутреннее устройство Яндекса отражает эту многопрофильность. Компания разделена на несколько больших бизнес-групп: поиск и реклама, электронная коммерция и доставка, развлекательные сервисы, такси и беспилотные технологии. Каждая группа имеет собственную операционную команду, но все они используют общую технологическую инфраструктуру и обмениваются данными.
Особого внимания заслуживает технологическая база Яндекса. Компания с самого начала делала ставку на собственные разработки: собственный поисковый алгоритм, собственное машинное обучение, собственные системы обработки естественного языка. Это позволило Яндексу добиться превосходства в понимании русскоязычных запросов и создать технологии, которые затем монетизируются в других сервисах.
Яндекс активно инвестирует в будущее, вкладывая значительные средства в исследования и разработки. Компания запустила фонд технологических инициатив и выделяет средства на проекты, связанные с робототехникой, искусственным интеллектом в медицине и созданием «умных магазинов» с автоматическим контролем ценников и ассортимента. Такая стратегия означает, что сегодняшняя прибыль приносится в жертву завтрашнему росту, что характерно для компаний, нацеленных на долгосрочное лидерство.
Отношения Яндекса с государством и регуляторами всегда были более сложными и тонкими, чем у глобальных конкурентов. Работая в России, компания обязана соблюдать требования законодательства о хранении данных, о локализации серверов и о доступе к информации. При этом Яндекс сохраняет репутацию независимого игрока, стремящегося балансировать между требованиями регуляторов и интересами пользователей.
Глава 3. Википедия: некоммерческий остров в море капитализма
На фоне гигантских корпораций, зарабатывающих миллиарды на рекламе и данных, Википедия выглядит аномалией, инопланетным объектом, каким-то образом приземлившимся в центре цифровой вселенной. Это пятый по посещаемости сайт в мире, который не продаёт рекламу, не собирает данные пользователей и не приносит прибыли своим создателям.
Финансовая модель Википедии уникальна для интернета такого масштаба. Проект зарегистрирован как некоммерческая организация, Фонд Викимедиа, цель которой — не извлечение прибыли, а распространение знаний. Бюджет фонда формируется почти исключительно за счёт пожертвований обычных людей. Раз в год на сайте появляется баннер с призывом поддержать проект, и миллионы пользователей по всему миру переводят небольшие суммы. Этих добровольных взносов оказывается достаточно, чтобы покрывать расходы на серверы, полосу пропускания и зарплаты небольшого штата сотрудников.
Принципиальный отказ от рекламы — сознательное решение основателя Википедии Джимми Уэйлса, который считает, что энциклопедия должна оставаться пространством для получения знаний, а не для совершения покупок. Википедия как национальный парк, библиотека, школа — это не лучшее место для продажи рекламы. Когда вы заходите на сайт, вы приходите изучать, а не покупать.
Но самое удивительное в Википедии — это не финансовая модель, а модель производства контента. Энциклопедию создают исключительно добровольцы, которые не получают за свою работу ни копейки. По всему миру насчитывается около ста тысяч активных участников сообщества, из которых несколько тысяч составляют костяк, обеспечивающий основную массу правок и поддержание порядка.
Что заставляет людей тратить своё время на написание статей для бесплатного ресурса? Психология этого феномена сложна и многообразна. Одним нравится создавать свободную энциклопедию на родном языке, приносить пользу обществу. Другие находят этот процесс увлекательным: работа над статьями позволяет встречать интересных людей, вести интеллектуальные дискуссии, углубляться в интересующие темы. Это чистая экономика дара, существующая параллельно с экономикой прибыли и даже не противоречащая ей.
Управление Википедией устроено по принципу минимальной иерархии. Споры разрешаются достижением консенсуса под руководством хорошо разработанного свода нормативных стандартов. Администраторы, которые тоже являются добровольцами, избранными сообществом, вмешиваются только в крайних случаях. Такой подход, основанный на доверии к коллективному разуму, доказывает свою эффективность на протяжении более чем двадцати лет существования проекта.
Конечно, у модели есть и слабые стороны. Качество статей неравномерно: одни темы проработаны блестяще, другие оставляют желать лучшего. Возможны ошибки, вандализм, предвзятость. Однако исследования показывают, что по точности фактов Википедия сравнима с традиционными энциклопедиями, а по оперативности обновления информации превосходит их многократно.
Основатель проекта определяет миссию Википедии так: давать людям ясную информацию для принятия решений. Он признаёт, что энциклопедия не даёт глубоких знаний и не заменяет учебники, но и не должна этого делать. Она даёт общее описание, введение в тему, достаточное для большинства повседневных ситуаций. Если вам нужно узнать, что происходит в Зимбабве, или кто такой Монтескьё, или как устроен двигатель внутреннего сгорания, Википедия предоставит базовую информацию быстрее и удобнее, чем любой другой источник.
Отношения Википедии с государственными властями в разных странах складываются по-разному. В большинстве демократических стран проект существует свободно, не подвергаясь цензуре. В некоторых государствах доступ к сайту ограничен или осуществляется фильтрация отдельных страниц, содержащих нежелательную информацию. Фонд Викимедиа ведёт переговоры с властями, пытаясь добиться смягчения ограничений, но не готов идти на компромиссы в вопросах содержания статей.
Часть вторая. Нейросети: новая технологическая революция
Глава 4. Экономика нейросетей: от эксперимента к бизнесу
Рынок искусственного интеллекта в середине двадцатых годов окончательно перешёл от стадии технологического эксперимента к массовой коммерциализации. Прогнозы аналитиков впечатляют: к концу десятилетия финансовый эффект от использования ИИ во всём мире будет исчисляться десятками триллионов долларов ежегодно. В России экономический потенциал этой технологии оценивается в триллионы рублей.
Но как именно бизнес зарабатывает на нейросетях и как измеряет эффект от их внедрения? Это оказалось сложнее, чем кажется на первый взгляд. ИИ — прикладная технология, а не конечный продукт, и правильно рассчитать её отдачу — нетривиальная задача, над решением которой сейчас работают крупнейшие компании.
Специалисты выделяют несколько типов эффектов от внедрения нейросетей. Прямые экономические эффекты отражаются в отчётах о прибылях и убытках компании за год и связаны в основном с оптимизацией операционных затрат. Когда ИИ берёт на себя часть работы службы поддержки или автоматизирует обработку документов, это позволяет сократить расходы на персонал и повысить эффективность.
Другой тип эффектов связан с улучшением рекомендательных систем. Если алгоритм начинает точнее подбирать для клиентов подходящие товары или услуги, стоимость привлечения каждого покупателя снижается, а конверсия растёт. Это тоже вполне измеримый финансовый результат, который можно подсчитать в денежном эквиваленте.
Существуют также долгосрочные эффекты, которые сложно посчитать в моменте, но они формируют будущее компании. Когда нейросети ускоряют работу разработчиков и аналитиков, компания начинает быстрее решать свои задачи, быстрее выводить на рынок новые продукты. Повышение лояльности клиентов благодаря лучшему сервису тоже сказывается на бизнесе не сразу, а в перспективе нескольких лет.
Наконец, есть нефинансовые эффекты — например, улучшение систем безопасности, которые защищают средства пользователей и повышают доверие к бизнесу, или повышение удовлетворённости сотрудников, которым становится интереснее работать с современными инструментами.
Крупнейшие игроки уже подсчитали конкретные цифры. Т-Банк оценивает прямой экономический эффект от применения ИИ в десятки миллиардов рублей ежегодно. В компании значительная часть кода уже пишется нейросетями, что кардинально ускоряет разработку. «Сбер» прогнозирует, что финансовый эффект от внедрения GigaChat в бизнес-процессы может достигать десятков миллиардов рублей. В «Яндексе» после внедрения ИИ-агента в службу поддержки «Яндекс Такси» нейросеть стала самостоятельно решать большинство текстовых обращений, что в разы увеличило скорость ответа пользователям и позволит сэкономить сотни миллионов рублей.
Глава 5. Модельный ландшафт: глобальные гиганты и локальные игроки
Рынок больших языковых моделей к середине двадцатых годов окончательно перестал быть монолитным. Эра «одна модель для всех задач» ушла в прошлое, уступив место узкой специализации и гибким системам, где для каждой задачи подбирается оптимальный инструмент.
На вершине глобальной иерархии остаются несколько флагманов общего назначения. Модели от Google выделяются гигантским контекстным окном, что позволяет анализировать сверхбольшие документы целиком. Модели от xAI показывают выдающиеся результаты в тестах на логику и рассуждение. Однако использование этих моделей сопряжено с высокой стоимостью и необходимостью передавать данные во внешние облака, что подходит не для всех задач.
Новая волна мощных моделей пришла из Китая. Открытые модели вроде DeepSeek, Qwen и других демонстрируют впечатляющие результаты, особенно в задачах, требующих сложной логики и многошаговых рассуждений. Китайские модели стали лидерами по соотношению производительности и затрат, что делает их привлекательными для бизнеса по всему миру.
Российский рынок развивается по собственному пути, что связано как с языковой спецификой, так и с требованиями законодательства о персональных данных. Две доминирующие модели — GigaChat от «Сбера» и YandexGPT от «Яндекса» — каждая со своими особенностями. GigaChat силён в мультимодальности, то есть в работе с разными типами контента, включая изображения. YandexGPT делает акцент на улучшении вызова функций и работе со структурированными ответами, что важно для создания сложных ИИ-агентов, взаимодействующих с внешними системами.
Уровень проникновения генеративного ИИ среди российского бизнеса, по оценкам «Сбера», достиг очень высоких значений. Это означает, что подавляющее большинство крупных компаний уже используют нейросети в той или иной форме, хотя глубина интеграции и реальная отдача варьируются очень широко.
Для бизнеса, работающего с конфиденциальной информацией, критически важной становится возможность локального запуска моделей в закрытом контуре компании. Это единственный способ гарантировать, что финансовая отчётность, персональные данные или инженерная документация никогда не покинут корпоративную сеть. Специализированные инструменты значительно упростили развёртывание моделей на собственном оборудовании.
Глава 6. Практическое внедрение: как нейросети меняют бизнес-процессы
Самый интересный и поучительный пример того, как нейросети могут трансформировать целую индустрию, демонстрирует история внедрения CPA-аукциона в «Яндекс Еде». Этот кейс показывает путь от технической идеи до масштабного бизнес-результата, изменившего правила игры на рынке доставки еды.
Долгое время в индустрии food-tech господствовала модель оплаты за клик. Рестораны платили за каждый переход пользователя на свою страницу, независимо от того, сделал ли он заказ. Эта модель была непрозрачной и неудобной для партнёров: сложно планировать бюджет, когда не знаешь, сколько реальных продаж принесёт каждый потраченный рубль. Кроме того, она ограничивала саму платформу, поскольку рекламные места доставались только тем заведениям, которые попадали в первые позиции выдачи.
Команда ML-инженеров предложила радикально иной подход — CPA-аукцион, где рестораны платят только за реально совершённые заказы. Техническая сложность заключалась в том, что новая система должна была за миллисекунды учитывать три параметра одновременно: ставку ресторана, вероятность того, что пользователь действительно закажет еду, и ожидаемую маржинальность заказа. При этом работать новая система должна была не медленнее старой.
Решение нашлось в параллельных вычислениях и батчевой обработке данных. Модель предсказания вероятности заказа и модель маржинальности стали работать одновременно, загружая сразу несколько ресторанов для анализа. Отдельной задачей стала калибровка — нужно было добиться, чтобы предсказания алгоритма точно соответствовали реальности.
Результат превзошёл все ожидания. Рекламные доходы выросли в разы, значительная часть ресторанов-партнёров подключилась к новой системе. Рестораны получили прозрачность, которой им так не хватало: теперь каждый потраченный рубль приносит конкретный заказ. Пользователи изменений практически не заметили, но выдача стала ещё лучше, поскольку алгоритм точнее подбирает рестораны под индивидуальные предпочтения.
Этот пример демонстрирует ключевую особенность современного этапа развития нейросетей: технология перестала быть самоцелью и превратилась в инструмент решения конкретных бизнес-задач. Успех измеряется не сложностью алгоритма, а реальными метриками — ростом выручки, снижением издержек, повышением лояльности клиентов.
Глава 7. Инфраструктура для нейросетей: платформы и агрегаторы
По мере того как количество доступных моделей росло, бизнес столкнулся с новой проблемой: сложностью управления целым «зоопарком» специализированных нейросетей. Какую модель выбрать для классификации входящих писем, какую для анализа юридических договоров, какую для генерации изображений, а какую для ответа клиентам на русском языке? Интегрировать и поддерживать десятки разных API в одиночку слишком дорого и сложно.
Ответом на этот вызов стало появление платформ-оркестраторов, которые берут на себя управление множеством моделей и предоставляют к ним единый интерфейс. Такие платформы выполняют роль «умного диспетчера», автоматически направляя каждый запрос на наиболее подходящую модель. Простой запрос может быть обработан быстрой локальной моделью, сложный аналитический — мощной DeepSeek, а задача, требующая знания российской специфики, — GigaChat или YandexGPT.
Ключевое преимущество таких платформ для бизнеса — возможность развёртывания в закрытом контуре компании. Вся оркестрация, маршрутизация и работа моделей происходят внутри безопасного периметра, что критически важно для компаний, работающих с конфиденциальными данными. Единый API избавляет IT-отдел от необходимости поддерживать десятки разных интеграций, а ролевая модель доступа обеспечивает соблюдение прав пользователей на всех этапах работы.
Петербургская компания Just AI, создавшая платформу Jay Flow, вложила в проект значительные средства и рассчитывает на окупаемость в течение двух-трёх лет. Основными потребителями продукта видятся банковский и промышленный сектор, а также средний бизнес, где уже формируется устойчивый спрос на внедрение ИИ-инструментов.
Интересно, что при разработке самой платформы создатели активно использовали нейросети для написания кода, тестирования, создания документации, маркетинга и дизайна. Это позволило создать продукт в сжатые сроки и сравнительно небольшой командой — пример того, как ИИ ускоряет собственное развитие.
Эксперты отмечают, что такие платформы-агрегаторы будут востребованы как на короткой, так и на длинной дистанции, хотя и предупреждают о юридических тонкостях. При использовании нейросетей важно понимать, что они обучаются на контенте, защищённом авторскими правами, и договор с платформой должен чётко регулировать, кому принадлежат права на сгенерированные материалы.
Глава 8. Нейросети и государство: регулирование и контроль
Отношения государства с нейросетями только начинают формироваться, и этот процесс будет определять развитие технологии на годы вперёд. В отличие от поисковых систем, чья бизнес-модель и социальное влияние более или менее изучены, нейросети ставят перед регуляторами принципиально новые вопросы.
Первый блок вопросов касается авторского права и интеллектуальной собственности. Нейросети обучаются на гигантских массивах текстов и изображений, многие из которых защищены авторским правом. Законно ли использовать чужие произведения для обучения коммерческих моделей? Кому принадлежат права на контент, созданный нейросетью? В разных странах ответы на эти вопросы пока различаются, и единого подхода не выработано.
Второй блок связан с достоверностью информации и ответственностью. Если нейросеть ошибается и выдаёт ложные сведения, кто несёт ответственность — разработчик модели, владелец платформы или пользователь? Если сгенерированный контент кого-то оклеветал или причинил ущерб, как применять существующие законы к ситуациям, которых не существовало, когда эти законы писались?
Третий блок — этические вопросы. Нейросети могут воспроизводить и усиливать предрассудки, содержащиеся в обучающих данных. Они могут использоваться для создания дезинформации, дипфейков, манипуляции общественным мнением. Как общество может защитить себя от этих рисков, не задушив при этом инновации?
Российские регуляторы активно следят за развитием технологии, но пока не спешат с жёсткими ограничениями. Упор делается на развитие собственных технологий и обеспечение суверенитета данных, чтобы критически важная инфраструктура не зависела от иностранных решений.
Часть третья. Сравнение и перспективы
Глава 9. Две эпохи, два подхода
Поисковые системы и нейросети представляют собой не просто разные технологии, а разные философии работы с информацией. Поисковики индексируют то, что уже создано человечеством, и помогают это находить. Нейросети создают новое, то, чего раньше не существовало.
Бизнес-модели тоже различаются фундаментально. Поисковики зарабатывают на рекламе, используя данные о пользователях для таргетинга. Нейросети пока находятся в стадии поиска устойчивых бизнес-моделей: кто-то продаёт доступ через API, кто-то внедряет технологии в свои продукты, повышая их ценность, кто-то экспериментирует с подписками.
Уровень зрелости рынков также разный. Поиск — это зрелая, устоявшаяся индустрия с понятными правилами игры и прогнозируемыми доходами. Нейросети — бурно развивающийся рынок, где каждые несколько месяцев появляются новые модели, новые возможности и новые игроки.
Глава 10. Куда движется мир
Будущее, скорее всего, за синтезом этих двух подходов. Поисковые системы уже активно встраивают нейросети в свои продукты. Google внедряет генеративные ответы прямо в выдачу, позволяя пользователю получить готовый ответ, не переходя по ссылкам. Яндекс использует нейросети для улучшения поиска и персонализации рекомендаций.
Нейросети, в свою очередь, нуждаются в доступе к актуальной информации, которую могут предоставить только поисковые системы. Так называемый RAG-подход, когда языковая модель перед генерацией ответа обращается к внешним источникам данных, становится стандартом для серьёзных бизнес-приложений.
Википедия в этом новом мире занимает особое место. Её качественно выверенный, структурированный контент становится идеальной базой для обучения нейросетей и для проверки фактов. Возможно, мы движемся к миру, где поиск, генерация и проверка будут неразрывно связаны, образуя новое качество работы с информацией.
Одно можно сказать с уверенностью: цифровая вселенная продолжает усложняться, и на смену простой дихотомии «найти — прочитать» приходит новая реальность «сгенерировать — проверить — использовать». И в этой реальности найдётся место и для рекламных гигантов, и для некоммерческих энциклопедий, и для стремительно эволюционирующих нейросетей.
ия.

