Шаг 4. Чем модели ИИ отличаются друг от друга? | ИИ — инструкция

Шаг 4. Чем модели ИИ отличаются друг от друга?

Если модели умеют примерно одно и то же, зачем вообще разбираться в поставщиках, тарифах и названиях? Не проще ли выбрать одну модель, которая сейчас считается самой умной, и пользоваться только ей?

Нет единой шкалы "умности"

У моделей нет одной общей шкалы "умности", по которой первая всегда лучше второй. Одна сильнее пишет текст, другая лучше работает с кодом, третья быстрее анализирует большой документ, а четвёртая дешевле справляется с рутинными действиями.

Выбор модели — это подбор инструмента под конкретную работу. При практике у вас сформируется набор из нескольких любимых моделей, от которых вы будете хорошо понимать, чего ожидать. Ведь еще есть такой немаловажный аспект, как привычка. Со временем и опытом общения с ботом вы учитесь все более тонко чувствовать, как именно надо ставить этой модели задачу. Мало того, даже модели, которые по официальным тестам и производительности вроде одинаковые, на практике оказывается, что разным моделям контекст задачи надо описывать по-разному.

Необходимость экспериментов возникает чаще всего из-за высокой стоимости флагманских моделей. Их есть смысл пробовать только в сложных задачах: построение архитектуры или работа в системе управления другими агентами в мультиагентной системе.

Например, мне может очень нравиться результат, который выдают GPT-6 Astra или Claude Opus 5.0. Но есть нюанс... они очень дорогие, и использовать их для задач из серии "сделай краткую выжимку текста и объясни простыми словами суть, что написано в законе на 58 листов" — это будет просто расточительно.

Модель DeepSeek V4 Flash с этой задачей справится с качеством, которое не будет заметно хуже, но при этом дешевле в 50 раз.

Со временем и экспериментами вы сформируете свой перечень моделей, с которыми вам комфортно работать. Ниже я опишу примеры, которые подходят лично для меня.

Актуальность данных

Иногда нужно будет следить за обновлениями моделей. Но опять же, это наиболее актуально в случае, если вы их используете в условиях, при которых важна актуальность основных обучающих данных.

Модель, обученная на данных до 2022 года, всё ещё может писать приложения, но с большей вероятностью будет использовать устаревшие библиотеки. И будет попадать в вертушки.

Одна из основных проблем создания программных продуктов в том, что программы собираются из множества взаимозависимых компонентов. Эти компоненты работают как кирпичики вашего приложения. И при обновлении их части совместимость всей системы может нарушиться. Одна из сложнейших задач поддержки — это как раз следить за обновлениями зависимых сервисов.

Мой список моделей

Это список, который я сформировал для себя. У вас он будет другим, в зависимости от задач и бюджета.

Быстрые и недорогие

Подходят для классификации писем, извлечения полей из документа, краткого пересказа, преобразования текста в таблицу и других повторяющихся действий.

Примеры:

  • DeepSeek V4 Flash
  • GPT-4.1 mini и nano

Эти модели работают быстро, стоят копейки и справляются с рутиной. Если задача простая, зачем платить больше?

Сбалансированные

Для ежедневной работы: редактирование текстов, составление планов, обсуждение идей, небольшие скрипты.

Примеры:

  • Claude Sonnet
  • GPT-4.1
  • DeepSeek V3

Эти модели дороже быстрых, но заметно умнее. С ними можно решать большинство реальных задач без переплаты за флагманов.

Флагманские

Для сложных задач: архитектурные решения, сложная логика, мультиагентные системы, рефакторинг большого кода

Примеры:

  • GPT-6 Astra
  • Claude Opus 5.0
  • o1 (если задача требует длинной цепочки рассуждений)

Эти модели стоят дорого, но иногда без них не обойтись. Если дешёвая модель три раза ошибается и вы тратите час на исправление, флагман, который решает задачу с первого раза за пять минут, окажется дешевле.

Справедливости ради отмечу, что сейчас даже разработку больших сайтов и личных кабинетов со многочисленными интеграциями можно вести НЕ на флагманах. Gpt 5.6-terra в разы дешевле той же gpt 6-astra, но ее вполне может хватать при хорошем опыте формирования контекста.

Специализированные

Некоторые модели заточены под конкретные задачи, например, gpt-5.3-codex пишет код лучше, чем универсальные модели, а DeepSeek V4 Flash
лучше работает с длинным контекстом и извлечением информации.

Контекст и его цена

Когда вы общаетесь с моделью, она каждый раз обрабатывает не только ваш новый вопрос, но и всю историю диалога. Это называется контекст.Чем длиннее диалог, тем больше токенов обрабатывается, тем дороже каждый запрос.

Поэтому в системных инструкциях опытных пользователей практически всегда есть пункт: "Отвечай кратко, если тебя не попросят иного".

Как не сжигать бюджет?

  • Отправлять только то, что нужно в каждом отдельном запросе.
  • Хранить постоянные инструкции отдельно
  • Просить краткий промежуточный результат там, где полный текст не нужен
  • Для простой операции использовать быструю модель
  • Сначала тестировать запрос на небольшом объёме данных
  • Ограничивать длину ответа и формат результата

При этом экономия не должна превращаться в самоцель. Если дешёвая модель ошибается то лучше взять более продвинутую.

На практике проще иметь несколько заранее настроенных ассистентов с описанным контекстом и подключенными подходящими моделями.

Такой подход экономит деньги и время. Я не трачу время на выбор модели для каждого запроса — просто обращаюсь к нужному ассистенту. Каждый из них уже в контексте моих задач, испльзуемых ресурсов и ограничений.

Например, у меня есть ассистент на базе gpt-5.3-codex, который в курсе моей инфраструктуры. Он знает, какие сервера у меня есть, может получить информацию об их ресурсах и установленных программах.

Он выполняет функции мониторинга и консультирует меня по вопросам диагностики при необходимости развернуть что-то новое. Важный момент, что у него только информация, но инструментов что-то самому выполнять на боевых серверах, у него нет.