Локальная модель и облако

Чтобы понимать, что происходит с вашим текстом, достаточно знать, где он обрабатывается.

Облако

Вы печатаете вопрос, он уходит по сети на чужие серверы, там его обрабатывают и присылают ответ обратно. Всё, что вы написали, побывало на оборудовании другой компании.

Так работают ChatGPT, Claude, Gemini, Grok и другие сервисы, которыми пользуются с телефона и из браузера. Вычисления требуют дорогого оборудования, и стоит оно не у вас.

Локальная модель

Модель можно запустить на своём компьютере или на сервере компании. Тогда текст никуда не уходит: вопрос и ответ остаются внутри.

За это приходится платить качеством и удобством. Модель, которая помещается в обычный ноутбук, слабее облачной, отвечает медленнее и умеет меньше. Компании ставят такие у себя, когда данные важнее удобства: юридические документы, медицина, разработки, государственные задачи.

Между этими крайностями есть середина: корпоративный доступ к облачному сервису. Данные всё равно уходят наружу, но по договору, который запрещает использовать их для обучения и определяет сроки хранения.

У модели нет памяти

Сама модель ничего не помнит между сообщениями. Каждый запрос она обрабатывает с нуля, как если бы он был первым.

Память создаёт приложение вокруг неё. С каждым вашим новым сообщением оно отправляет модели весь предыдущий разговор заново: все ваши реплики, все её ответы, все приложенные файлы. Модель читает это целиком и отвечает на последнее сообщение.

Из этого следует 3 вещи.

Длинный разговор пересылается каждый раз. Чем больше вы наговорили, тем больше текста уходит по сети на каждую реплику, и тем дороже обходится ответ.

У этого есть предел. Когда разговор перестаёт помещаться в отведённый объём, ранние сообщения начинают выпадать. Вот почему длинный чат забывает сказанное в начале.

Удаление сообщения из окна не отменяет того, что оно уже уходило на сервер. Вы убираете его из будущих пересылок, а не из прошлых.