Локальная модель и облако
Чтобы понимать, что происходит с вашим текстом, достаточно знать, где он обрабатывается.
Облако
Вы печатаете вопрос, он уходит по сети на чужие серверы, там его обрабатывают и присылают ответ обратно. Всё, что вы написали, побывало на оборудовании другой компании.
Так работают ChatGPT, Claude, Gemini, Grok и другие сервисы, которыми пользуются с телефона и из браузера. Вычисления требуют дорогого оборудования, и стоит оно не у вас.
Локальная модель
Модель можно запустить на своём компьютере или на сервере компании. Тогда текст никуда не уходит: вопрос и ответ остаются внутри.
За это приходится платить качеством и удобством. Модель, которая помещается в обычный ноутбук, слабее облачной, отвечает медленнее и умеет меньше. Компании ставят такие у себя, когда данные важнее удобства: юридические документы, медицина, разработки, государственные задачи.
Между этими крайностями есть середина: корпоративный доступ к облачному сервису. Данные всё равно уходят наружу, но по договору, который запрещает использовать их для обучения и определяет сроки хранения.
У модели нет памяти
Сама модель ничего не помнит между сообщениями. Каждый запрос она обрабатывает с нуля, как если бы он был первым.
Память создаёт приложение вокруг неё. С каждым вашим новым сообщением оно отправляет модели весь предыдущий разговор заново: все ваши реплики, все её ответы, все приложенные файлы. Модель читает это целиком и отвечает на последнее сообщение.
Из этого следует 3 вещи.
Длинный разговор пересылается каждый раз. Чем больше вы наговорили, тем больше текста уходит по сети на каждую реплику, и тем дороже обходится ответ.
У этого есть предел. Когда разговор перестаёт помещаться в отведённый объём, ранние сообщения начинают выпадать. Вот почему длинный чат забывает сказанное в начале.
Удаление сообщения из окна не отменяет того, что оно уже уходило на сервер. Вы убираете его из будущих пересылок, а не из прошлых.