Локальные модели (Ollama)
Ollama позволяет запускать языковые модели полностью на вашем устройстве — запросы не покидают машину и не требуют внешнего API-ключа. Kodik автоматически обнаруживает запущенный Ollama-сервер и предлагает все загруженные модели для выбора.

Установка Ollama
Заголовок раздела «Установка Ollama»Если Ollama ещё не установлена, Kodik предложит установить её прямо из интерфейса. Вы также можете сделать это вручную.
| ОС | Команда |
|---|---|
| Linux | curl -fsSL https://ollama.com/install.sh | sh |
| macOS | brew install ollama |
| Windows | winget install -e --id Ollama.Ollama |
Запуск и остановка сервера
Заголовок раздела «Запуск и остановка сервера»Kodik умеет запускать и останавливать Ollama-сервер через встроенный интерфейс:
- Запустить — Kodik выполняет
ollama serveв фоне. Процесс остаётся живым даже после закрытия терминала. - Остановить — Kodik отправляет команду завершения, подходящую для текущей ОС.
Можно также запустить сервер самостоятельно командой ollama serve в терминале.
Настройка базового URL
Заголовок раздела «Настройка базового URL»По умолчанию Kodik обращается к http://localhost:11434. Если вы запускаете Ollama на другом хосте или порту — например, в Docker или на удалённой машине — укажите нужный URL в настройках провайдера Ollama.
Для Ollama в Docker, на удалённой машине или за прокси локальная команда ollama не обязана быть установлена, если указанный HTTP-эндпоинт доступен. Kodik использует этот эндпоинт для обнаружения моделей и действий в настройках.
Таймаут запроса
Заголовок раздела «Таймаут запроса»Поле Таймаут запроса в настройках провайдера Ollama задаёт, сколько миллисекунд Kodik ждёт, пока модель начнёт отвечать, прежде чем прервать запрос. Крупная модель при «холодном» старте или длинный промпт, обрабатываемый на CPU, могут не уложиться в значение по умолчанию до первого токена — увеличьте таймаут, чтобы Kodik ждал столько, сколько нужно. По умолчанию — 60000 (60 секунд); значение указывается в миллисекундах.
Загрузка и удаление моделей
Заголовок раздела «Загрузка и удаление моделей»В разделе настроек Ollama доступен список моделей с кнопками Pull и Delete:
- Pull — Kodik отправляет запрос
/api/pullна настроенный эндпоинт Ollama и показывает прогресс в настройках. - Delete — удаляет модель с диска через API Ollama.
Если нужная модель ещё не загружена, найдите её имя на ollama.com/library и введите его в поле загрузки.
Тест модели
Заголовок раздела «Тест модели»Кнопка Протестировать модель отправляет короткое тестовое сообщение выбранной модели и показывает ответ и время отклика. Это удобно для проверки корректности настройки перед началом работы.
Определение окна контекста
Заголовок раздела «Определение окна контекста»Kodik получает список установленных моделей через /api/tags, а поддерживаемый архитектурой контекст — через /api/show. Эти метаданные модели служат источником истины для меню использования контекста, настроек модели, бюджета запросов и автоматического сжатия.
Kodik также проверяет /api/ps для диагностики запущенной модели, но меньшее выделенное окно не заменяет размер контекста, успешно полученный через /api/show. Например, модель с заявленным контекстом 40 960 продолжает отображать и использовать 40 960, даже если /api/ps сообщает 4 096.
Kodik также читает возможности модели из /api/show. Если выбранная модель объявляет tools, Kodik отправляет активные схемы инструментов Harness и связанные инструкции. Если эта возможность явно отсутствует, Kodik отправляет запрос чата без инструментов. При создании Goal Kodik переходит на проверяемый JSON, а выбранный на такой модели foreground-subagent всё ещё может выполнить делегированную задачу, не требующую инструментов.
Поле Окно контекста в Kodik настраивает нативные функции Ollama, например автодополнение; для чата контекст выбранной модели определяется автоматически. Чтобы изменить выделение памяти Ollama во время выполнения, измените настройку контекста в Ollama, задайте OLLAMA_CONTEXT_LENGTH для сервера или создайте модель с PARAMETER num_ctx в Modelfile.
Управление рассуждением (thinking)
Заголовок раздела «Управление рассуждением (thinking)»Модели с возможностью thinking (например, семейство Qwen3) получают переключатель Рассуждение в выборе модели чата — отдельно для каждой модели. Вкл. сохраняет поведение Ollama по умолчанию: модель размышляет перед ответом, ход мыслей показывается в сворачиваемом блоке. Выкл. отправляет think: false — модель отвечает сразу, без этапа размышления: быстрее и экономнее по токенам для простых задач. Моделям без этой возможности флаг не отправляется никогда.
Авторизация
Заголовок раздела «Авторизация»Если ваш Ollama-сервер требует Bearer-токена (например, при использовании Ollama Cloud или закрытого корпоративного экземпляра), введите его в поле API Key в настройках провайдера Ollama. Для стандартной локальной установки оставьте это поле пустым.
