DeepSeek Harness выпустил первое значительное обновление после публичной беты: v0.1.0-rc.8, с поддержкой мультимодальности в качестве главной особенности. 14 изменений охватывают мультимодальный ввод, совместную работу саб-агентов, терминальный опыт, вызов инструментов и поддержку разработчиков. Поддерживаются нативные запросы изображений и смешанный ввод текста и изображений, /goal и /plan напрямую принимают изображения; Claude Code и Codex дополнительно интегрированы в систему саб-агентов, улучшен терминал Windows, исправлены проблемы с запросами изображений, стримингом и пользовательскими шлюзами.
DeepSeek Harness открыл публичную бету v0.1 и исходный код 13 августа. В ночь беты Жиду (Zhidx) скачал исходники и протестировал, переведя 88-страничную статью и разработав игру Snake. Менее чем за неделю агентский харнес получил мультимодальные возможности. Отечественные разработчики отреагировали с восторгом, а зарубежные сосредоточились на двух новых способностях — явном прогрессе. Ещё интереснее: некоторые разработчики обнаружили способ видения DeepSeek Harness: для моделей, которые сами не поддерживают ввод изображений, он вызывает инструменты OCR, статистики цветов и сканирования пикселей, чтобы разложить изображения на структурированную информацию, а затем передать её текстовым моделям для рассуждения — фактически, создавая на уровне инструментов зрение для чисто текстовых моделей.
Адаптеры модели DeepSeek теперь могут включать нативные запросы изображений через конфигурацию; для моделей со зрением Harness отправляет изображения напрямую, а /goal и /plan поддерживают смешанный ввод текста и изображений. Меню @ в поле ввода добавляет ссылки на файлы и сессии, позволяя пользователям включать локальные файлы и существующие сессии в задачу, так что агентские рабочие процессы могут добавлять скриншоты в контекст. Система саб-агентов расширяется: новая версия поддерживает установку Claude Code и Codex в качестве Profile Bundles по запросу, причём Codex поддерживает неинтерактивный режим с разрешениями и несколько именованных экземпляров. Пользователи Windows получают постоянные сессии PowerShell в PTY-терминале, включённые по умолчанию в минимальном режиме. Обновление также исправляет проблемы с изображениями избыточного размера или накопившейся истории, которые приводили к сбоям запросов, отменённый стриминг, теряющий префиксы ответов, и пользовательские шлюзы, совместимые с OpenAI, которые выходили из строя из-за различий в формате запросов.
Разработчик Йинсен (Yinsen) обнаружил, что когда модель не объявляет ввод изображений, прямой вызов read_image сначала завершается ошибкой, но задача не останавливается: Harness использует запасной вариант — распознавание текста OCR, статистику соотношения цветов и частичное сканирование строк пикселей, считывая размеры изображения и метаданные цветового режима. Изображение с текстом и простой графикой может быть разложено на текстовое содержимое, соотношение цветов фона, изменения пикселей и размер; результаты возвращаются текстовой модели, которая восстанавливает всю картину на основе текста OCR и позиций пикселей. Для скриншотов презентаций, блок-схем и UI-скриншотов с чёткой структурой OCR и пиксельные признаки восстанавливают полезную информацию; реальные фотографии восстанавливают меньше. Зрение не обязательно привязывать к базовой модели. Сообщество уже создало плагины для зрения: dsh-vision, dsh-vision-toolkit, modlens, dsh-auto-vision, dsh-subagent-vision и pi-vision через pi2dsh. С rc.8 нативный мультимодал и эти схемы на уровне инструментов работают вместе.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




