AI-модели — 400+ нейросетей через единый API
Каталог нейросетей от OpenAI, Anthropic, Google, Meta, xAI и DeepSeek. Фильтруйте по провайдеру, категории и цене. Все модели доступны через единый API с оплатой в BYN.
476 моделей
FLUX.3 Image - модель Black Forest Labs для генерации и редактирования изображений по тексту. Поддерживает обработку нескольких референсов - до 10 входных изображений, принимает текст и изображения, а результат выдает в виде изображения.
MAI-Voice-2.1 от Microsoft AI - модель для генерации речи по тексту. Подходит для управляемого создания голосовых реплик, озвучивания и подачи аудиоконтента; на вход принимает текст, на выходе формирует аудио.
MAI-Voice-2.1-Flash от Microsoft AI - модель для генерации речи по тексту. Подходит для озвучивания с настраиваемым голосом, дикторского чтения и управления подачей аудио; на вход принимает текст, на выходе создаёт аудио.
HeyGen Video - универсальная модель HeyGen для генерации видео. Она создает короткие ролики с синтезированным аудио, включая диалоги, звуковое окружение и эффекты, за один запрос; на вход принимает текст, изображения, аудио и видео.
GPT-6.1 Sol от OpenAI предназначена для сложного программирования, работы с компьютером и профессиональных задач при более низкой стоимости. Модель принимает текст, изображения и файлы, поддерживает reasoning, tool calling, web search, prompt caching и structured outputs.
GPT-6.1 Sol Pro - модель OpenAI для работы с текстом, изображениями и файлами. Режим Pro reasoning предназначен для более качественных ответов на сложные задачи; также поддерживаются tool calling, веб-поиск и структурированные ответы.
Claude Sonnet 5.5 от Anthropic - быстрая модель для повседневной разработки, агентов и работы со знаниями. Поддерживает context до 1 млн токенов, принимает файлы, изображения и текст, а также включает reasoning, tool calling, vision и web search для комплексных задач.
Perceptron Mk1.5 - мультимодальная модель с reasoning для анализа изображений и работы с физическими агентами. Принимает текст, изображения, видео и аудио, поддерживает tool calling и структурированный вывод с точками, рамками, полигонами и треками.
Ember-1 от Fireworks - это мультимодальная модель для визуального анализа, планирования и использования инструментов. Она поддерживает reasoning, tool calling и structured outputs, принимает на вход изображения и текст, а также имеет context в один миллион токенов.
Aion 3.5 от AionLabs - текстовая модель семейства GLM для совместного создания историй и ролевых сценариев. Она поддерживает выразительную структуру повествования, напряжение, конфликт и неоднозначные взрослые темы, а также reasoning и tool calling; context - 262144 токена.
Aion 3.5 Mini от AionLabs - это модель из семейства GLM для ролевых игр и сторителлинга. Она улучшает нарратив, напряжение и конфликты, поддерживая нюансированные взрослые темы. Работает с контекстом на 262144 токена, включает reasoning и tool calling.
GLM 5.3 Prime - флагманская модель Z.ai для reasoning, написания кода и инженерных задач с участием AI-агентов. Поддерживает текстовый ввод и вывод, обязательный reasoning, tool calling, параллельные вызовы инструментов, logprobs и prompt caching.
Qwen 3.8 Max Prime - высокопроизводительная версия Qwen3.8 Max для coding, профессиональных задач, мультимодального понимания и длительных agent workflows. Принимает текст, изображения и видео, генерирует текст, поддерживает context до 1 млн токенов, reasoning, tool calling и структурированные ответы.
Recraft V4.1 Flash - модель для генерации изображений по текстовым запросам, редактирования и визуального дизайна. Принимает текст на входе и создает изображения для творческих задач.
Solar Mini 4 - компактная MoE-модель Upstage на 35 млрд параметров, из которых активны 3 млрд; поддерживает context до 524K токенов и работу с текстом. Подходит для agentic tasks, поддерживает корейский и английский языки, reasoning и tool calling.
Claude Opus 5.5 от Anthropic - модель для длительных агентных задач в кодинге и интеллектуальной работе. Поддерживает контекст до 1 млн токенов, принимает файлы, изображения и текст, а также включает обязательный reasoning, tool calling, параллельные вызовы инструментов, vision, веб-поиск и структурированные выходные данные.
Command A+ от Cohere - это мультиязычная модель для корпоративных агентов, инструментов и чатов. Она поддерживает расширенный контекст, принимает изображения и текст, а выдает только текст. Модель оснащена функциями reasoning, tool calling, параллельными вызовами инструментов, structured outputs, vision и prompt caching.
GPT-6 Luna - модель OpenAI для эффективной обработки большого объёма целевых задач. Она принимает текст, изображения и файлы, поддерживает reasoning, tool calling, поиск в интернете и структурированный вывод.
GPT-6 Luna Pro от OpenAI использует режим reasoning pro для работы со сложными задачами. Модель принимает текст, изображения и файлы, поддерживает tool calling, web search, prompt caching и структурированный вывод.
GPT-6 Sol от OpenAI предназначена для сложных задач программирования и agentic workflows. Модель принимает текст, изображения и файлы, поддерживает reasoning, vision, web search, параллельные tool calls, prompt caching и structured outputs, а выдаёт текст.
GPT-6 Sol Pro от OpenAI - модель с reasoning.mode, установленным в pro для ответов на сложные задачи. Поддерживает context до 1 050 000 токенов, принимает текст, изображения и файлы, генерирует текст и умеет работать с tool calling, web search и structured outputs.
MiMo-V2.6-Flash от Xiaomi предназначена для мультимодальных coding agents и автоматизации задач с длинным context. Модель принимает аудио, изображения, текст и видео, генерирует текст и поддерживает reasoning, tool calling, параллельные вызовы инструментов и структурированные ответы.
MiMo-V2.6-Pro - модель Xiaomi для мультимодального reasoning и выполнения задач coding-агентами. Принимает текст, изображения, аудио и видео, поддерживает context до 1048576 токенов, параллельные tool calls и структурированный вывод.
Ming Image 0.1 Design от inclusionAI - text-to-image модель для создания изображений по текстовому описанию. Она ориентирована на задачи графического дизайна и уделяет особое внимание разборчивости текста, встроенного в изображение.
Grok 4.7 от xAI предназначена для длительной работы агентов, программирования, задач со знаниями и визуальных проектов. Модель принимает текст, изображения и файлы, поддерживает reasoning, tool calling, web search и структурированный вывод.
MiMo-V2.6-Pro-UltraSpeed - модель Xiaomi для мультимодального reasoning и выполнения задач агентом. Принимает аудио, изображения, видео и текст, поддерживает context до 1048576 токенов, параллельный tool calling и структурированный вывод.
GLM 5.3 FlashX - быстрый вариант модели для программирования и агентных задач. Принимает текст, изображения и видео, поддерживает reasoning, tool calling, параллельные вызовы инструментов и кэширование промптов.
Ternary Bonsai 2 27B - reasoning-модель PrismML на 27B параметров, основанная на Qwen3.8-27B. Поддерживает программирование, математику, tool calling и понимание изображений, принимает текст и изображения и работает с context до 262K токенов.
Pareto - мультимодальная модель, которая параллельно использует несколько языковых моделей и объединяет их результаты в один ответ. Принимает текст и изображения, генерирует текст и поддерживает tool calling и prompt caching; context - 262144 токена.
Qwen3.8 Omni Flash от Alibaba работает с текстом, изображениями, аудио и видео и предназначена для мультимодальных агентных задач. Модель поддерживает reasoning, tool calling, структурированный вывод и параллельные вызовы инструментов.
Schematron V2 Small от Inference.net предназначена для ответов с низкой задержкой, извлечения данных и автоматизации рутинных задач. Модель работает с текстом и поддерживает prompt caching и structured outputs.
Schematron V2 Turbo от Inference.net подходит для быстрых текстовых ответов, извлечения информации и автоматизации рутинных задач. Поддерживает prompt caching и structured outputs.
Fugu Max от Sakana направляет экспертных агентов для решения сложных аналитических задач. Модель принимает текст, изображения и файлы, поддерживает reasoning, tool calling, web search, prompt caching и структурированный вывод.
Fugu Ultra v2 от Sakana - multi-agent модель для сложных исследований, аналитики и соревнований с акцентом на качество. Принимает текст, изображения и файлы, поддерживает reasoning, tool calling, веб-поиск, prompt caching и структурированный вывод.
DeepSeek V4.1 Flash - модель от DeepSeek для решения задач reasoning и агентного программирования. Поддерживает большой контекст, принимает на вход изображения и текст, генерирует текстовые ответы. Включает функции logprobs, параллельные вызовы инструментов, кэширование запросов, reasoning, структурированные выходные данные, tool calling и vision.
FLUX Video Edit - модель Black Forest Labs для редактирования видео по текстовому запросу: она принимает исходный ролик и описание правок, а возвращает изменённое видео. С её помощью можно добавлять, удалять или заменять объекты и персонажей, а также перестраивать окружение.
Ling 3.0 Flash VL - мультимодальная модель для анализа изображений и видео, планирования и reasoning. Принимает текст, изображения и видео, генерирует текст, поддерживает context до 131072 токенов, tool calling, параллельные вызовы инструментов и структурированный вывод.
GPT Image 2.5 Flare от OpenAI создает изображения по текстовым запросам, редактирует их и помогает в задачах визуального дизайна. Модель принимает текст и изображения, а результатом выдает изображение.
GPT Image 2.5 Sunburst от OpenAI создает и редактирует изображения по текстовым запросам, а также подходит для задач визуального дизайна. Модель принимает текст и изображения, поддерживает image editing, vision и web search.
Mercury 2.5 от Inception - текстовая reasoning-модель для последовательного анализа и решения многоэтапных задач. Поддерживает tool calling, параллельные вызовы инструментов, prompt caching и структурированный вывод; context - 260 000 токенов.
Nex-N2.5-Mini - мультимодальная модель Nex AGI для reasoning, анализа изображений и планирования. Принимает текст и изображения, выдаёт текст, поддерживает tool calling, параллельные вызовы инструментов и context до 262144 токенов.
Nex-N2.5-Pro от Nex AGI - мультимодальная модель для анализа изображений, планирования и reasoning. Принимает текст и изображения, генерирует текст, поддерживает context до 262144 токенов, tool calling, структурированный вывод и параллельные вызовы инструментов.
GPT-6 Astra - модель OpenAI для сложного reasoning, программирования, работы с компьютером, исследований и создания документов. Принимает текст, изображения и файлы, поддерживает web search, tool calling и структурированный вывод.
GPT-6 Astra Pro от OpenAI - версия GPT-6 Astra с режимом reasoning pro, рассчитанным на более качественные ответы в сложных задачах. Поддерживает context до 1 050 000 токенов, анализ файлов и изображений, tool calling и веб-поиск.
MAI-Image-2.6 - модель Microsoft AI для генерации и редактирования изображений, ориентированная на создание визуальных материалов для дизайна. Принимает текст и изображения, обрабатывает визуальный ввод и выдаёт изображения; context составляет 4096 токенов.
MAI-Image-2.6 Flash - модель Microsoft AI для генерации и редактирования изображений с низкой задержкой и стоимостью. Она рассчитана на производственные сценарии с высокой нагрузкой и предлагает качество, сопоставимое с precision-версией; на вход принимает текст и изображения.
Gemini 3.8 Flash от Google предназначена для длительной разработки ПО, автономных агентов и сложных корпоративных процессов. Принимает текст, изображения, аудио, видео и файлы, поддерживает context, reasoning и tool calling, а выводит текст.
H3 Max - модель MiniMax для text-to-video и image-to-video генерации, разработанная на основе MiniMax H3 с дополнительным обучением. Выпущена совместно с fal.ai; принимает текст и изображения, а результатом создаёт видео.
Muse Spark 1.3 - мультимодальная reasoning-модель Meta для длительных агентных, мультиагентных и coding-сценариев. Принимает текст, изображения, видео и файлы, поддерживает tool calling; по сравнению с Muse Spark 1.2 улучшены взаимодействие агентов, следование инструкциям и эффективность в coding.
Muse Spark 1.3 Contributor от Meta - мультимодальная reasoning-модель для длительных агентных задач, взаимодействия нескольких агентов и программирования. Принимает текст, изображения, видео и файлы, поддерживает tool calling, web search, структурированный вывод и prompt caching.
Claude Fable 5.1 от Anthropic - модель для требовательных задач reasoning и длительной агентной работы. Поддерживает расширенный контекст, принимает файлы, изображения и текст, выдает текстовые ответы. Включает обязательный reasoning, параллельные tool calls, prompt caching, vision, structured outputs и web search.
Granite 4.2 8B - текстовая модель IBM для анализа и решения задач, требующих нескольких шагов. Поддерживает reasoning, tool calling, параллельные вызовы инструментов и структурированные ответы, а также prompt caching и выдачу logprobs.
Hy4 preview - модель Tencent для продуктивных задач, рассчитанная на работу Agent и выполнение сложных сценариев. Поддерживает reasoning, tool calling, параллельные вызовы инструментов, prompt caching и структурированный вывод.
Ling 3.0 Flash Fin - модель от inclusionAI для финансовых исследований, многоэтапных инвестиционных процессов и долгосрочного планирования с выполнением задач. Поддерживает reasoning, tool calling и структурированный вывод; context составляет 262144 токена.
Wan 3.0 Prime - быстрая версия модели Alibaba для генерации видео. Она создает ролики по текстовому описанию или на основе изображения, заданного в качестве первого кадра.
GLM-5.3-Flash от Zhipu AI - мультимодальная модель для задач программирования и длительных агентских сценариев. Принимает текст, изображения и видео, генерирует текст, поддерживает reasoning, tool calling и структурированные ответы.
Muse Image - модель Meta для генерации и редактирования изображений по текстовым описаниям и референсам. Перед созданием изображения она применяет reasoning; на вход принимает текст и изображения, а результатом служит изображение.
Qwen3.8 Flash - мультимодальная модель Alibaba для визуального reasoning, работы с документами и агентских задач. Принимает текст, изображения и видео, а в ответ выдаёт текст; поддерживает tool calling, структурированные ответы, prompt caching и context на 1 миллион токенов.
Avatar IV от HeyGen - это image-to-video модель, которая оживляет одно фото в выразительное видео с синхронизацией губ. Она интерпретирует голос, а не просто подбирает формы рта к словам, создавая естественное движение.
Wan 3.0 - модель Alibaba для генерации видео по текстовому описанию, изображению или референсу. Создает ролики в разрешении 480p, 720p или 1080p длительностью от 2 до 30 секунд.
DeepSeek V4 Flash Vision Exp - экспериментальная мультимодальная модель от DeepSeek для понимания изображений, кодинга и агентных задач. Поддерживает context до 1M токенов, принимает на вход изображения и текст, генерирует текст. Включает возможности reasoning, tool calling, vision, structured outputs, parallel tool calls и prompt caching.
Hy-MT2-1.8B - reasoning-модель Tencent для работы с кодом, выполнения инструкций и агентских задач. Принимает текст и генерирует текст; поддерживает context до 8192 токенов.
Hy-MT2-30B-A3B - reasoning-модель Tencent для задач программирования, выполнения инструкций и работы агентов. Принимает текст и генерирует текст, поддерживает structured outputs и context до 8192 токенов.
Hy-MT2-7B - модель перевода Tencent с 7 млрд параметров, поддерживающая 33 языковые пары и пять пар с китайскими диалектами и языками меньшинств. Она работает со структурированным текстом, разделителями, контекстом и глоссариями, а также учитывает заданный стиль.
GLM-5.3 - флагманская модель Zhipu AI для программирования в рамках длительных задач, работы агентов и выполнения сложных проектов. Поддерживает context до 1048576 токенов, reasoning, tool calling, параллельные вызовы инструментов и структурированный вывод.
Qwen3.8 27B - плотная vision-language модель Alibaba для программирования, агентных задач и понимания изображений и видео. Принимает текст, изображения и видео, генерирует текст, поддерживает reasoning, tool calling, структурированный вывод и кэширование prompt.
Gemini 3.7 Flash от Google предназначена для agentic workflows, программирования и мультимодального reasoning. Принимает текст, аудио, файлы, изображения и видео; поддерживает tool calling, web search, prompt caching и структурированный вывод.
Qwen3 ASR 0.6B - компактная модель распознавания речи от Qwen. Она определяет язык и преобразует аудио в текст на 30 языках и 22 китайских диалектах, поддерживая потоковую и офлайн-обработку.
Qwen3 ASR 1.7B - модель автоматического распознавания речи от Qwen, принимающая аудио и выдающая транскрипцию. Поддерживает определение языка и расшифровку речи на 30 языках и 22 китайских диалектах, а также потоковую обработку и офлайн-инференс.
voyage-code-4 - embedding-модель от Voyage AI, компании MongoDB, разработанная для coding agents и поиска по коду. Принимает на вход текст и формирует embeddings для извлечения информации из программного кода.
Grok 4.6 от xAI предназначена для агентных задач, программирования, работы со знаниями и визуальных проектов. Модель принимает текст, изображения и файлы, поддерживает vision, reasoning, tool calling, поиск в интернете и структурированные ответы.
Qwen3.8 2.4T A95B от Alibaba - модель с открытыми весами и разреженной архитектурой MoE: 2,4 трлн параметров всего, 95 млрд активных. Подходит для программирования, исследований, сложного reasoning и агентных задач, поддерживает tool calling и структурированный вывод.
Nemotron 3.5 Lightning 30B A3B - модель NVIDIA архитектуры MoE для агентных задач в корпоративных сценариях. Поддерживает context до 262144 токенов, reasoning, tool calling, параллельные вызовы инструментов, структурированный вывод и prompt caching.
Muse Glimmer 30B - мультимодальная модель с открытыми весами от Meta Superintelligence Labs, дистиллированная из Muse Spark. Она принимает текст и изображения, поддерживает reasoning, tool calling и структурированные ответы; context - 131072 токена.
Grok Imagine Image 2.0 от xAI предназначена для создания изображений по текстовым запросам, редактирования изображений и задач визуального дизайна. Модель принимает текст и изображения и генерирует изображения.
Seedance 2.5 от ByteDance - модель для создания и редактирования видео, а также работы с движением по текстовым подсказкам. На вход можно подавать аудио, изображения, текст и видео, а на выходе получать видео.
Solar Pro 4 - флагманская модель Upstage, предназначенная для агентных сценариев. Поддерживает reasoning, tool calling, параллельные вызовы инструментов, структурированный вывод и prompt caching, работает с текстом на входе и выходе.
GPT Transcribe - модель OpenAI для преобразования речи в текст. Она подходит для расшифровки записей, потоковой обработки аудиофайлов и завершённых Realtime-сессий; поддерживает контекст в свободной форме и подсказки с ключевыми словами.
Muse Spark 1.2 от Meta - модель общего назначения с акцентом на программирование. Она помогает генерировать код, разбирать сложные ошибки, понимать кодовые базы и выполнять рабочие процессы разработчика от начала до конца. Поддерживает reasoning, tool calling, текст, изображения, видео и файлы.
Muse Spark 1.2 Contributor от Meta ориентирована на программирование: модель помогает генерировать код, разбираться со сложной отладкой и понимать кодовую базу. Поддерживает reasoning, tool calling, структурированные ответы и обработку текста, файлов, изображений и видео.
Qwen Image 3 - модель Qwen для генерации и редактирования изображений по тексту и изображениям. Она поддерживает точное отображение текста и мелких деталей размером от 10 пикселей, а также обработку изображений.
Qwen Image 3 Pro - модель Qwen для генерации и редактирования изображений по тексту и входным изображениям. Она точно передаёт текст и мелкие детали размером до 10 px и использует расширенные знания о мире.
Flux 3 - модель Black Forest Labs для генерации видео по текстовым запросам, редактирования и визуального дизайна. Принимает текст, изображения и видео, а на выходе создаёт видео; поддерживает работу с визуальной информацией.
Qwen3.8 Max - модель Alibaba с архитектурой MoE и 2,4 трлн параметров. Поддерживает reasoning и tool calling, работает с текстом, изображениями и видео, генерирует текст и имеет context до 1 млн токенов.
Sakana Namazu - reasoning-модель Sakana AI на базе Kimi K2.6, настроенная для работы с японским языком, культурой и деловыми процессами. Принимает текст, изображения и файлы, поддерживает vision, web search, tool calling, prompt caching и структурированные ответы.
Grok Voice TTS 1.0 от xAI преобразует текст в речь за один вызов API. Модель поддерживает выразительные голоса, теги для настройки подачи речи и форматы вывода от MP3 высокого качества до μ-law для телефонии.
command-r - текстовая модель общего назначения с большим контекстом. Поддерживает structured outputs для формирования структурированных ответов и tool calling для работы с инструментами.
Command-r-plus - модель для работы с текстом, поддерживающая контекст до 128000 токенов. Она принимает текстовые запросы и генерирует текстовые ответы, а также умеет обрабатывать структурированные выходные данные и tool calling. Это универсальное решение для задач, требующих длинного контекста и интеграции с внешними инструментами.
command-r7b - языковая модель общего назначения для работы с текстом. Поддерживает длинный context и structured outputs, позволяя формировать ответы в заданной структуре.
flux-1-kontext-max - модель для работы с изображениями: принимает текст и изображение, поддерживает редактирование и анализ визуального содержимого. На выходе создает изображение.
flux-1-kontext-pro - модель для работы с изображениями, принимает на вход картинку и текст, возвращает обработанное изображение. Поддерживает редактирование изображений (image edit) и распознавание визуальной информации (vision), что позволяет изменять и анализировать визуальный контент по текстовым инструкциям.
flux-1-krea-dev - модель для генерации изображений по текстовому описанию. Принимает текстовый запрос и создает изображение, поэтому подходит для задач text-to-image.
flux-1.1-pro - модель для генерации изображений по текстовому запросу. На вход подается текст, а на выходе модель создает изображение, поэтому взаимодействие с ней строится вокруг описания желаемого визуального результата.
flux-1.1-pro-ultra - модель для генерации изображений по текстовому описанию. Принимает текстовый запрос и создаёт изображение в качестве результата.
grok-4.20-beta - универсальная модель с context до 2 млн токенов, принимает текст и изображения, а отвечает текстом. Поддерживает reasoning, tool calling и параллельный вызов инструментов; prompt caching помогает повторно использовать части запросов.
hunyuan-image-3 - модель для генерации изображений по текстовому описанию. Принимает текст на входе и возвращает изображение; относится к категории image и поддерживает image_output.
Inkling Small от Thinking Machines - мультимодальная MoE-модель для reasoning с 276 млрд параметров, из которых активны 12 млрд. Принимает текст, изображения и аудио, генерирует текст; context - 524288 токенов, доступны prompt caching и tool calling.
seedream-4 - модель для генерации и редактирования изображений по тексту и изображениям. Поддерживает работу с визуальным вводом и создание изображений на выходе.
z-image-turbo - модель для генерации и редактирования изображений по тексту и входным изображениям. Поддерживает vision, принимает текст и изображения, а результатом работы становится изображение. Контекст - 2000 токенов.
Aleph 2.0 от Runway - это модель для редактирования видео in-context, которая применяет текстовые инструкции и правки по ключевым кадрам к существующему материалу. Она сохраняет детали, которые не должны меняться, принимая на вход изображения, текст и видео, а на выходе выдает видео.
Gen-4.5 от Runway - модель для генерации видео по текстовому описанию или изображению. Она предназначена для создания кинематографичных сцен с качественной передачей движения и визуальных деталей, а также точным следованием запросу.
H3 от MiniMax - легковесная модель генерации видео с открытыми весами, принимающая аудио, изображения, текст и видео. Она поддерживает мультимодальное редактирование по инструкциям, управляемую генерацию, а также отображение текста и брендов в видео.
S2.1 Pro от Fish Audio преобразует текст в аудио и подходит для генерации речи с управляемым голосом, озвучки повествования и настройки подачи. Модель принимает текст и выдает аудио.
voyage-multimodal-3.5 - мультимодальная embedding-модель от VoyageAI by MongoDB, которая преобразует текст, изображения и видео в векторы, в том числе если эти форматы чередуются. Поддерживает ввод текста и изображений и функцию vision.
Claude Opus 5 от Anthropic - это мощная модель для программирования, работы с агентами и профессиональных задач. Модель поддерживает контекст до 1 миллиона токенов, принимает на вход файлы, изображения и текст, а также умеет выполнять параллельные tool calls, reasoning, prompt caching, vision, web search и выдавать структурированные ответы.
Grok STT 1.0 - модель SpaceXAI для преобразования аудио в текст, доступная через REST endpoint /v1/stt. Она поддерживает временные метки для отдельных слов, определение говорящих и обработку многоканального аудио.
Ling 3.0 Flash от inclusionAI - модель для быстрой помощи, извлечения данных и автоматизации повседневных задач. Поддерживает text-ввод и text-вывод, context до 262144 токенов, reasoning, tool calling с параллельными вызовами инструментов, logprobs и prompt caching.
MAI-Image-2.5 Pro от Microsoft AI создаёт фотореалистичные и художественные изображения по текстовым запросам с разными соотношениями сторон. Модель принимает текст и изображения, поддерживает редактирование изображений и имеет context 4096 токенов.
MAI-Voice-2-Flash - модель text-to-speech от Microsoft AI с низкой задержкой для голосовых агентов, ассистентов, контакт-центров и интерактивных приложений. Она преобразует текст в выразительную монофоническую речь с частотой 24 кГц, в том числе для озвучивания и задач доступности.
Qwen-Audio-3.0-TTS Flash - модель Alibaba для преобразования текста в речь. Она генерирует аудио по текстовому вводу и доступна через API DashScope Speech Synthesizer.
Qwen-Audio-3.0-TTS Plus - модель Alibaba для преобразования текста в речь через API DashScope Speech Synthesizer. Она принимает текст и генерирует аудио, обеспечивая более высокое качество синтеза речи.
Gemini 3.5 Flash Lite от Google - мультимодальная модель для reasoning и работы с инструментами. Принимает текст, аудио, файлы, изображения и видео, поддерживает web search, структурированные ответы и параллельные вызовы инструментов, а на выходе генерирует текст.
Gemini 3.6 Flash от Google предназначена для мультимодальных задач и сочетает reasoning с использованием инструментов. Принимает текст, изображения, аудио, видео и файлы, поддерживает параллельные вызовы инструментов, кэширование prompt и поиск в интернете.
Laguna S 2.1 - модель Poolside для агентного программирования, рассчитанная на локальное развёртывание и относящаяся к классу XS. Поддерживает ввод и генерацию текста, reasoning, tool calling и context до 1 048 576 токенов.
Krea 2 Large - модель Krea для генерации изображений, более чем вдвое крупнее Krea 2 Medium. Облегчённая post-training обработка придаёт результатам более фактурный, свободный вид; модель также поддерживает редактирование изображений и работу с текстовыми и визуальными входными данными.
Krea 2 Medium - сбалансированная и экономичная модель Krea для генерации изображений, подходящая для широкого круга задач. Обучение после базового этапа помогает получать стабильные и последовательные результаты; модель принимает текст и изображения и поддерживает редактирование.
Krea 2 Medium Turbo - ускоренная версия Krea 2 Medium для быстрой генерации и проработки идей в графическом дизайне. Принимает текст и изображения на вход, поддерживает редактирование изображений и создание новых, а также vision.
Aura-2 - это многоязычная модель text-to-speech от Deepgram. Она использует каталог голосов Aura-2 для синтеза речи на нескольких языках, принимая на вход текст и выдавая аудио. Модель предназначена для генерации естественно звучащей речи.
Kimi K3 от Moonshot AI - мультимодальная модель с поддержкой текста, изображений и видео на входе и контекстом до 1 млн токенов. Подходит для длительных агентных задач, поддерживает reasoning с переключаемым уровнем усилий, tool calling, структурированный вывод и кэширование промптов.
Speech 2.8 HD от MiniMax преобразует текст в речь и генерирует аудио. Для озвучивания модель принимает произвольные voice ID MiniMax, что позволяет выбирать голос для конкретной задачи.
Speech 2.8 Turbo - модель MiniMax для преобразования текста в речь. Она генерирует аудио по текстовому вводу и поддерживает любые голосовые ID MiniMax.
Inkling от Thinking Machines - мультимодальная MoE-модель с reasoning для работы с текстом, изображениями и аудио. Общий размер модели - 975B параметров, активно задействуется 41B; context составляет 524288 токенов, доступны tool calling и prompt caching.
Nova-3 от Deepgram - универсальная модель для преобразования аудио в текст. Она поддерживает транскрибацию на одном языке и многоязычную транскрибацию, принимая аудио и выдавая текстовую расшифровку.
Qwen3.7 Flash - легковесная мультимодальная модель Alibaba для задач с текстом, изображениями и видео. Она генерирует текст, поддерживает reasoning, tool calling, параллельные вызовы инструментов, кэширование промптов и обработку визуального содержимого.
Seedream 5.0 Pro от ByteDance Seed - модель для генерации изображений по текстовым запросам, редактирования изображений и задач визуального дизайна. Принимает на вход текст и изображения, а результатом работы становятся изображения.
Seedream 5.0 Pro от ByteDance Seed создает изображения по текстовым запросам и редактирует загруженные изображения. Модель принимает на вход текст и изображения, поддерживая задачи визуального дизайна.
KAT-Coder-Pro V2.5 от Kwaipilot помогает разбирать код в репозиториях, выполнять рефакторинг и решать инженерные задачи с участием AI-агентов. Модель обрабатывает текст и поддерживает prompt caching, structured outputs и tool calling.
GPT-5.6 Luna - модель OpenAI для быстрых задач с большим потоком запросов. Принимает текст, изображения и файлы, поддерживает reasoning, параллельные tool calls, web search, prompt caching и структурированный вывод.
GPT-5.6 Sol от OpenAI помогает решать сложные профессиональные задачи, писать код и работать в agentic workflows. Принимает текст, изображения и файлы, поддерживает reasoning, vision, web search, tool calling, параллельные вызовы инструментов, кэширование промптов и структурированный вывод.
GPT-5.6 Terra - универсальная модель OpenAI для повседневных задач, рассчитанная на сочетание возможностей и экономичности. Обрабатывает текст, изображения и файлы, генерирует текст и поддерживает reasoning, tool calling, web search и структурированный вывод.
gpt-5.6-luna-pro - экономичная модель OpenAI для быстрых задач с большим объёмом запросов. Она принимает текст, изображения и файлы, генерирует текст и поддерживает reasoning, tool calling, поиск в интернете, структурированный вывод и кэширование запросов.
gpt-5.6-sol-pro от OpenAI подходит для сложной профессиональной работы, программирования и агентных процессов. Модель принимает текст, изображения и файлы, поддерживает reasoning, tool calling, поиск в интернете и структурированный вывод.
gpt-5.6-terra-pro - универсальная модель OpenAI для повседневных задач с reasoning. Принимает текст, изображения и файлы, поддерживает большой context, structured outputs, tool calling, web search и prompt caching, а на выходе генерирует текст.
Grok 4.5 от xAI предназначена для чата, написания кода и работы с агентными инструментами. Модель принимает текст, изображения и файлы, поддерживает reasoning, tool calling, web search и структурированный вывод.
Aion-3.0 от AionLabs - модель из семейства GLM для ролевых игр и сторителлинга. Она улучшает структуру сюжета, напряжение и конфликты, поддерживая нюансированные взрослые темы. Контекст - 131072 токена, есть prompt caching, обязательный reasoning и tool calling.
Aion-3.0-Mini - модель от AionLabs для генерации текста, ориентированная на ролевые игры и повествование. Она поддерживает расширенный контекст и работает с текстовыми входами и выходами. Модель отличается улучшенной структурой сюжета, напряжением и конфликтами, а также поддерживает обязательный reasoning, tool calling и кэширование промптов.
Hy3 - reasoning-модель Tencent для программирования, выполнения инструкций и агентных задач. Поддерживает text-ввод и text-вывод, context до 262144 токенов, tool calling с параллельными вызовами, prompt caching и структурированные ответы.
Laguna XS 2.1 - модель Poolside для агентного программирования, предназначенная для локального развёртывания. Поддерживает reasoning и tool calling, работает с текстом и имеет большой context.
Claude Sonnet 5 от Anthropic - это агентная модель для повседневных задач: написания кода, планирования, работы в браузере и общей деятельности. Поддерживает контекст до 800 тысяч токенов, принимает на вход файлы, изображения и текст, а также включает возможности reasoning, tool calling, vision, web search и параллельных вызовов инструментов.
LongCat-2.0 - reasoning-модель от Meituan для работы с текстом. Поддерживает tool calling и context примерно на 1 млн токенов, а также prompt caching для повторного использования данных в запросах.
Nano Banana 2 Lite от Google - модель для генерации и редактирования изображений с высокой скоростью и экономным использованием ресурсов. Поддерживает входные изображения, файлы и текст, выдаёт изображения и текст, имеет context 65536 токенов и поддерживает reasoning, tool calling и web search.
HappyHorse 1.0 - модель Alibaba для генерации коротких видео. Она создает ролики по текстовому запросу, одному начальному изображению или набору референсных изображений.
HappyHorse 1.1 - модель Alibaba для генерации коротких видео по текстовому запросу, одному стартовому изображению или набору изображений-референсов. Принимает на вход текст и изображения, а результатом становится видео.
Seed 2.1 Turbo - модель ByteDance Seed для мультимодального reasoning и агентских задач, чувствительных к задержке. Принимает текст, изображения и видео, поддерживает context до 262144 токенов, tool calling, параллельные вызовы инструментов и структурированный вывод.
Seedance 2.0 Mini от ByteDance - модель для создания и редактирования видео по текстовым инструкциям, а также работы с движением. Принимает на вход текст, изображения, аудио и видео, а результатом становится видео.
Fugu Ultra от Sakana AI предназначена для сложных исследований, аналитики и соревнований, с акцентом на качество. Принимает текст и изображения, поддерживает reasoning, tool calling, поиск в интернете и структурированный вывод; context - миллион токенов.
GLM-5.2 от Zhipu AI - открытая флагманская модель для coding agents с длительными задачами и работы с большим context. Поддерживает reasoning, tool calling, параллельные вызовы инструментов, structured outputs, logprobs и prompt caching; работает с текстом.
Kimi K2.7 Code от Moonshot AI - модель для задач программирования, ориентированная на продолжительную работу с репозиториями. Поддерживает reasoning, tool calling и анализ изображений; принимает текст и изображения, выдает текст и обрабатывает context до 262144 токенов.
Claude Fable 5 от Anthropic подходит для творческого письма, анализа и управляемых рабочих процессов с агентами. Модель принимает текст, изображения и файлы, поддерживает reasoning, tool calling, parallel tool calls, web search и structured outputs.
Nemotron 3 Ultra 550B A55B - крупнейшая модель семейства Nemotron 3 с открытыми весами, ориентированная на reasoning и точность работы агентов. Принимает и генерирует текст, поддерживает reasoning, tool calling, параллельные вызовы инструментов, prompt caching и структурированный вывод.
Nemotron 3.5 Content Safety от Nvidia - модель для проверки соответствия политикам, модерации контента и маршрутизации с учетом рисков. Принимает текст и изображения, формирует текстовый ответ, поддерживает reasoning и обрабатывает контекст до 131072 токенов.
Riverflow V2.5 Fast от Sourceful - вариант семейства Riverflow 2.5, ориентированный на скорость. Модель принимает текст и изображения, генерирует и редактирует изображения, а также поддерживает reasoning.
Riverflow V2.5 Pro - модель Sourceful для генерации и редактирования изображений по тексту и изображениям. Поддерживает vision и обязательный reasoning, а context составляет 32 768 токенов.
MAI-Image-2.5 от Microsoft AI генерирует фотореалистичные и художественные изображения по текстовым запросам, поддерживая разные соотношения сторон. Модель доступна через Azure AI Foundry, принимает текст и изображения, а также поддерживает редактирование изображений и vision.
MAI-Voice-2 - модель Microsoft AI для выразительного преобразования текста в речь. Поддерживает 15 языков и подходит для голосовых помощников, озвучивания материалов, задач доступности, обучения и других приложений с длинными аудиоформатами.
Qwen3.7 Plus - мультимодальная модель Alibaba для работы с текстом и изображениями, поддерживающая context до 1 млн токенов. Подходит для агентных сценариев и задач программирования, умеет reasoning, tool calling, параллельные вызовы инструментов и структурированный вывод.
MAI-Transcribe 1.5 - мультиязычная модель Microsoft AI для преобразования речи в текст на 43 языках. Подходит для создания субтитров, расшифровки звонков, обеспечения доступности и других приложений с голосовым вводом.
MiniMax-M3 - мультимодальная модель для работы с кодом, анализа изображений и видео, а также планирования действий агентов. Поддерживает длинный context, reasoning и tool calling, включая параллельные вызовы инструментов.
Grok Imagine Video 1.5 от xAI принимает изображения и текст, чтобы создавать видео в сценариях image-to-video. Модель подходит для редактирования и расширения видео, поддерживает vision и logprobs.
Step 3.7 Flash - модель StepFun для быстрых агентных задач, программирования и мультимодальных запросов. Поддерживает text, image и video на входе, context до 262144 токенов, reasoning, tool calling, структурированный вывод и кэширование промптов.
Wan2.7 Image - модель для создания изображений по текстовым запросам и редактирования загруженных изображений. Поддерживает визуальные задачи, связанные с дизайном, принимает на вход текст и изображения и выдаёт результат в виде изображения.
Claude Opus 4.8 от Anthropic предназначена для сложных задач reasoning, программирования и длительных агентных сценариев. Модель принимает текст, изображения и файлы, поддерживает tool calling, параллельные вызовы инструментов, web search и context на 120 тысяч токенов.
Nano Banana 2 от Google создаёт изображения по текстовым запросам, помогает редактировать визуальный контент и работать над дизайном. Модель принимает текст, изображения и файлы, поддерживает vision, reasoning и tool calling, а результат может включать изображение и текст.
Nano Banana Pro от Google предназначена для создания изображений с высокой точностью и редактирования, где важен дизайн. Модель принимает текст, изображения, аудио и файлы, а на выходе может создавать изображения и текст.
Parakeet TDT 0.6B v3 - мультиязычная модель NVIDIA для преобразования аудио в текст на архитектуре FastConformer-TDT. Она содержит 600 млн параметров, обучена на наборе Granary с более чем 670 000 часов аудио и поддерживает автоматическое определение языка.
Qwen3.7 Max - модель Alibaba для агентных систем, помощников по программированию и длительных задач. Поддерживает text-ввод и text-вывод, context до 1 млн токенов, reasoning, tool calling, параллельные вызовы инструментов, структурированные ответы и prompt caching.
Gemini 3.5 Flash от Google - быстрая мультимодальная модель, принимающая текст, аудио, файлы, изображения и видео. Поддерживает reasoning, tool calling, web search, structured outputs и параллельные вызовы инструментов.
Voxtral Mini Transcribe - модель Mistral для преобразования речи в текст, разработанная на основе семейства Voxtral Mini. Принимает аудио на вход и возвращает расшифровку через стандартный API транскрибации.
Recraft V4.1 - модель для генерации изображений по текстовым запросам и редактирования визуального контента. Она принимает текст и изображения, поддерживает задачи визуального дизайна и создает изображения.
Recraft V4.1 Pro - модель для генерации изображений по текстовым запросам, редактирования визуальных материалов и работы с графическим дизайном. Принимает текст и изображения, поддерживает анализ визуального содержимого и возвращает изображение.
Recraft V4.1 Utility - модель для генерации изображений по текстовым запросам, редактирования изображений и задач визуального дизайна. Принимает текст и изображения, поддерживает анализ визуального содержимого и выдаёт изображения; context составляет 65536 токенов.
Recraft V4.1 Utility Pro - модель для генерации и редактирования изображений по текстовым запросам, а также для задач визуального дизайна. Принимает текст и изображения, результат работы - изображение.
Recraft V4 Pro Vector - версия Recraft V4 Pro для создания векторных изображений в формате SVG. Модель принимает текст и изображения, генерирует изображения с разными соотношениями сторон и поддерживает редактирование изображений.
Recraft V4 Vector - векторная (SVG) версия Recraft V4 для создания изображений. Принимает текст и изображения, формирует векторный результат с разными соотношениями сторон; поддерживает редактирование изображений и обработку визуального ввода.
Recraft V4.1 Pro Vector - версия Recraft V4.1 Pro для создания векторной графики в формате SVG с акцентом на эстетику и высоким разрешением. Принимает текст и изображения, а также поддерживает редактирование изображений.
Recraft V4.1 Vector - векторный вариант Recraft V4.1, предназначенный для создания изображений в формате SVG с акцентом на эстетику. Модель принимает текст и изображения и генерирует SVG в нескольких соотношениях сторон.
Perceptron Mk1 - мультимодальная модель для reasoning, визуального анализа, планирования и работы с инструментами. Принимает текст, изображения и видео, генерирует текст и поддерживает структурированные ответы; context - 32768 токенов.
Gemini 3.1 Flash Lite - модель Google с низкой задержкой для мультимодальных и агентных задач с высокой нагрузкой. Принимает текст, изображения, аудио, видео и файлы, поддерживает reasoning, tool calling, web search и структурированные ответы.
Chirp 3 - это многоязычная модель от Google для распознавания речи, преобразующая аудио в текст. Она обеспечивает высокую точность транскрипции для 24 официально поддерживаемых языков и более 77 языков в режиме предпросмотра. Модель поддерживает автоматическое определение языка и расстановку пунктуации, принимая на вход только аудио.
Veo 3.1 от Google создает видео по текстовым запросам и изображениям. Модель также поддерживает редактирование видео и работу с движением, принимая на вход текст или изображение и выдавая видео.
Veo 3.1 Fast от Google создает видео по текстовым запросам и изображениям. Модель поддерживает редактирование видео и сценарии работы с движением, а также обрабатывает визуальные входные данные.
Veo 3.1 Lite - видеомодель Google для создания видео по текстовым запросам и изображениям. Модель поддерживает редактирование видео и работу с движением, принимает текст и изображения на входе и генерирует видео.
Mistral Medium 3.5 - мультиязычная модель для диалогов, reasoning и рабочих процессов с tool calling. Поддерживает ввод текста, изображений и файлов, structured outputs и vision; размер context - 262144 токена.
Video v3.0 Pro - премиальная модель Kling от Kuaishou для генерации видео по тексту и изображениям. Она поддерживает text-to-video и image-to-video, а также управление первым и последним кадрами; визуальное качество выше, чем у уровня Standard.
Video v3.0 Standard - модель Kling для генерации видео по тексту или изображению. Поддерживает задание первого и последнего кадров, чтобы направлять композицию сцены.
Qwen3.6 Flash - мультимодальная модель Alibaba для работы с текстом, изображениями и видео. Подходит для визуального reasoning, обработки документов и агентных задач, поддерживает tool calling и структурированные ответы.
DeepSeek V4 Flash - модель DeepSeek для reasoning, программирования и работы с длинным context. Принимает текст и поддерживает tool calling, параллельные вызовы инструментов, prompt caching и структурированный вывод.
DeepSeek V4 Pro - открытая MoE-модель для программирования и длительных агентных задач. Поддерживает reasoning, tool calling и параллельные вызовы инструментов, а также структурированный вывод, prompt caching и logprobs. Работает с текстом.
CSM 1B от Sesame - это conversational speech модель, которая принимает текст и генерирует английскую речь. Модель поддерживает различные голоса, включая разговорный и чтецкий стили. С 1B параметров она обеспечивает качественный audio output, работая с context до 4096 токенов.
GPT-5.5 от OpenAI - универсальная модель для программирования, работы с компьютером, исследований и интеллектуальных задач. Принимает текст, изображения и файлы, поддерживает reasoning, vision, web search, tool calling и структурированный вывод.
GPT-5.5 Pro - модель OpenAI для задач, где важны точность, reasoning и программирование. Она принимает текст, изображения и файлы, поддерживает web search, tool calling и structured outputs.
Kokoro 82M - лёгкая модель с открытыми весами от hexgrad для синтеза речи по тексту. Поддерживает 8 языков: американский и британский английский, испанский, французский, хинди, итальянский, японский, португальский и китайский.
Orpheus 3B от Canopy Labs - англоязычная text-to-speech модель, дообученная для естественной интонации и выразительной речи. Поддерживает 7 готовых голосов и подходит для озвучивания текстов, голосовых помощников и других задач генерации аудио.
Gemini Embedding 2 от Google - мультимодальная embedding-модель, которая преобразует текст, изображения, видео, аудио и PDF в единое embedding-пространство. Поддерживает входные данные разных типов и context до 8192 токенов, а на выходе формирует embeddings.
MiMo-V2.5 - открытая мультимодальная модель Xiaomi для coding-агентов и автоматизации с длинным context. Принимает текст, изображения, аудио и видео, поддерживает reasoning, tool calling, параллельные вызовы инструментов и структурированный вывод.
MiMo-V2.5-Pro от Xiaomi - модель общего назначения для мультимодального reasoning и выполнения задач coding-агентами. Поддерживает работу с текстом, structured outputs, параллельные tool calls, prompt caching и logprobs.
Qwen3.6 27B от Alibaba работает с текстом, изображениями и видео, включая задачи визуального reasoning, работу с документами и агентные сценарии. Поддерживает tool calling, параллельные вызовы инструментов и структурированный вывод.
GPT-5.4 Image 2 - модель OpenAI для создания изображений по текстовым запросам, редактирования и задач визуального дизайна. Принимает текст, изображения и файлы, а на выходе формирует изображения и текст; поддерживает reasoning и web search.
GPT-Image-2 от OpenAI предназначена для генерации изображений по текстовым запросам, редактирования изображений и задач визуального дизайна. На вход принимает текст и изображения, на выходе создает изображения.
Kimi K2.6 от Moonshot AI - мультимодальная модель для агентных циклов, задач программирования и работы с визуальным контекстом. Принимает изображения и текст, генерирует текст и поддерживает context до 262144 токенов, reasoning, tool calling и структурированный вывод.
Hailuo 2.3 - модель MiniMax для генерации видео по текстовым запросам и референсным изображениям. Поддерживает сценарии text-to-video и image-to-video: на вход принимает текст и изображения, а на выходе создает видео.
Qwen3.6 Max Preview - флагманская модель Alibaba для сложных задач reasoning, программирования и агентных сценариев. Поддерживает обработку текста, prompt caching, logprobs, структурированный вывод и tool calling.
Video O1 от Kling - модель Kuaishou для генерации видео по тексту или изображению. Поддерживает сценарии text-to-video и image-to-video, принимая текстовые и визуальные входные данные и создавая видео.
Grok 4.3 от xAI подходит для общения, программирования и задач с агентными инструментами. Модель принимает текст, изображения и файлы, отвечает текстом и поддерживает reasoning, tool calling и поиск в интернете.
Qwen3.6 35B-A3B - мультимодальная MoE-модель Alibaba для локальных агентов, принимающая текст, изображения и видео и генерирующая текст. Контекст - 262144 токена; доступны reasoning, tool calling, параллельные вызовы инструментов, структурированный вывод, logprobs и prompt caching.
Claude Opus 4.7 от Anthropic предназначена для сложной разработки ПО и задач reasoning с высокими требованиями. Модель принимает текст, изображения и файлы, поддерживает web search, tool calling, prompt caching и structured outputs.
Grok Build 0.1 от xAI предназначена для программирования и агентной работы с последовательными правками. Модель принимает текст, изображения и файлы, поддерживает reasoning, tool calling, поиск в интернете и structured outputs.
Gemini 3.1 Flash TTS Preview от Google генерирует речь по тексту с низкой задержкой. Поддерживает настраиваемые промпты и аудиотеги для управления выразительностью звучания; context модели - 32768 токенов.
Wan 2.7 - модель генерации видео от Alibaba, принимающая текст и изображения. Она поддерживает text-to-video, создание видео по изображению с контролем первого и последнего кадра, а также reference-to-video с несколькими изображениями для задания стиля и содержания.
Seedance 2.0 от ByteDance - модель для генерации и редактирования видео по инструкциям, а также работы с движением. Принимает текст, изображения, аудио и видео, поддерживает vision и создаёт видео на выходе.
Seedance 2.0 Fast от ByteDance создает видео по текстовым запросам и поддерживает редактирование и работу с движением. На вход можно подавать текст, изображения, аудио и видео, результатом становится видео.
Muse Spark 1.1 от Meta - мультимодальная модель для reasoning, которая обрабатывает текст, изображения, видео и файлы. Поддерживает tool calling, визуальную цепочку рассуждений, координацию нескольких агентов, web search и структурированный вывод.
GLM-5.1 от Zhipu AI предназначена для программирования, работы с терминалами и создания репозиториев. Модель поддерживает reasoning, tool calling, параллельные вызовы инструментов и структурированный вывод текста.
Grok Imagine Image Quality от xAI создает изображения по текстовым запросам и подходит для визуального дизайна. Модель также редактирует изображения, принимает на вход текст и изображения, поддерживает context объемом 65536 токенов.
Gemma 4 26B A4B IT - открытая instruction-модель Google для чата и самостоятельного развёртывания. Принимает текст, изображения и видео, поддерживает reasoning и tool calling, а также выдаёт структурированный текст и позволяет получать logprobs.
Gemma 4 31B IT - инструкция-модель Google для чатов и reasoning с возможностью самостоятельного размещения. Поддерживает обработку текста, изображений и видео, context до 262144 токенов, tool calling, структурированные ответы и prompt caching.
Qwen3.6 Plus от Alibaba - мультимодальная модель для работы с текстом, изображениями и видео. Поддерживает context до 1 млн токенов, reasoning, tool calling, параллельные вызовы инструментов, структурированный вывод и кеширование prompt.
GLM-5V-Turbo от Zhipu AI - быстрая vision-модель для анализа изображений, скриншотов, документов и видео. Поддерживает reasoning и tool calling для мультимодальных агентных задач, принимает текст, изображения и видео, обрабатывает context до 202752 токенов.
Trinity Large Thinking - агентная MoE-модель от Arcee AI с extended thinking для длительных задач и многошаговой работы с инструментами. Поддерживает reasoning, tool calling, prompt caching, текстовый ввод и вывод.
Grok 4.20 от xAI предназначена для reasoning, написания кода и помощи в реальном времени. Модель принимает текст, изображения и файлы, поддерживает большой context, web search и параллельный tool calling.
Grok 4.20 Multi-Agent от SpaceXAI предназначена для reasoning, написания кода, использования инструментов и помощи в реальном времени. Поддерживает ввод текста, изображений и файлов, web search и context до 2 млн токенов; результат выдаёт в текстовом формате.
Wan 2.6 - модель Alibaba для генерации видео, объединяющая более 10 визуальных возможностей. Создаёт видео в разрешении 1080p и с частотой 24 кадра в секунду по тексту, изображениям, референсным видео и аудио.
Seedance 1.5 Pro - модель ByteDance для генерации видео и аудио по тексту и изображениям. В основе лежит Dual-Branch Diffusion Transformer с 4,5 млрд параметров; звук и видео создаются одновременно за один проход.
Reka Edge - мультимодальная модель для анализа текста, изображений, видео, документов и других медиа. Принимает текст, изображения и видео, а также поддерживает vision, tool calling, structured outputs и logprobs.
MiniMax-M2.7 - открытая флагманская модель MiniMax для coding agents, автоматизации офисных задач и работы в сложных средах. Поддерживает обработку текста, reasoning, tool calling и structured outputs.
GPT-5.4 mini от OpenAI подходит для задач с кодом, быстрого вызова инструментов и обработки большого потока запросов. Модель принимает текст, изображения и файлы, поддерживает reasoning, tool calling, поиск в интернете и структурированный вывод.
GPT-5.4 nano от OpenAI предназначена для простых задач маршрутизации, извлечения данных и массовой автоматизации. Принимает текст, изображения и файлы, поддерживает reasoning, tool calling, web search, параллельные вызовы инструментов и структурированные ответы.
GLM-5-Turbo от Zhipu AI - ускоренная версия GLM-5 для coding agents, которым важна низкая задержка. Модель принимает текст, поддерживает reasoning, параллельные вызовы инструментов и prompt caching; context - 202752 токена.
Nemotron 3 Super 120B A12B - модель Nvidia среднего уровня для совместной работы агентов и задач с интенсивным reasoning. Поддерживает обработку текста, структурированный вывод, logprobs и параллельный tool calling.
S2 Pro от Fish Audio - модель для генерации речи по тексту с настройкой голоса, озвучиванием повествования и управлением подачей. На вход подаётся текст, на выходе модель создаёт аудио.
GPT-5.4 от OpenAI подходит для coding и агентных сценариев с управлением компьютером при меньшей стоимости. Модель принимает текст, изображения и файлы, поддерживает reasoning, tool calling, web search, параллельные вызовы инструментов и структурированный вывод.
GPT-5.4 Pro от OpenAI рассчитана на сложные профессиональные задачи с reasoning и работу агентов. Принимает текст, изображения и файлы, поддерживает web search, tool calling, параллельные вызовы инструментов и структурированный вывод; context - 1050000 токенов.
Transcribe-1 - модель Fish Audio для распознавания речи и преобразования аудио в текст. Подходит для подготовки транскрипций и субтитров; принимает аудио и возвращает текстовую расшифровку.
Voxtral Mini TTS (latest) от Mistral - мультиязычная модель, которая преобразует текст в аудио и поддерживает клонирование голоса zero-shot. На вход подаётся текст, размер context составляет до 4096 токенов.
Embed v1 0.6b - embedding-модель Perplexity для работы с текстом и создания embeddings. Её можно использовать в системах семантического поиска, извлечения информации, кластеризации и ранжирования.
Embed v1 4b - embedding-модель Perplexity для семантического поиска, извлечения информации, кластеризации и ранжирования. Принимает текст и возвращает embeddings.
Mercury 2 - reasoning-модель Inception для анализа, многоэтапного решения задач и работы с инструментами. Принимает текст и генерирует текст, поддерживает prompt caching и структурированные ответы.
Aion-2.0 от AionLabs - это reasoning-модель для продуманного анализа, многошагового решения задач и использования инструментов. Поддерживает расширенный context, принимает и возвращает текст, а также включает обязательный reasoning, prompt caching и tool calling.
Qwen3.5 122B-A10B - vision-language модель Alibaba для анализа изображений, видео и документов, а также задач с агентами. Поддерживает reasoning, tool calling и структурированный вывод; принимает текст, изображения и видео, а context составляет 262144 токена.
Qwen3.5 27B от Alibaba - мультимодальная модель для анализа изображений, видео и документов, а также агентских задач. Поддерживает reasoning, tool calling и структурированный вывод; context составляет 262144 токена.
Qwen3.5 35B-A3B от Alibaba - мультимодальная модель для визуального reasoning, работы с документами и агентных задач. Принимает текст, изображения и видео, поддерживает context до 262144 токенов, tool calling, структурированный вывод и logprobs.
Qwen3.5 9B от Alibaba - модель для многоязычного общения, reasoning и работы с инструментами. Поддерживает ввод текста, изображений и видео, а также context до 262144 токенов; умеет выдавать структурированные ответы и выполнять параллельные tool calls.
Qwen3.5 Flash - мультимодальная модель Alibaba для работы с текстом, изображениями и видео. Она поддерживает visual reasoning, обработку документов, задачи для агентов, tool calling и структурированный вывод.
Gemini 3.1 Pro Preview от Google предназначена для задач, требующих reasoning, включая агентное написание кода и решение сложных проблем. Модель принимает текст, аудио, файлы, изображения и видео, поддерживает web search, структурированные ответы и tool calling.
Gemini 3.1 Pro Preview Custom Tools от Google помогает решать задачи программирования и мультимодального анализа с обязательным reasoning. Модель принимает текст, изображения, аудио, видео и файлы, поддерживает tool calling, web search и structured outputs.
Claude Sonnet 4.6 от Anthropic предназначена для coding agents, анализа и контроля затрат в production. Модель принимает текст, изображения и файлы, генерирует текст и поддерживает reasoning, tool calling, параллельные вызовы инструментов, prompt caching, structured outputs и web search.
Recraft V4 - модель для генерации изображений по текстовым запросам, редактирования и задач визуального дизайна. Принимает текст и изображения, поддерживает анализ визуального содержимого и выдаёт результат в виде изображения. Контекст - 65536 токенов.
Recraft V4 Pro - модель для генерации и редактирования изображений по текстовым запросам и для визуального дизайна. Принимает на вход текст и изображения, поддерживает анализ визуального ввода и создаёт изображения.
Qwen3.5 Plus - мультимодальная модель Alibaba для работы с текстом, изображениями и видео. Она поддерживает визуальный reasoning, анализ документов, агентские задачи, tool calling и структурированные ответы.
Qwen3.5 397B-A17B от Alibaba - открытая мультимодальная MoE-модель, которая принимает текст, изображения и видео, а выдаёт текст. Поддерживает reasoning, tool calling и структурированный вывод; предназначена для визуальных агентов и длительных технических задач.
Seed 2.0 Code - модель ByteDance Seed для мультимодальной разработки ПО и длительно работающих агентов. Поддерживает текст, изображения и видео на входе, context до 262144 токенов, reasoning, tool calling, параллельные вызовы инструментов, кэширование промптов и структурированные ответы.
Seed 2.0 Lite - экономичная модель ByteDance Seed для чат-сценариев, анализа и структурированной генерации. Принимает текст, изображения и видео, формирует текстовые ответы и поддерживает reasoning, structured outputs и tool calling.
Seed 2.0 Mini - лёгкая мультимодальная модель ByteDance Seed для задач с низкой задержкой и высокой нагрузкой. Поддерживает reasoning по тексту, изображениям и видео, context до 262144 токенов, tool calling, параллельные вызовы инструментов и структурированные ответы.
Seedream 5.0 Lite от ByteDance Seed - модель для генерации и редактирования изображений по текстовым запросам. Поддерживает загрузку изображений и помогает в задачах визуального дизайна, принимая на вход текст и изображения и создавая изображения на выходе.
GLM-5 от Zhipu AI - универсальная модель для программирования, анализа и инженерных задач с активным использованием инструментов. Поддерживает reasoning, tool calling, структурированный вывод и кэширование промптов; context - 202752 токена.
MiniMax-M2.5 - модель MiniMax для задач программирования, агентных сценариев, редактирования офисных документов и автоматизации. Поддерживает reasoning, tool calling, параллельные вызовы инструментов и структурированный вывод.
Qwen3 Max Thinking (retires Oct 9) - reasoning-модель Qwen для решения задач, работы с математикой и программирования. Принимает и генерирует текст, поддерживает tool calling, structured outputs, logprobs, параллельные вызовы инструментов и prompt caching.
Claude Opus 4.6 от Anthropic - это высококлассная модель для сложных задач программирования, планирования и медленных экспертных рассуждений. Модель поддерживает большой контекст, принимает на вход файлы, изображения и текст, а также обладает функциями reasoning, tool calling, vision, web search и параллельными вызовами инструментов.
GPT-5.3 Codex от OpenAI предназначена для редактирования и проверки репозиториев, а также агентных задач разработки. Модель поддерживает reasoning, tool calling, параллельные вызовы инструментов, работу с файлами и изображениями; доступный context составляет 380 тысяч токенов.
Qwen3 Coder Next от Alibaba - open-weight модель для задач программирования, работы с репозиториями и агентных сценариев. Поддерживает context до 262144 токенов, reasoning и tool calling, включая параллельные вызовы инструментов.
Riverflow V2 Fast от Sourceful - быстрая версия линейки Riverflow 2.0 для производственных задач и сценариев, где важна низкая задержка. Модель принимает текст и изображения, поддерживает vision и редактирование изображений, а результатом может быть изображение.
Riverflow V2 Pro - модель Sourceful для работы с изображениями, принимает текст и изображения и создает новые изображения. Поддерживает редактирование и анализ изображений; context составляет 8192 токена.
Step 3.5 Flash - модель StepFun для быстрого мультимодального reasoning и помощи с программированием. Поддерживает reasoning и tool calling, принимает и генерирует текст; размер context - 262144 токена.
Grok Imagine от SpaceXAI - модель для генерации видео по текстовому запросу и изображению. Поддерживает редактирование изображений и задачи визуального дизайна, принимает текст и изображения, а результат выдаёт в формате видео.
MiniMax-M2 Her - вариант MiniMax M2 для диалогов и агентных взаимодействий с акцентом на персонажей. Модель работает с текстом и поддерживает prompt caching.
GLM-4.7-Flash от Zhipu AI помогает с кодом, маршрутизацией запросов и повседневной автоматизацией. Модель работает с текстом, поддерживает reasoning, tool calling, параллельные вызовы инструментов и структурированные ответы.
GPT Audio от OpenAI генерирует речь с управляемым голосом и подачей, в том числе для озвучивания текста. Модель принимает аудио и текст, а возвращает аудио и текст; также поддерживает tool calling, структурированные выходы и logprobs.
GPT Audio Mini - модель OpenAI для генерации речи с настройкой голоса, озвучивания и подачи аудио. Она принимает текст и аудио, создаёт аудио и текст, а также поддерживает tool calling, logprobs и structured outputs.
FLUX.2 [klein] 9B - модель для создания и редактирования изображений по текстовым запросам. Она принимает текст и изображения, поддерживает визуальные задачи и подходит для работы с графическим дизайном.
voyage-4 - embedding-модель общего назначения от VoyageAI by MongoDB. Принимает текст и возвращает embeddings. Указанная область применения включает выполнение инструкций, написание и анализ.
voyage-4-large - embedding-модель VoyageAI by MongoDB для задач анализа и программирования, а также production-агентов. Принимает текст и преобразует его в embeddings; размер context составляет 32 тысячи токенов.
voyage-4-lite - embedding-модель от VoyageAI by MongoDB с текстовым вводом и векторным выводом. Рассчитана на обработку с низкой задержкой, извлечение информации, помощь в работе и автоматизацию рутинных задач.
FLUX.2 Klein 4B от Black Forest Labs - модель для создания изображений по текстовым запросам, редактирования и задач визуального дизайна. Принимает текст и изображения, а результатом становится новое изображение; context составляет 40960 токенов.
Kimi K2.5 от Moonshot AI - модель для работы с текстом и изображениями, ориентированная на длинный context, агентов и программирование. Поддерживает reasoning, vision, tool calling, параллельные вызовы инструментов и структурированный вывод; размер context - 262144 токена.
Solar Pro 3 от Upstage - модель для анализа, написания кода и агентных сценариев. Поддерживает reasoning, tool calling, параллельные вызовы инструментов, структурированный вывод и prompt caching; работает с текстом на входе и выходе.
MiniMax-M2.1 - более ранняя агентная модель MiniMax для практических задач программирования и повышения продуктивности. Поддерживает reasoning, tool calling, параллельные вызовы инструментов и кэширование промптов.
GLM-4.7 от Zhipu AI предназначена для программирования, reasoning и структурированных агентских задач. Модель принимает и генерирует текст, поддерживает параллельные tool calling, prompt caching и структурированный вывод.
Gemini 3 Flash Preview - быстрая мультимодальная модель Google с поддержкой reasoning и работы с инструментами. Принимает текст, аудио, изображения, видео и файлы, умеет выполнять параллельный tool calling, искать в интернете и формировать структурированные ответы.
FLUX.2 [max] от Black Forest Labs - модель для генерации изображений по текстовому запросу, редактирования изображений и задач визуального дизайна. Принимает текст и изображения, поддерживает vision и выдаёт изображения; context - 46864 токена.
Nemotron 3 Nano 30B A3B - компактная MoE-модель Nvidia для задач программирования, математики и работы агентных систем с длинным context. Поддерживает reasoning, tool calling, структурированный вывод, logprobs и кеширование промптов; принимает и генерирует текст.
GPT-5.2 от OpenAI подходит для задач программирования, написания текстов и работы с инструментами. Модель принимает текст, изображения и файлы, поддерживает reasoning, web search, параллельные вызовы инструментов и структурированный вывод.
GPT-5.2 Codex от OpenAI помогает редактировать код в репозиториях, проверять изменения и выполнять длительные задачи в роли программного агента. Модель принимает текст и изображения, поддерживает reasoning, tool calling, структурированные ответы и поиск в интернете.
GPT-5.2 Pro - вариант GPT-5.2 для сложных задач на reasoning и проверки материалов. Принимает текст, изображения и файлы, поддерживает vision, web search, обязательный reasoning, параллельные tool calls и структурированные ответы.
GPT-5.2 Chat - модель OpenAI для диалогов, помощи с письмом и задач с инструментами. Она принимает текст, изображения и файлы, поддерживает vision, web search, tool calling, структурированный вывод и prompt caching.
GLM-4.6V от Zhipu AI анализирует изображения, видео и документы, поддерживая visual reasoning и работу мультимодальных агентов. Модель принимает текст, изображения и видео, поддерживает tool calling, reasoning и prompt caching, а на выходе генерирует текст.
Relace Search - чат-модель для выполнения инструкций и агентных сценариев. Поддерживает tool calling, принимает текст на вход и генерирует текстовые ответы.
Seedream 4.5 от ByteDance Seed - модель для генерации изображений по текстовым запросам, редактирования и задач визуального дизайна. Принимает текст и изображения, анализирует визуальный контент и создает изображения; context составляет 4096 токенов.
Ministral 14B - компактная мультимодальная модель Mistral для локальных помощников и edge-агентов. Она принимает текст и изображения, генерирует текст и поддерживает prompt caching, structured outputs и tool calling.
Nova 2 Lite - мультимодальная модель Amazon для анализа изображений и видео, планирования и работы с инструментами. Она принимает текст, файлы, изображения и видео, поддерживает reasoning и tool calling и может обрабатывать контекст до миллиона токенов.
DeepSeek Chat - модель DeepSeek для выполнения инструкций, написания кода и анализа. Поддерживает reasoning, tool calling, параллельные вызовы инструментов и структурированный вывод; работает с текстом и имеет context на 163840 токенов.
DeepSeek V3.2 - текстовая модель с режимами thinking и non-thinking, разреженным механизмом внимания и поддержкой tool calling. Среди возможностей - reasoning, structured outputs, logprobs, параллельные вызовы инструментов и prompt caching.
FLUX.2 [flex] от Black Forest Labs создает изображения по текстовым запросам и редактирует входные изображения. Модель принимает текст и изображения и поддерживает рабочие процессы визуального дизайна.
FLUX.2 [pro] от Black Forest Labs создает изображения по текстовым запросам, поддерживает редактирование изображений и задачи визуального дизайна. На вход принимает текст и изображения, на выходе генерирует изображения.
GPT-Image-1.5 от OpenAI создает изображения по текстовым запросам и редактирует загруженные изображения. Модель принимает на вход текст и изображения, а также подходит для задач визуального дизайна.
Claude Opus 4.5 (latest) - модель Anthropic для reasoning, программирования и задач, где агенту нужно работать длительное время. Принимает текст, изображения и файлы, поддерживает web search, tool calling, параллельные вызовы инструментов и structured outputs.
all-MiniLM-L12-v2 - это embedding модель от Sentence Transformers, которая преобразует текст в 384-мерные векторы. Она поддерживает контекст до 512 токенов и предназначена для семантического поиска, кластеризации и других задач. Модель принимает на вход текст и выдает embeddings.
bge-base-en-v1.5 от BAAI - это embedding-модель, преобразующая английские тексты в 768-мерные векторы для семантического поиска и сопоставления документов. Версия v1.5 поддерживает контекст до 512 токенов, принимает текст и выдает embeddings, оптимизированные для retrieval-задач.
bge-large-en-v1.5 от BAAI - это embedding-модель, которая преобразует английские предложения, абзацы и документы в 1024-мерные плотные векторы. Она обеспечивает качественные семантические представления для поиска, извлечения документов и задач NLP. Модель принимает на вход текст и выдает embeddings, поддерживая контекст до 512 токенов.
E5-Base-v2 от Intfloat - это embedding-модель, которая преобразует английские предложения и абзацы в плотные векторы размерностью 768. Она создана для задач семантического поиска и оценки схожести текстов, обеспечивая качественные векторные представления. Модель принимает на вход текст и работает с context до 512 токенов.
GTE-Base от Thenlper преобразует английские предложения и абзацы в плотные векторы embedding размерностью 768. Модель подходит для поиска семантически близких текстов, семантического поиска и кластеризации; context составляет 512 токенов.
GTE-Large - embedding-модель Thenlper, которая преобразует английские предложения, абзацы и документы умеренной длины в плотные векторы размерностью 1024. Подходит для поиска информации, семантического сопоставления текстов и reranking; поддерживает context до 512 токенов.
Multilingual-E5-Large - embedding-модель Intfloat, которая кодирует предложения, абзацы и документы более чем на 90 языках в плотные векторы размерностью 1024. Модель предназначена для multilingual retrieval и сравнения текстов на разных языках, её context составляет 512 токенов.
paraphrase-MiniLM-L6-v2 - embedding-модель от Sentence Transformers, преобразующая предложения и короткие абзацы в плотные векторы размерностью 384. Подходит для выявления перефразирований, оценки семантического сходства, кластеризации и облегченного поиска; принимает текст с context до 512 токенов.
all-mpnet-base-v2 от Sentence Transformers - это embedding-модель, преобразующая предложения и короткие абзацы в 768-мерные векторы. Она подходит для поиска, кластеризации и оценки сходства текстов, поддерживая контекст до 512 токенов. На вход подается текст, на выходе - embeddings.
GPT-5.1 - модель OpenAI для программирования, продуктовых задач и работы с инструментами. Принимает текст, изображения и файлы, поддерживает reasoning, tool calling, поиск в интернете и структурированные ответы.
GPT-5.1 Codex от OpenAI предназначена для редактирования репозиториев, проверки кода и работы программных агентов. Модель принимает текст и изображения, поддерживает reasoning, tool calling, web search и структурированный вывод.
GPT-5.1 Codex Max - модель OpenAI для редактирования кода, проверки репозиториев и агентной разработки. Принимает текст и изображения, поддерживает reasoning, параллельные вызовы инструментов, поиск в интернете и структурированный вывод.
GPT-5.1 Codex mini от OpenAI оптимизирована для редактирования репозиториев, ревью кода и агентных задач разработки. Принимает текст и изображения, генерирует текст, поддерживает reasoning, tool calling, структурированные выходные данные и web search.
Kimi K2 Thinking от Moonshot AI предназначена для исследований, планирования и решения сложных технических задач. Модель работает с текстом, поддерживает reasoning, tool calling и структурированный вывод.
Nova Premier 1.0 - флагманская модель Amazon для сложного анализа, программирования и агентных задач в производственных сценариях. Принимает текст и изображения, отвечает текстом, поддерживает tool calling и prompt caching; размер context - 1000000 токенов.
Sonar Pro Search от Perplexity помогает проводить углублённые исследования и формировать синтез информации с цитированием источников. Модель принимает текст и изображения, выполняет web search, поддерживает reasoning и структурированный вывод.
GPT OSS Safeguard 20B от OpenAI - модель для проверки запросов на соответствие политикам, модерации и маршрутизации с учетом рисков. Поддерживает текстовый ввод и вывод, reasoning, structured outputs и tool calling; context - 131072 токена.
MiniMax-M2 - открытая модель MiniMax для coding agents и задач с активным использованием инструментов. Поддерживает текстовый ввод и вывод, reasoning, параллельные вызовы инструментов, структурированные ответы, logprobs и prompt caching.
Qwen/Qwen3-VL-32B-Instruct - vision-language модель для работы с изображениями и текстом. Подходит для visual reasoning, анализа документов и агентских задач; поддерживает tool calling, structured outputs и logprobs, размер context - 131072 токена.
Granite 4.0 Micro от IBM предназначена для низколатентной помощи, извлечения данных и автоматизации рутинных задач. Модель принимает и генерирует текст, а также поддерживает logprobs.
S1 от Fish Audio - модель для генерации речи по тексту. Она позволяет управлять голосом, подачей и стилем озвучивания; на вход принимает текст, а результатом становится аудио.
GPT-5 Image Mini от OpenAI помогает создавать изображения по текстовым запросам, редактировать визуальные материалы и решать задачи визуального дизайна. Модель принимает текст, изображения и файлы, а в ответ может предоставить изображение или текст.
Claude Haiku 4.5 (latest) от Anthropic - это быстрая модель для легких агентов, офисных задач и отзывчивого чата. Поддерживает context до 180000 токенов, принимает файлы, изображения и текст, а выдает только текст. Среди возможностей - параллельные tool calls, reasoning, structured outputs, vision и веб-поиск.
Seed 1.6 - модель ByteDance Seed для reasoning, выполнения инструкций и задач с использованием инструментов. Принимает текст, изображения и видео, генерирует текст и поддерживает structured outputs и tool calling.
GPT-5 Image от OpenAI создает изображения по текстовым запросам, редактирует изображения и поддерживает рабочие процессы визуального дизайна. Принимает текст, изображения и файлы, а на выходе предоставляет изображения и текст; доступны reasoning и web search.
Qwen3 VL 8B Thinking - vision-language модель Qwen для работы с изображениями и текстом. Поддерживает visual reasoning, анализ документов, agent tasks и tool calling, а также structured outputs и logprobs; context составляет 131072 токена, результат выводится в текстовом формате.
Qwen/Qwen3-VL-8B-Instruct - vision-language модель для задач с изображениями и текстом. Подходит для визуального reasoning, работы с документами и агентских сценариев, поддерживает tool calling и структурированный вывод. Context - 262144 токена.
Qwen3-VL-30B-A3B-Thinking - vision-language модель Qwen для работы с текстом и изображениями. Поддерживает reasoning, структурированный вывод и tool calling, подходит для анализа документов и агентских задач. Context - 262144 токена.
GPT-5 Pro от OpenAI предназначена для сложного анализа, проверки кода и планирования. Модель принимает текст, файлы и изображения, генерирует текст, поддерживает reasoning, структурированный вывод, tool calling, vision и web search.
Sora-2-Pro от OpenAI - модель для генерации и редактирования видео по текстовым запросам и изображениям. Поддерживает сценарии работы с движением, принимает текст и изображения, а результатом выдаёт видео.
Qwen3 VL 30B A3B Instruct - vision-language модель для visual reasoning, документов и agent-задач. Принимает изображения и текст, выдаёт текст, поддерживает tool calling и structured outputs.
GLM-4.6 - модель Zhipu AI для coding agents, reasoning и структурированных задач. Она принимает текст и поддерживает tool calling, параллельные вызовы инструментов, prompt caching и structured outputs.
Claude Sonnet 4.5 (latest) от Anthropic - сбалансированная модель для программирования, анализа и агентных сценариев с контролем затрат. Поддерживает расширенный контекст, принимает файлы, изображения и текст, а также включает функции reasoning, tool calling, vision, web search и структурированные выходные данные.
DeepSeek V3.2 Exp - чат-модель для выполнения инструкций, программирования и анализа. Поддерживает reasoning, tool calling, параллельные вызовы инструментов, структурированный вывод и prompt caching. Принимает текст и генерирует текст.
Cydonia 24B V4.1 - это открытая модель с весами для адаптивного чата и самостоятельного хостинга производственных задач. Поддерживает контекст до 131072 токенов, принимает текстовые входные данные и генерирует текст. Включает функции logprobs, prompt caching и structured outputs для гибкой настройки.
gpt-image-1-mini - модель OpenAI для генерации изображений по текстовым запросам, редактирования картинок и задач визуального дизайна. Принимает текст и изображения, а на выходе создает изображения.
Relace Apply 3 - универсальная чат-модель для выполнения инструкций, написания текстов и анализа. Принимает текстовый ввод и выдаёт текстовый ответ.
Qwen3 Max - флагманская модель Alibaba для coding agents, сложных задач reasoning и работы с инструментами. Принимает и генерирует текст, поддерживает context до 262 144 токенов, параллельный tool calling и структурированные ответы.
Qwen3 VL 235B A22B Instruct - vision-language модель Alibaba для работы с изображениями и текстом. Подходит для visual reasoning, анализа документов и agent tasks, поддерживает context до 262144 токенов, reasoning, tool calling и structured outputs.
Qwen3 VL 235B A22B Thinking - vision-language модель Alibaba для работы с изображениями и текстом. Поддерживает визуальный reasoning, обработку документов, агентские задачи и tool calling.
DeepSeek V3.1 Terminus - чат-модель DeepSeek для выполнения инструкций, программирования и анализа. Поддерживает reasoning, tool calling, структурированный вывод и prompt caching; принимает текст и формирует текстовые ответы.
Qwen3-ASR Flash - модель для распознавания речи, которая преобразует аудио в текст. Она принимает аудиозаписи и подходит для создания транскрипций и субтитров.
Qwen3-Next 80B-A3B (Thinking) - модель Alibaba для локального reasoning, математических задач и работы coding-агентов. Поддерживает tool calling, параллельные вызовы инструментов, структурированный вывод и обязательный reasoning.
Qwen3-Next 80B-A3B Instruct от Alibaba предназначена для многоязычного общения, reasoning и работы с инструментами. Поддерживает текстовый ввод и вывод, большой context, параллельный tool calling, structured outputs, prompt caching и logprobs.
Qwen3 30B A3B Thinking 2507 - текстовая reasoning-модель Qwen для решения задач, работы с математикой и программирования. Поддерживает обязательный reasoning и tool calling, принимает текстовый ввод и генерирует текст.
Seed 1.6 Flash - модель ByteDance Seed для быстрых диалогов, извлечения данных и простого tool calling. Принимает текст, изображения и видео, поддерживает reasoning и структурированные ответы, а на выходе генерирует текст.
Hermes 4 405B - модель общего назначения для reasoning, тщательного анализа и пошагового решения задач. Поддерживает работу с инструментами, принимает и генерирует текст.
Nano Banana от Google предназначена для быстрой генерации и редактирования изображений, а также создания материалов с сохранением согласованности персонажей. Модель принимает изображения и текст, выдаёт изображения и текст.
DeepSeek V3.1 - чат-модель от DeepSeek для выполнения инструкций, написания кода и анализа. Поддерживает контекст до 32768 токенов, принимает и возвращает текст. Включает reasoning, tool calling, параллельные вызовы инструментов, кэширование запросов и структурированные выходные данные.
Qwen Image Edit принимает изображение и текстовый запрос, чтобы создавать и редактировать визуальный контент по инструкции. Модель возвращает изображение и поддерживает сценарии визуального дизайна с использованием возможностей vision.
Mistral Medium 3.1 - модель Mistral для многоязычного общения, reasoning и рабочих процессов с инструментами. Принимает текст, изображения и файлы, поддерживает tool calling, структурированные ответы и prompt caching.
GLM-4.5V от Zhipu AI - vision-модель для работы с изображениями и текстом. Поддерживает visual reasoning, анализ документов, создание мультимодальных агентов и tool calling.
GPT-5 - универсальная модель OpenAI для reasoning, программирования, написания текстов и работы с инструментами. Принимает текст, изображения и файлы, поддерживает web search, параллельные tool calls и structured outputs, а результат выдаёт в текстовом формате.
GPT-5 Mini от OpenAI - компактная модель для отзывчивых агентов, помощи с программированием и повседневной автоматизации. Принимает текст, изображения и файлы, поддерживает reasoning, vision, web search и tool calling, а ответы формирует в текстовом виде.
GPT-5 Nano от OpenAI подходит для маршрутизации запросов, извлечения данных, классификации и массовой обработки. Модель принимает текст, изображения и файлы, поддерживает reasoning, tool calling, web search и структурированный вывод.
Qwen Image - модель для создания и редактирования изображений по текстовым запросам, а также для задач визуального дизайна. Принимает на вход текст и изображения, анализирует визуальный контент и выдает изображения.
Claude Opus 4.1 (latest) - флагманская модель Anthropic для reasoning, программирования и длительных агентских задач. Принимает текст, изображения и файлы, поддерживает tool calling, веб-поиск, параллельные вызовы инструментов и prompt caching.
GPT OSS 120B - открытая reasoning-модель OpenAI для самостоятельного развёртывания и создания агентов с настраиваемым управлением. Принимает текст и файлы, генерирует текст, поддерживает tool calling, параллельные вызовы инструментов и структурированный вывод.
GPT OSS 20B - открытая reasoning-модель OpenAI для запуска собственных агентов и развёртывания с настраиваемым управлением. Поддерживает context до 131072 токенов, обработку текста и файлов, tool calling, параллельные вызовы инструментов и структурированный вывод.
Qwen3 30B A3B Instruct 2507 от Alibaba подходит для многоязычного общения, reasoning и работы с инструментами через tool calling. Модель принимает и генерирует текст, поддерживает большой context, logprobs и структурированный вывод.
GLM-4.5 от Zhipu AI - универсальная модель с гибридным reasoning. Работает с текстом, поддерживает prompt caching и параллельный tool calling. Контекст - 131072 токена.
GLM-4.5-Air - облегчённая модель Zhipu AI для быстрой помощи с программированием и создания более экономичных агентов. Она работает с текстом и поддерживает reasoning и tool calling.
Qwen3 Coder Flash от Alibaba предназначена для программных агентов, редактирования репозиториев и reasoning по коду. Поддерживает текстовый ввод и вывод, tool calling, logprobs и prompt caching; размер context - миллион токенов.
Qwen3 235B A22B Thinking - модель для reasoning, работы с документами и агентных задач. Поддерживает обязательный reasoning и tool calling, включая параллельные вызовы инструментов, а также принимает текст и генерирует текст.
Qwen3 Coder - модель для программирования, работы программных агентов и редактирования репозиториев. Поддерживает reasoning и tool calling, принимает и генерирует текст, context составляет 262144 токена.
Qwen3 Coder Plus - модель Alibaba для задач программирования: она подходит для работы программных агентов и внесения изменений в репозитории. Поддерживает context до 1 млн токенов, reasoning, tool calling и параллельные вызовы инструментов.
UI-TARS 7B - мультимодальная модель ByteDance для анализа текста, изображений, документов и медиа. Принимает текст и изображения, а ответы формирует в текстовом виде; поддерживает vision, structured outputs, prompt caching и logprobs.
Voxtral Small 24B 2507 от Mistral - открытая chat-модель с поддержкой аудио для расшифровки речи и понимания звуковых данных. Принимает аудио, файлы и текст, поддерживает context до 32 768 токенов, tool calling и структурированный вывод для голосового управления инструментами.
Kimi K2 от MoonshotAI предназначена для диалогов с длинным context, программирования и агентного reasoning. Модель работает с текстом и поддерживает tool calling, параллельные вызовы инструментов и кэширование промптов.
Grok 4 - модель для reasoning, coding и помощи в реальном времени. Поддерживает использование инструментов в агентных сценариях, принимает текстовые запросы и генерирует текстовые ответы.
Uncensored от Venice - модель на базе Mistral для многоязычного чата, reasoning и tool calling. Поддерживает контекст до 128K токенов, принимает и генерирует только текст, что упрощает её интеграцию в текстовые рабочие процессы.
Hunyuan A13B Instruct - reasoning-модель Tencent для задач программирования, выполнения инструкций и работы в агентных сценариях. Принимает текст, формирует текстовые ответы и поддерживает структурированный вывод; размер context - 131072 токена.
Morph V3 Fast - текстовая модель Morph для быстрой помощи, извлечения информации и автоматизации повседневных задач. Поддерживает context до 81920 токенов, принимает текст на вход и генерирует текстовые ответы.
Morph V3 Large - флагманская текстовая модель Morph для сложного анализа, написания кода и агентных процессов в production-среде. Поддерживает context до 262144 токенов, logprobs и структурированный вывод.
ERNIE 4.5 VL 424B A47B от Baidu - мультимодальная модель для визуального анализа, планирования и tool use. Она поддерживает reasoning и vision, принимая изображения и текст, с context до 123000 токенов. Модель решает задачи, требующие совмещения визуальной информации с логическими рассуждениями.
Mistral Small 3.2 - эффективная модель для быстрого общения, извлечения данных и производственных ассистентов. Обрабатывает текст и изображения, поддерживает reasoning, vision, tool calling, параллельные вызовы инструментов, кэширование промптов и структурированный вывод.
Mistral Small 3.2 24B - модель Mistral для быстрых диалогов, извлечения информации и работы ассистентов. Принимает текст и изображения, генерирует текст, поддерживает tool calling, vision, logprobs и структурированный вывод.
Gemini 2.5 Flash от Google - мультимодальная модель для приложений, где важны скорость отклика и стоимость. Она принимает текст, изображения, аудио, видео и файлы, поддерживает reasoning, tool calling, веб-поиск и структурированные ответы.
Gemini 2.5 Flash-Lite от Google принимает текст, изображения, аудио, видео и файлы, а генерирует текст. Поддерживает reasoning, tool calling, параллельные вызовы инструментов, prompt caching, structured outputs и web search.
Gemini 2.5 Pro от Google предназначена для reasoning, программирования, математики и мультимодального анализа. Принимает аудио, файлы, изображения, текст и видео; поддерживает tool calling, web search и структурированный вывод текста.
MiniMax M1 - текстовая модель для общения, программирования, офисных и агентных задач. Поддерживает reasoning, tool calling и параллельные вызовы инструментов; context - 1000000 токенов.
o3-pro от OpenAI предназначена для сложных технических задач и подготовки тщательно обоснованных ответов. Модель принимает текст, изображения и файлы, поддерживает reasoning, web search, tool calling и структурированный вывод.
Qwen3 Embedding 8B - модель для преобразования текста в embeddings. Подходит для семантического поиска, извлечения информации, кластеризации и ранжирования; поддерживает context до 32768 токенов.
Codestral Embed - это модель для создания эмбеддингов (embedding), предназначенная для пайплайнов семантического поиска, извлечения информации, кластеризации и ранжирования. Модель принимает текстовые данные на вход и генерирует векторные представления, поддерживая контекст до 8192 токенов.
Claude Sonnet 4 от Anthropic - сбалансированная модель для программирования, анализа, агентных сценариев и контроля затрат. Поддерживает большой context, принимает файлы, изображения и текст, а также включает возможности reasoning, tool calling, параллельные вызовы инструментов, prompt caching, vision и веб-поиск.
Imagen-4 - модель для генерации изображений по текстовым запросам, редактирования и задач визуального дизайна. Она поддерживает рабочие процессы, в которых изображения создаются или изменяются на основе заданных инструкций.
Gemini Embedding - embedding-модель Google для преобразования текста в embeddings. Она подходит для семантического поиска, retrieval, кластеризации и ранжирования.
Mistral Medium 3 поддерживает многоязычное общение, reasoning и сценарии с tool calling. Модель принимает текст и изображения, генерирует текст, а также поддерживает параллельные вызовы инструментов и prompt caching.
Mistral Medium 3 - модель для многоязычного общения, reasoning и задач с tool calling. Принимает текст, изображения и файлы, поддерживает prompt caching и структурированный вывод, а генерирует текст.
Llama Guard 4 12B - модель Meta для проверки контента на соответствие политикам, модерации и маршрутизации с учетом рисков. Принимает текст и изображения, формирует текстовые ответы и поддерживает reasoning и tool calling.
Palmyra X5 - текстовая модель для анализа и решения задач, требующих нескольких последовательных шагов. Поддерживает tool use и работает с контекстом до 1040000 токенов.
Qwen3 14B - языковая модель Qwen для многоязычного общения, reasoning и работы с инструментами. Принимает и генерирует текст, поддерживает context до 40960 токенов, параллельные вызовы инструментов, структурированный вывод и logprobs.
Qwen3 30B A3B - языковая модель Alibaba на архитектуре MoE с 3 млрд активных параметров. Подходит для диалогов и reasoning, поддерживает tool calling, параллельные вызовы инструментов и структурированный вывод; принимает и генерирует текст, context - 40960 токенов.
GPT-Image-1 от OpenAI создает изображения по текстовым запросам и редактирует загруженные изображения. Модель поддерживает визуальные рабочие процессы с учетом требований к бренду, принимает на вход текст и изображения и выдает изображения.
o3 от OpenAI предназначена для сложных задач по математике, программированию и многошагового анализа. Модель принимает текст, изображения и файлы, поддерживает reasoning, web search и tool calling, а также выдаёт структурированные текстовые ответы.
o4 Mini High - reasoning-модель OpenAI для задач анализа, математики, программирования и планирования. Она обрабатывает текст, изображения и файлы, поддерживает tool calling, web search и структурированные ответы.
o4-mini - модель OpenAI для reasoning, программирования и работы с инструментами. Принимает текст, изображения и файлы, поддерживает vision, web search, structured outputs и параллельный tool calling.
GPT-4.1 от OpenAI подходит для программирования, выполнения инструкций и production-приложений. Модель принимает текст, изображения и файлы, генерирует текст и поддерживает tool calling, параллельный вызов инструментов, поиск в интернете и structured outputs.
GPT-4.1 mini от OpenAI предназначена для быстрой помощи с кодом и извлечения структурированных данных. Модель принимает текст, изображения и файлы, поддерживает vision, web search, tool calling, параллельные вызовы инструментов, prompt caching и структурированный вывод.
GPT-4.1 nano от OpenAI подходит для классификации, маршрутизации запросов и задач с большим потоком обращений. Модель принимает текст, изображения и файлы, генерирует текст, поддерживает tool calling, web search, structured outputs и prompt caching.
Llama 4 Maverick от Meta - мультимодальная модель с открытым доступом, которая принимает текст и изображения и генерирует текст. Поддерживает context до 1048576 токенов, reasoning, tool calling, структурированный вывод и logprobs.
Llama 4 Scout - открытая мультимодальная модель Meta для работы с текстом и изображениями, поддерживающая context до 1 310 720 токенов. Подходит для анализа длинных материалов и создания агентов, умеет распознавать изображения, вызывать инструменты и формировать структурированные ответы.
Qwen3 235B-A22B - открытая MoE-модель Alibaba для работы с текстом на разных языках. Подходит для reasoning, программирования и tool calling, поддерживает параллельные вызовы инструментов и context до 131072 токенов.
Qwen3 32B - открытая плотная модель Alibaba для самостоятельного развертывания, предназначенная для диалогов, reasoning и программирования. Поддерживает обработку текста, tool calling, structured outputs и prompt caching.
Qwen3 8B - модель Qwen для многоязычного общения, reasoning и работы с инструментами через tool calling. Принимает текст и генерирует текстовые ответы, поддерживает context длиной 131072 токена.
Qwen3-Coder 30B-A3B Instruct - модель Alibaba для задач программирования, рассчитанная на эффективную работу локальных агентов и исправление ошибок на уровне репозитория. Поддерживает context до 262144 токенов, tool calling и структурированный вывод.
GPT-4o Mini Transcribe (OpenAI) - модель для преобразования аудио в текст. Подходит для расшифровки речи и подготовки подписей к аудиоматериалам; принимает аудио и выдаёт текстовую транскрипцию.
GPT-4o Transcribe от OpenAI - модель для преобразования речи в текст. Она предназначена для расшифровки аудио и создания субтитров, принимает аудио и выдаёт текстовую транскрипцию.
o1-pro - модель OpenAI для сложных задач анализа, математики, программирования и планирования. Она обрабатывает текст, изображения и файлы, поддерживает reasoning, поиск в интернете и структурированный вывод.
Mistral Small 3.1 24B - эффективная модель Mistral для быстрых диалогов, извлечения информации и ассистентов для рабочих задач. Принимает текст и изображения, поддерживает vision, tool calling и logprobs.
Command A - это мультиязычная модель от Cohere для корпоративных агентов, инструментов и чат-приложений. Она поддерживает контекст до 256 тысяч токенов и работает с текстовыми входами и выходами. Модель включает функции reasoning, structured outputs и tool calling.
Gemma 3 12B IT - открытая мультимодальная модель Google для генерации текста на разных языках и понимания изображений. Она принимает текст и изображения, а в ответ формирует текст; доступны tool calling и структурированный вывод.
Gemma 3 27B IT от Google - открытая модель для многоязычной генерации текста и визуального понимания. Принимает текст и изображения, формирует текстовые ответы, поддерживает reasoning, tool calling и структурированные выходы.
Gemma 3 4B IT - открытая мультимодальная модель Google для выполнения инструкций. Принимает текст и изображения, генерирует текст и поддерживает vision и структурированные ответы.
Reka Flash 3 - эффективная модель для ответов с низкой задержкой, извлечения информации и автоматизации рутинных задач. Работает с текстом, поддерживает reasoning, logprobs и структурированный вывод.
Skyfall 36B V2 - открытая instruction-модель для адаптивного общения и рабочих нагрузок на собственной инфраструктуре. Принимает и генерирует текст, поддерживает logprobs, prompt caching и structured outputs.
Saba - модель Mistral для многоязычного общения, reasoning и сценариев с tool calling. Принимает текст и файлы, генерирует текст, поддерживает prompt caching и структурированный вывод.
o3 Mini High - reasoning-модель OpenAI для анализа, математических задач, программирования и планирования. Принимает текст и файлы, поддерживает tool calling, web search, prompt caching и структурированные ответы.
Aion-RP 1.0 (8B) - открытая модель на базе Llama для многоязычного чата, reasoning и кодинга. Поддерживает контекст до 32768 токенов, принимает текст и генерирует текст. Создана AionLabs для общих задач.
Sonar Deep Research - поисковая модель Perplexity для самостоятельного исследования и подготовки подробных отчетов с цитированием источников. Поддерживает reasoning, поиск в интернете и параллельные вызовы инструментов, принимает текст на входе и выдает текстовые ответы.
Mistral Small 3 - эффективная модель Mistral для быстрого общения, извлечения данных и создания ассистентов для рабочих сценариев. Поддерживает текстовый ввод и вывод, большой context и structured outputs.
DeepSeek-R1 - открытая модель для решения задач с прозрачным reasoning, созданная DeepSeek. Она предназначена для математики, кодинга и обдуманного решения проблем, поддерживает context до 64000 токенов и tool calling. Модель принимает и генерирует текст, при этом reasoning обязателен для всех запросов, что обеспечивает пошаговый анализ.
MiniMax-01 - мультимодальная модель MiniMax для программирования, reasoning на длинном context и агентских задач. Принимает текст и изображения, поддерживает vision и генерирует текст; размер context - 1 000 192 токена.
Qwen 3 Embedding 4B - модель для преобразования текста в embeddings, которые подходят для семантического поиска, извлечения информации, кластеризации и ранжирования. Принимает текст и поддерживает context до 32768 токенов.
DeepSeek V3 - модель DeepSeek для программирования, развивающая навыки следования инструкциям и написания кода предыдущих версий. Поддерживает обработку текста, структурированный вывод, tool calling, logprobs и prompt caching.
o3-mini - компактная reasoning-модель OpenAI для задач программирования, математики и планирования. Принимает текст и файлы, поддерживает tool calling, web search, параллельные вызовы инструментов, prompt caching и структурированные ответы.
Llama 3.3 Euryale 70B - открытая instruction-модель для многоязычного общения, reasoning и задач по программированию. Поддерживает текстовый ввод и вывод, context до 131072 токенов, а также logprobs и структурированные ответы.
Phi-4 - открытая модель Microsoft для диалогов и развёртывания на собственной инфраструктуре. Поддерживает reasoning, tool calling, параллельные вызовы инструментов и структурированный вывод; работает с текстом.
Llama-3.3-70B-Instruct - открытая модель Meta для многоязычного общения и работы с кодом, которую можно развернуть самостоятельно. Поддерживает reasoning, tool calling, структурированный вывод и кэширование prompt; принимает и генерирует текст.
Nova Lite 1.0 - эффективная модель Amazon для ответов с низкой задержкой, извлечения информации и автоматизации рутинных задач. Обрабатывает текст и изображения, генерирует текст, поддерживает tool calling, параллельные вызовы инструментов и prompt caching.
Nova Micro 1.0 - модель Amazon для низколатентной помощи, извлечения данных и автоматизации рутинных задач. Поддерживает текстовый ввод и вывод, tool calling, параллельные вызовы инструментов и prompt caching.
o1 - reasoning-модель OpenAI для анализа, математических задач, программирования и планирования. Принимает текст, изображения и файлы, поддерживает tool calling, web search и structured outputs, а результат выдаёт в текстовом формате.
Nova Pro 1.0 от Amazon предназначена для сложного анализа, программирования и агентных процессов в production. Модель принимает текст и изображения, генерирует текст, поддерживает vision, tool calling, параллельные вызовы инструментов и кэширование промптов.
Qwen2.5-Coder-32B-Instruct - открытая модель Alibaba для задач программирования. Она генерирует и исправляет код, а также помогает анализировать репозитории. Поддерживает текстовый ввод и вывод, context - до 32768 токенов.
UnslopNemo 12B - модель с открытыми весами для диалогов и задач, следующих инструкциям. Её можно адаптировать для самостоятельного развёртывания в рабочих системах; модель принимает и генерирует текст, поддерживает logprobs и structured outputs.
Recraft V3 - модель для создания изображений по текстовым запросам, редактирования и работы с визуальным дизайном. Принимает текст и изображения, поддерживает анализ визуального содержимого и выдаёт изображения; context - 65536 токенов.
Magnum v4 72B - модель с открытыми весами для диалогов и самостоятельного развёртывания в производственных системах. Работает с текстом, поддерживает logprobs и структурированный вывод.
Ministral 3B - компактная модель Mistral для edge-сценариев, задач с высокими требованиями к скорости отклика и экономии ресурсов. Она принимает текст и изображения, генерирует текст и поддерживает tool calling, структурированный вывод и prompt caching.
Ministral 8B (latest) - компактная модель Mistral для устройств и задач, где важны низкая задержка и экономия затрат. Принимает текст и изображения, генерирует текст, поддерживает vision, tool calling, параллельные вызовы инструментов, prompt caching и структурированный вывод.
Whisper 3 Large от OpenAI - открытая модель для распознавания речи и создания субтитров на разных языках. Принимает аудио и выдаёт текстовую транскрипцию, а также поддерживает перевод речи.
Whisper Large v3 Turbo от OpenAI - модель для распознавания речи и преобразования аудио в текст. Подходит для создания транскрипций и субтитров, а также поддерживает перевод речи; на вход принимает аудио, на выходе формирует текст.
Llama 3.2 1B Instruct - открытая модель Meta для общения на нескольких языках, reasoning и программирования. Принимает текст и отвечает текстом, поддерживает reasoning, tool calling и параллельные вызовы инструментов.
Qwen2.5 72B Instruct - мультиязычная модель для диалогов, reasoning и работы с инструментами. Поддерживает параллельные вызовы инструментов и структурированные ответы, принимает и генерирует текст.
Llama 3.2 3B Instruct - открытая модель Meta для многоязычного общения, reasoning и программирования. Работает с текстом, поддерживает logprobs, structured outputs и tool calling, в том числе параллельные вызовы инструментов.
Qwen2.5 7B Instruct - модель для многоязычного общения, reasoning и использования инструментов. Она принимает текст и формирует текстовые ответы, поддерживает structured outputs и tool calling.
Qwen2.5-VL 72B Instruct - мультимодальная модель Alibaba, принимающая текст и изображения и создающая текстовые ответы. Она предназначена для visual reasoning, работы с документами и agent tasks, а также поддерживает structured outputs, prompt caching и logprobs.
Llama 3.1 Euryale 70B v2.2 от Sao10K - открытая модель для общения на разных языках, reasoning и программирования. Принимает и генерирует текст, поддерживает context до 131072 токенов, структурированный вывод и tool calling.
Hermes 3 70B Instruct - открытая instruction-модель Nous для многоязычного общения, reasoning и написания кода. Принимает текст, генерирует текст и поддерживает structured outputs; размер context - 131072 токена.
Hermes 3 405B Instruct - открытая модель Nous для общения на разных языках, reasoning и написания кода. Принимает и генерирует текст, поддерживает context до 131 072 токенов и структурированный вывод.
Llama 3 8B Lunaris - открытая модель для диалогов на разных языках, reasoning и помощи с кодом. Принимает и генерирует текст, поддерживает context до 8192 токенов, logprobs и структурированные ответы.
Llama-3.1-70B-Instruct - открытая модель Meta для многоязычного общения, reasoning и программирования. Принимает текст, поддерживает tool calling, параллельные вызовы инструментов и структурированный вывод.
Llama-3.1-8B-Instruct - компактная открытая модель Meta для текстовых чатов, подготовки черновиков и самостоятельного запуска. Поддерживает reasoning, tool calling, структурированный вывод, logprobs, параллельные вызовы инструментов и prompt caching.
GPT-4o mini от OpenAI - компактная мультимодальная модель для помощи с текстом, изображениями и файлами. Поддерживает reasoning, tool calling, web search, структурированные ответы, кэширование запросов и параллельный вызов инструментов.
Gemma 2 27B - открытая языковая модель Google для диалогов и самостоятельного размещения. Принимает текст и генерирует текст, поддерживает структурированный вывод и работает с context до 8192 токенов.
Mistral Nemo - открытая модель Mistral и NVIDIA для многоязычного общения и локального развертывания. Поддерживает текстовый ввод и вывод, tool calling, структурированные ответы и logprobs.
Codestral (latest) от Mistral - модель для программирования, поддерживающая завершение кода, рефакторинг и рабочие процессы в IDE. Она работает с контекстом до 256000 токенов, принимает файлы и текст, а выводит только текст. Включает tool calling, параллельные вызовы инструментов, prediction, prompt caching и структурированные выходы.
GPT-4o от OpenAI поддерживает мультимодальное общение, работу с кодом и задачи общего назначения. Модель принимает текст, изображения и файлы, а в ответ выдаёт текст; доступны reasoning, vision, web search, tool calling и структурированный вывод.
Mixtral 8x22B Instruct от Mistral предназначена для многоязычного общения, reasoning и рабочих процессов с tool calling. Она принимает текст и файлы, отвечает текстом и поддерживает prompt caching и структурированный вывод.
WizardLM-2 8x22B - открытая instruction-модель для гибкого общения и производственных задач при самостоятельном развёртывании. Работает с текстом, поддерживает tool calling и параллельный вызов инструментов.
Mistral Large предназначена для программирования, сложного reasoning и работы на разных языках. Модель принимает текст, изображения и файлы, поддерживает vision, tool calling, параллельный вызов инструментов, prompt caching и структурированный вывод текста.
BGE M3 от BAAI - это флагманская embedding-модель для сложного анализа, кодирования и production-агентов. Она преобразует текст в векторные представления, поддерживая контекст до 8194 токенов. Модель ориентирована на требовательные сценарии, где важна точность смысловой обработки.
Qwen Plus - мультиязычная instruction-модель Alibaba для диалогов, reasoning и работы с инструментами. Принимает и генерирует текст, поддерживает большой context, tool calling, structured outputs, logprobs и prompt caching.
text-embedding-3-large от OpenAI создает embeddings для работы с текстом. Модель подходит для семантического поиска, извлечения информации, кластеризации и ранжирования; принимает текст и поддерживает context до 8000 токенов.
text-embedding-3-small - модель OpenAI для преобразования текста в embeddings. Она подходит для семантического поиска, извлечения информации, кластеризации и ранжирования; принимает текст и поддерживает context до 8000 токенов.
Sonar от Perplexity ищет информацию в интернете и отвечает с указанием источников. Модель принимает текст и изображения, поддерживает reasoning и tool calling, а также лёгкое извлечение данных.
Sonar Pro - поисковая модель Perplexity для поиска по широкому кругу источников и синтеза информации. Принимает текст и изображения, поддерживает web search, reasoning и параллельные вызовы инструментов.
Sonar Reasoning Pro от Perplexity помогает разбирать многоэтапные исследовательские вопросы, опираясь на веб-источники и предоставляя цитаты. Модель принимает текст и изображения, поддерживает web search, reasoning и параллельные tool calls, а результат выдаёт в текстовом формате.
Mistral Embed - модель для преобразования текста в embeddings, которые подходят для семантического поиска, извлечения информации, кластеризации и ранжирования. Поддерживает текстовый ввод и context до 8000 токенов.
GPT-4 от OpenAI подходит для reasoning, написания текстов и программирования, а также задач с использованием инструментов. Модель принимает текст и файлы, генерирует текст и поддерживает tool calling, параллельные вызовы инструментов и структурированный вывод; context - 8191 токен.
GPT-4 Turbo от OpenAI - компактная модель для быстрой помощи и обработки большого потока запросов. Принимает текст, изображения и файлы, формирует текстовые ответы и поддерживает vision, tool calling, параллельные вызовы инструментов и структурированный вывод.
GPT-3.5 Turbo Instruct - компактная текстовая модель OpenAI для быстрой помощи и задач с большим числом запросов. Поддерживает context до 4095 токенов, выдачу logprobs и structured outputs.
GPT-3.5 Turbo 16k от OpenAI - компактная модель для быстрой текстовой помощи и обработки большого числа запросов. Поддерживает text-ввод и text-вывод, tool calling, structured outputs и logprobs.
Weaver (alpha) от Mancer - текстовая модель общего назначения с context на 8000 токенов и поддержкой logprobs. Подходит для ролевых и повествовательных сценариев, где важен подробный стиль ответа; связность и память могут быть ограничены.
ReMM SLERP 13B - модель с открытыми весами для диалогов и самостоятельного развёртывания в рабочих системах. Принимает текст, генерирует текст и поддерживает structured outputs и logprobs; context составляет 6144 токена.
MythoMax 13B - открытая instruction-модель для диалогов и задач, где важны гибкость и возможность самостоятельного развёртывания. Поддерживает текстовый ввод и вывод, reasoning, tool calling, структурированные ответы, logprobs и context до 4096 токенов.
E5 Large v2 от Intfloat - это embedding модель для семантического поиска, извлечения, кластеризации и ранжирования. Она принимает текстовые данные и преобразует их в embeddings, поддерживая контекст до 512 токенов.
GPT-3.5-turbo - компактная текстовая модель OpenAI для быстрых ответов и интенсивной нагрузки. Поддерживает tool calling, структурированный вывод и получение logprobs.
text-embedding-ada-002 - модель OpenAI для создания embedding из текста. Её используют в задачах семантического поиска, извлечения информации, кластеризации и ранжирования; context составляет 8192 токена.
Whisper от OpenAI - модель для распознавания речи, которая преобразует аудио в текст. Подходит для создания транскрипций и субтитров; принимает аудио и выдаёт текстовую расшифровку.
All-MiniLM-L6-v2 от Sentence Transformers - это embedding-модель для семантического поиска, извлечения информации, кластеризации и ранжирования. Она преобразует текстовые данные в embeddings, поддерживая контекст до 512 токенов. Модель оптимизирована для задач retrieval и ranking, обеспечивая компактные и эффективные векторные представления текста.
Multi-QA-mpnet-base-dot-v1 - embedding-модель Sentence Transformers для обработки текстов. Её используют в системах семантического поиска, извлечения и ранжирования информации, а также кластеризации; модель принимает текст и возвращает embeddings с context до 512 токенов.
Цены указаны в белорусских рублях за 1 миллион токенов
Готовы начать?
Получите API-ключ и начните использовать AI модели уже сегодня
Каталог нейросетей AIAI.BY
В каталоге представлены 400+ моделей искусственного интеллекта от ведущих мировых провайдеров — OpenAI, Anthropic, Google, Meta, xAI и DeepSeek. Каждая модель доступна через единый API, совместимый с форматом OpenAI: текстовые модели (GPT-5, Claude, Gemini), модели генерации изображений (DALL-E, Flux), reasoning-модели и бюджетные варианты для массовых задач.
Все цены указаны в белорусских рублях за 1 миллион токенов. Фильтруйте по провайдеру, категории или стоимости, чтобы подобрать оптимальную модель. Для детального сравнения моделей между собой используйте раздел Сравнение.
Не знаете, какую модель выбрать? Наши специалисты помогут подобрать модель под вашу задачу — от обработки клиентских обращений до анализа финансовой отчётности. Подключение занимает 5 минут, первые 100K токенов — бесплатно.
