INTEGRITY Документация

Модели

Мы обнаружили 233 модели
Логотип Alibaba

hh1-i2v

AlibabaImage-to-Video

Модель image-to-video HappyHorse 1.0 от Alibaba анимирует референсное изображение с помощью необязательного текстового промпта. Поддерживает вывод в 720P и 1080P с длительностью от 3 до 15 секунд.

  • Сторонние
  • Zero data retention
Логотип Alibaba

hh1-t2v

AlibabaText-to-Video

Модель text-to-video HappyHorse 1.0 от Alibaba создаёт видео по текстовому промпту с настраиваемым разрешением, соотношением сторон и длительностью (3-15 с).

  • Сторонние
  • Zero data retention
Логотип Alibaba

hh1.1-i2v

AlibabaImage-to-Video

Модель image-to-video HappyHorse 1.1 от Alibaba анимирует референсное изображение с помощью необязательного текстового промпта, обеспечивая более плавное движение, естественную текстуру кожи и улучшенное качество крупных планов по сравнению с версией 1.0. Поддерживает вывод в 720P и 1080P с длительностью от 3 до 15 секунд.

  • Сторонние
Логотип Alibaba

hh1.1-r2v

AlibabaImage-to-Video

Модель reference-to-video HappyHorse 1.1 от Alibaba использует от 1 до 9 референсных изображений (персонажей и сцен) и промпт, который выстраивает их в единое видео, сохраняя узнаваемость каждого персонажа. Поддерживает вывод в 720P и 1080P с длительностью от 3 до 15 секунд.

  • Сторонние
Логотип Alibaba

hh1.1-t2v

AlibabaText-to-Video

Модель text-to-video HappyHorse 1.1 от Alibaba создаёт видео по текстовому промпту с более выраженной динамической экспрессивностью, лучшим визуальным качеством и более точным следованием инструкциям по сравнению с версией 1.0. Настраиваемые разрешение, соотношение сторон и длительность (3-15 с).

  • Сторонние
Логотип Alibaba

qwen-image-3.0-pro

AlibabaТекст в изображение

Qwen Image 3.0 Pro от Alibaba создаёт изображения по текстовым промптам с акцентом на генерацию сложных макетов, точность мелкого текста и многоязычный рендеринг шрифтов. Поддерживает до 6 вариантов изображения за один вызов, негативные промпты, управление seed и необязательную переработку промпта.

  • Сторонние
Логотип Alibaba

qwen3-max

AlibabaГенерация текста

Qwen 3 Max от Alibaba представляет собой большую языковую модель с сильными возможностями в написании кода, рассуждениях и работе с несколькими языками; доступна через OpenAI-совместимую конечную точку DashScope.

  • Сторонние
  • Zero data retention
Логотип Alibaba

qwen3.5-397b-a17b

AlibabaГенерация текста

Qwen 3.5 от Alibaba представляет собой модель mixture-of-experts с 397 млрд параметров и 17 млрд активных параметров, обеспечивающую сильные способности к рассуждению при эффективном инференсе.

  • Сторонние
  • Zero data retention
Логотип Alibaba

qwen3.7-max

AlibabaГенерация текста

Qwen 3.7 Max от Alibaba является самой крупной и мощной моделью в серии Qwen3.7, флагманом нового поколения для эпохи агентного ИИ с сильными сторонами в программировании, офисных задачах и задачах повышения продуктивности, а также в долгосрочном автономном выполнении задач; доступна через OpenAI-совместимую конечную точку DashScope.

  • Сторонние
Логотип Alibaba

qwen3.7-plus

AlibabaГенерация текста

Qwen 3.7 Plus от Alibaba является экономичным решением в серии Qwen3.7, сочетающим сильные текстовые возможности с пониманием изображений и видео, а также полноценным интеллектом агентного уровня для написания кода, использования инструментов и автоматизации на основе GUI; доступна через OpenAI-совместимую конечную точку DashScope.

  • Сторонние
Логотип Alibaba

qwen3.8-max

AlibabaГенерация текста

Qwen 3.8 Max от Alibaba представляет собой MoE-флагман с 2,4 трлн параметров, созданный для профессионального программирования и продолжительной автономной работы, способный реализовывать полноценные проекты промышленного уровня продолжительностью 10+ дней в юридической, финансовой, дизайнерской и других специализированных областях. Встроенное визуальное понимание изображений и расширенного видео работает на протяжении всего цикла планирования, выполнения и проверки; доступна через OpenAI-совместимую конечную точку DashScope.

  • Сторонние
Логотип Alibaba

wan-2.6-image

AlibabaТекст в изображение

Модель text-to-image Wan 2.6 от Alibaba создаёт изображения по текстовым промптам с возможностью использования негативных промптов и настраиваемыми размерами.

  • Сторонние
  • Zero data retention
Логотип Alibaba

wan-2.7-i2v

AlibabaImage-to-Video

Модель image-to-video Wan 2.7 от Alibaba создаёт видео по референсному изображению с необязательными текстовыми промптами. Поддерживает вывод в 720P и 1080P с длительностью от 2 до 15 секунд.

  • Сторонние
  • Zero data retention
Логотип Alibaba

wan-3.0

AlibabaText-to-Video

Модель text-to-video Wan 3.0 от Alibaba создаёт кинематографичные видео по текстовым промптам с адаптивным соотношением сторон, разрешением 480P, 720P или 1080P и настраиваемой длительностью.

  • Сторонние
Логотип Anthropic

claude-fable-5

AnthropicГенерация текста

Claude Fable 5 представляет собой самую производительную из широко выпущенных моделей Anthropic, созданную для самых сложных задач в области рассуждений и продолжительной агентной работы. Адаптивное мышление в ней включено постоянно, а модель поддерживает контекстное окно в 1 млн токенов и до 128 тыс. выходных токенов на один запрос.

  • Сторонние
Логотип Anthropic

claude-haiku-4.5

AnthropicГенерация текста

Claude Haiku 4.5 обеспечивает такой же уровень производительности в написании кода при трети стоимости и более чем вдвое превышающей скорости по сравнению с более крупными моделями.

  • Сторонние
  • Zero data retention
Логотип Anthropic

claude-opus-4.5

AnthropicГенерация текста

Claude Opus 4.5 приносит дальнейшие улучшения в рассуждениях, написании кода и агентных задачах по сравнению с Opus 4.1, а также более уверенное использование инструментов и более точное следование инструкциям.

  • Сторонние
  • Zero data retention
Логотип Anthropic

claude-opus-4.6

AnthropicГенерация текста

Claude Opus 4.6 представляет собой флагманскую языковую модель Anthropic, созданную для сложных многоэтапных задач в написании кода, финансовом анализе и юридических рассуждениях. Модель использует расширенное мышление для тщательной проработки сложных задач и поддерживает контекстное окно в один миллион токенов.

  • Сторонние
  • Zero data retention
Логотип Anthropic

claude-opus-4.7

AnthropicГенерация текста

Claude Opus 4.7 представляет собой самую производительную общедоступную модель Anthropic, обеспечивающую качественный скачок в агентном написании кода по сравнению с Claude Opus 4.6. Модель использует адаптивное мышление для настройки глубины рассуждений под конкретную задачу и поддерживает контекстное окно в один миллион токенов по стандартным тарифам.

  • Сторонние
  • Zero data retention
Логотип Anthropic

claude-opus-4.8

AnthropicГенерация текста

Claude Opus 4.8 представляет собой самую производительную общедоступную модель Anthropic, обеспечивающую качественный скачок в агентном написании кода по сравнению с Claude Opus 4.7. Модель использует адаптивное мышление для настройки глубины рассуждений под конкретную задачу и поддерживает контекстное окно в один миллион токенов по стандартным тарифам.

  • Сторонние
  • Zero data retention
Логотип Anthropic

claude-opus-5

AnthropicГенерация текста

Claude Opus 5 представляет собой модель Anthropic для сложных агентных задач в написании кода и корпоративной работы, обеспечивающую интеллект, близкий к Claude Fable 5, но за половину цены. Модель использует адаптивное мышление для настройки глубины рассуждений под конкретную задачу и поддерживает контекстное окно в один миллион токенов по стандартным тарифам. В отличие от Fable 5, для общего доступа к Opus 5 не требуется соблюдение условий хранения данных.

  • Сторонние
Логотип Anthropic

claude-sonnet-4.5

AnthropicГенерация текста

Claude Sonnet 4.5 является лучшей на сегодняшний день моделью для написания кода, с существенными улучшениями на всех этапах цикла разработки.

  • Сторонние
  • Zero data retention
Логотип Anthropic

claude-sonnet-4.6

AnthropicГенерация текста

Claude Sonnet 4.6 представляет собой последнюю сбалансированную модель Anthropic, сочетающую высокую производительность в написании кода, рассуждениях и агентных задачах с улучшенным следованием инструкциям.

  • Сторонние
  • Zero data retention
Логотип Anthropic

claude-sonnet-5

AnthropicГенерация текста

Claude Sonnet 5 представляет собой самую агентную на сегодняшний день модель линейки Sonnet от Anthropic, созданную для написания кода, использования инструментов, рассуждений и продолжительной профессиональной работы по более низкой цене, чем модели уровня Opus.

  • Сторонние
Логотип AssemblyAI

universal-3-pro

AssemblyAIАвтоматическое распознавание речи

Модель распознавания речи Universal 3 Pro от AssemblyAI для высокоточной транскрипции.

  • Сторонние
  • Zero data retention
Логотип AssemblyAI

universal-3.5-pro

AssemblyAIАвтоматическое распознавание речи

Модель распознавания речи Universal-3.5 Pro от AssemblyAI для быстрой и высокоточной транскрипции.

  • Сторонние
Логотип Black Forest Labs

flux-1-kontext-max

Black Forest LabsТекст в изображение

FLUX.1 Kontext [max] представляет собой самую качественную модель линейки Kontext от Black Forest Labs для генерации изображений по тексту (text-to-image) и контекстно-зависимого редактирования изображений.

  • Сторонние
Логотип Black Forest Labs

flux-1-kontext-pro

Black Forest LabsТекст в изображение

FLUX.1 Kontext [pro] создаёт и редактирует изображения по текстовым промптам, сохраняя высокую согласованность персонажей и стиля.

  • Сторонние
Логотип Black Forest Labs

flux-2-flex

Black Forest LabsТекст в изображение

FLUX.2 [flex] представляет собой вариант FLUX.2 от Black Forest Labs с точной настройкой параметров: модель предоставляет регулируемое количество шагов вывода (inference steps), guidance и prompt upsampling для сценариев с большим объёмом типографики и продакшен-задач.

  • Сторонние
Логотип Black Forest Labs

flux-2-max

Black Forest LabsТекст в изображение

FLUX.2 [max] представляет собой самую качественную модель для работы с изображениями от Black Forest Labs: обеспечивает максимальную согласованность при редактировании, наилучшее следование промпту и поиск с обоснованием (grounding search) для визуализации данных в реальном времени.

  • Сторонние
Логотип Black Forest Labs

flux-2-pro-preview

Black Forest LabsТекст в изображение

FLUX.2 [pro] Preview представляет собой рекомендуемую по умолчанию модель Black Forest Labs для генерации и редактирования изображений в продакшене: она отслеживает последние веса [pro] и обеспечивает надёжную поддержку нескольких референсных изображений.

  • Сторонние
Логотип Black Forest Labs

flux-3-video

Black Forest LabsText-to-Video

FLUX 3 Video представляет собой модель генерации видео от Black Forest Labs. Она создаёт видео из текстового промпта (t2v), анимирует одно или несколько референсных изображений (i2v) или продолжает существующий клип (v2v), поддерживает синхронизированный звук, разрешение до fhd и длительность от 5 до 20 секунд.

  • Сторонние
Логотип Black Forest Labs

flux-video-upscale

Black Forest Labsvideo-to-video

FLUX Video Upscale повышает разрешение видео: точный режим сохраняет верность исходному материалу, а творческий режим усиливает детализацию. Модель принимает клипы длительностью до 20 секунд и сохраняет звук.

  • Сторонние
Логотип ByteDance

seedance-2.0

ByteDanceText-to-Video

Видеомодель ByteDance нового поколения с унифицированной мультимодальной архитектурой. Генерирует высококачественное видео с синхронизированным аудио на основе текста, изображений, видеоклипов и аудиовходных данных. Поддерживает мультимодальные референсы (до 9 изображений, 3 видео, 3 аудиофайлов), нативную генерацию аудио, редактирование видео, расширение видео, интеллектуальную длительность и адаптивное соотношение сторон.

  • Сторонние
Логотип ByteDance

seedance-2.0-fast

ByteDanceText-to-Video

Более быстрый вариант модели Seedance 2.0 для генерации видео от ByteDance. Жертвует частью качества ради скорости, сохраняя ту же мультимодальную архитектуру. Поддерживает text-to-video, image-to-video, встроенную генерацию звука, мультимодальные референсы (изображения, видео, аудио), редактирование видео и расширение видео.

  • Сторонние
Логотип ByteDance

seedance-2.0-mini

ByteDanceText-to-Video

Компактная и экономичная модель генерации видео от ByteDance из семейства Seedance 2.0. Поддерживает text-to-video, image-to-video, референсное видео и референсное аудио для фоновой музыки. Идеально подходит для высоконагруженных рабочих процессов, где важны скорость и стоимость.

  • Сторонние
Логотип ByteDance

seedance-2.5

ByteDanceText-to-Video

Видеомодель ByteDance нового поколения с унифицированной мультимодальной архитектурой reference-to-video. Генерирует видео из текста, до 30 референсных изображений, 10 референсных видео и 10 референсных аудиоклипов, включая ввод только аудио без необходимости изображения или видео. Поддерживает image-to-video по первому и последнему кадру, редактирование видео, расширение видео, интеллектуальную длительность (включая автоматический выбор) и адаптивное соотношение сторон.

  • Сторонние
Логотип ByteDance

seedream-4.0

ByteDanceТекст в изображение

Seedream 4.0 представляет собой модель ByteDance для создания изображений, которая объединяет генерацию text-to-image и редактирование изображений в единой архитектуре, обеспечивая быстрый вывод с высоким разрешением до 4K.

  • Сторонние
Логотип ByteDance

seedream-4.5

ByteDanceТекст в изображение

Seedream 4.5 развивает возможности версии 4.0, добавляя поддержку нескольких референс-изображений, пакетную генерацию и последовательную генерацию изображений.

  • Сторонние
Логотип ByteDance

seedream-5-lite

ByteDanceТекст в изображение

Seedream 5 Lite представляет собой облегчённую и более быструю версию линейки Seedream 5 с поддержкой нескольких референс-изображений и пакетной генерации.

  • Сторонние
Логотип ByteDance

seedream-5-pro

ByteDanceТекст в изображение

Seedream 5 Pro представляет собой высококачественную модель ByteDance для генерации и редактирования изображений с текстовыми промптами, поддержкой до 10 референсных изображений и управлением выводом с разрешением 1K, 2K или заданным в пикселях размером.

  • Сторонние

deepseek-v4-pro

deepseekГенерация текста

DeepSeek V4 Pro представляет собой высокопроизводительную модель для рассуждений от DeepSeek, развёрнутую на инфраструктуре Fireworks для обеспечения инференса промышленного уровня.

  • Сторонние
Логотип ElevenLabs

eleven-flash-v2-5

ElevenLabsТекст в речь

Модель text-to-speech Flash v2.5 от ElevenLabs с низкой задержкой для быстрой многоязычной генерации речи.

  • Сторонние
Логотип ElevenLabs

eleven-multilingual-v2

ElevenLabsТекст в речь

Многоязычная модель text-to-speech от ElevenLabs для создания естественной речи на разных языках с использованием голосов ElevenLabs.

  • Сторонние
Логотип ElevenLabs

eleven-turbo-v2-5

ElevenLabsТекст в речь

Модель text-to-speech Turbo v2.5 от ElevenLabs сочетает высококачественную генерацию голоса с низкой задержкой на 32 языках.

  • Сторонние
Логотип ElevenLabs

eleven-v3

ElevenLabsТекст в речь

Новейшая модель text-to-speech от ElevenLabs для выразительной, естественной генерации речи с расширенным управлением голосом.

  • Сторонние
Логотип ElevenLabs

music-v2

ElevenLabsГенерация музыки

ElevenLabs Music v2 создаёт песни и инструментальные композиции на основе промпта или подробного плана композиции.

  • Сторонние
Логотип Google

gemini-2.5-flash

GoogleГенерация текста

Быстрая мультимодальная модель Google Gemini 2.5 с развитыми возможностями рассуждения и окном контекста в 1 млн токенов.

  • Сторонние
  • Zero data retention
Логотип Google

gemini-2.5-flash-lite

GoogleГенерация текста

Самая лёгкая и экономичная модель Google Gemini 2.5 для высокопроизводительных задач.

  • Сторонние
  • Zero data retention
Логотип Google

gemini-2.5-pro

GoogleГенерация текста

Самая мощная модель Google Gemini 2.5 с развитыми возможностями рассуждения, поддержкой thinking и окном контекста в 1 млн токенов.

  • Сторонние
  • Zero data retention
Логотип Google

gemini-3-flash

GoogleГенерация текста

Gemini 3 Flash представляет собой быструю мультимодальную модель Google с передовым уровнем интеллекта, продвинутым поиском и функцией grounding.

  • Сторонние
  • Zero data retention
Логотип Google

gemini-3.1-flash-lite

GoogleГенерация текста

Самая лёгкая и экономичная модель Google Gemini для высокопроизводительных задач.

  • Сторонние
  • Zero data retention
Логотип Google

gemini-3.1-flash-tts

GoogleТекст в речь

  • Сторонние
  • Zero data retention
Логотип Google

gemini-3.1-pro

GoogleГенерация текста

Самая интеллектуальная модель Google Gemini с улучшенным рассуждением, средним уровнем thinking и окном контекста в 1 млн токенов.

  • Сторонние
  • Zero data retention
Логотип Google

gemini-3.5-flash

GoogleГенерация текста

Gemini 3.5 Flash представляет собой быструю мультимодальную модель Google с передовым уровнем интеллекта, продвинутым поиском и функцией grounding.

  • Сторонние
Логотип Google

gemini-3.5-flash-lite

GoogleГенерация текста

Gemini 3.5 Flash-Lite представляет собой мультимодальную модель с низкой задержкой и экономичным использованием ресурсов, оптимизированную для высокопроизводительного и недорогого выполнения задач субагентов и разбора документов.

  • Сторонние
Логотип Google

gemini-3.6-flash

GoogleГенерация текста

Gemini 3.6 Flash обеспечивает стабильно высокий, передовой уровень интеллекта, оптимизированный для реальных задач при более высокой скорости и меньшей стоимости, и особенно хорошо справляется с генерацией кода, агентным выполнением задач и пространственным мышлением.

  • Сторонние
Логотип Google

gemini-3.7-flash

GoogleГенерация текста

Gemini 3.7 Flash представляет собой высокопроизводительную, изначально мультимодальную модель для рассуждений, оптимизированную для агентных рабочих процессов и реальных задач.

  • Сторонние
Логотип Google

nano-banana

GoogleТекст в изображение

Быстрая модель Google для генерации изображений, создающая качественные изображения по текстовым промптам.

  • Сторонние
  • Zero data retention
Логотип Google

nano-banana-2

GoogleТекст в изображение

Модель Google второго поколения для генерации изображений с улучшенным качеством и скоростью.

  • Сторонние
  • Zero data retention
Логотип Google

nano-banana-2-lite

GoogleТекст в изображение

Самая быстрая модель Google Gemini для генерации изображений, предназначенная для быстрого создания и доработки изображений.

  • Сторонние
  • Zero data retention
Логотип Google

nano-banana-pro

GoogleТекст в изображение

Модель Google для генерации изображений более высокого качества с улучшенной детализацией и точным следованием промпту.

  • Сторонние
  • Zero data retention
Логотип Google

veo-3.1

GoogleText-to-Video

Новейшая модель Google для генерации видео с улучшенным качеством, движением и генерацией звука.

  • Сторонние
  • Zero data retention
Логотип Google

veo-3.1-fast

GoogleText-to-Video

Более быстрая версия Veo 3.1, оптимизированная для меньшей задержки при сохранении высокого качества видео и аудио.

  • Сторонние
  • Zero data retention
Логотип Inworld

tts-1.5-max

InworldТекст в речь

Высочайшее качество text-to-speech с задержкой менее 200 мс, управлением эмоциями и поддержкой 15 языков.

  • Сторонние
  • Zero data retention
Логотип Inworld

tts-1.5-mini

InworldТекст в речь

Сверхбыстрое и экономичное преобразование текста в речь с задержкой около 120 мс и поддержкой 15 языков.

  • Сторонние
  • Zero data retention
Логотип Inworld

tts-2

InworldТекст в речь

Самая мощная и выразительная text-to-speech-модель от Inworld. В основе лежит TTS 1.5, дополненная богатой выразительной речью, задержкой, близкой к реальному времени, управлением голосом на естественном языке (например, [whisper], [say excitedly]) и расширенной поддержкой многоязычности: 15 продакшен-языков и ещё 90+ экспериментальных.

  • Сторонние
  • Zero data retention

krea-2-large

kreaТекст в изображение

Более чем в 2 раза крупнее Medium, с более мягким постобучением. Результаты получаются более сырыми, текстурными и гибкими: в лучших случаях Large выдает результаты, которые Medium не может повторить. Особенно силен в фотореализме, естественных эффектах (смазе движения, зерне, низком динамическом диапазоне), а также в выразительных и художественных стилях.

  • Сторонние

krea-2-medium

kreaТекст в изображение

Меньше, быстрее и экономичнее. Основательное пост-обучение делает результаты особенно стабильными и последовательными между генерациями. Особенно силён в иллюстрациях, аниме, живописи и других выразительных или художественных стилях.

  • Сторонние

krea-2-medium-turbo

kreaТекст в изображение

Самая быстрая модель Krea 2, созданная для недорогой итеративной работы над выразительными иллюстрациями, стилевыми концепциями и быстрым визуальным исследованием. Сохраняет систему стилей Krea 2 и широкий выразительный диапазон, но использует дистиллированную схему сэмплирования, что позволяет гораздо быстрее перебирать идеи. Особенно полезна для выразительных иллюстраций, графических стилей, экспериментов с типографикой и быстрой проработки направлений для кампаний или концепций.

  • Сторонние

ltx-2-5-fast

lightricksText-to-Video

Lightricks LTX-2.5 Fast представляет собой быструю модель генерации видео для сценариев text-to-video и image-to-video с синхронизированным звуком, а также настраиваемыми длительностью, разрешением и частотой кадров.

  • Сторонние
Логотип MiniMax

hailuo-2.3

MiniMaxText-to-Video

Модель генерации видео с высокой точностью деталей, оптимизированная для реалистичного движения людей, кинематографических визуальных эффектов, выразительных персонажей и точного следования промпту и стилю в сценариях text-to-video и image-to-video.

  • Сторонние
  • Zero data retention
Логотип MiniMax

hailuo-2.3-fast

MiniMaxText-to-Video

Версия Hailuo 2.3 с меньшей задержкой, которая сохраняет базовое качество движения, визуальную согласованность и стилизацию, обеспечивая при этом более быструю итерацию.

  • Сторонние
  • Zero data retention
Логотип MiniMax

m2.7

MiniMaxГенерация текста

Языковая модель M2.7 от MiniMax с поддержкой множества языков.

  • Сторонние
  • Zero data retention
Логотип MiniMax

m3

MiniMaxГенерация текста

Языковая модель M3 от MiniMax с передовыми возможностями программирования, агентными функциями, контекстным окном на 1 млн токенов и поддержкой множества языков.

  • Сторонние
  • Zero data retention
Логотип MiniMax

music-2.6

MiniMaxГенерация музыки

Модель генерации музыки от MiniMax, которая создает полноценные песни с вокалом на основе текстовых промптов и текстов песен, или инструментальные композиции. Поддерживает управление BPM и тональностью, а также автоматическую генерацию текста песен.

  • Сторонние
  • Zero data retention
Логотип MiniMax

speech-2.8-hd

MiniMaxТекст в речь

MiniMax Speech 2.8 HD ориентирована на генерацию аудио студийного качества с контролем эмоций, поддержкой более 40 языков и клонированием голоса.

  • Сторонние
  • Zero data retention
Логотип MiniMax

speech-2.8-turbo

MiniMaxТекст в речь

MiniMax Speech 2.8 Turbo превращает текст в естественную выразительную речь с клонированием голоса, контролем эмоций и поддержкой более 40 языков при более высокой скорости.

  • Сторонние
  • Zero data retention
Логотип Moonshot AI

kimi-k3

Moonshot AIГенерация текста

Kimi K3 представляет собой флагманскую модель Moonshot с 2.8 триллиона параметров, построенную на Kimi Delta Attention (гибридном механизме линейного внимания) с Attention Residuals. Она обеспечивает нативное понимание изображений, постоянно включённое рассуждение и контекстное окно на 1M токенов для долгосрочных задач программирования, работы со знаниями и глубокого анализа.

  • Сторонние
Логотип OpenAI

gpt-4.1

OpenAIГенерация текста

Флагманская модель GPT от OpenAI для сложных задач с окном контекста в миллион токенов.

  • Сторонние
  • Zero data retention
Логотип OpenAI

gpt-4.1-mini

OpenAIГенерация текста

Быстрая и доступная версия GPT-4.1 с контекстным окном на миллион токенов.

  • Сторонние
  • Zero data retention
Логотип OpenAI

gpt-4.1-nano

OpenAIГенерация текста

GPT-4.1 Nano от OpenAI представляет собой самый маленький и дешёвый вариант GPT-4.1, оптимизированный для задач с высокой пропускной способностью и низкой задержкой.

  • Сторонние
  • Zero data retention
Логотип OpenAI

gpt-4o

OpenAIГенерация текста

GPT-4o представляет собой мультимодальную флагманскую модель OpenAI, которая принимает текст и изображения и быстро отвечает в широком диапазоне задач.

  • Сторонние
  • Zero data retention
Логотип OpenAI

gpt-4o-mini

OpenAIГенерация текста

GPT-4o Mini представляет собой облегчённый и недорогой вариант GPT-4o, хорошо подходящий для многочисленных задач с мультимодальными входными данными.

  • Сторонние
  • Zero data retention
Логотип OpenAI

gpt-4o-transcribe

OpenAIАвтоматическое распознавание речи

Модель преобразования речи в текст, использующая GPT-4o для транскрибации аудио с более низкой частотой ошибок в словах и более точным распознаванием языка по сравнению с исходными моделями Whisper.

  • Сторонние
  • Zero data retention
Логотип OpenAI

gpt-5

OpenAIГенерация текста

Модель OpenAI, которая особенно хорошо справляется с кодированием, письмом и рассуждениями.

  • Сторонние
  • Zero data retention
Логотип OpenAI

gpt-5-mini

OpenAIГенерация текста

GPT-5 Mini представляет собой облегчённый и недорогой вариант GPT-5, хорошо подходящий для многочисленных задач по написанию кода и рассуждениям.

  • Сторонние
  • Zero data retention
Логотип OpenAI

gpt-5-nano

OpenAIГенерация текста

GPT-5 Nano от OpenAI представляет собой самый маленький вариант GPT-5, оптимизированный для задач с низкой задержкой и дешёвой высокой пропускной способностью.

  • Сторонние
  • Zero data retention
Логотип OpenAI

gpt-5.1

OpenAIГенерация текста

GPT-5.1 от OpenAI представляет собой постепенное улучшение GPT-5 с более сильными возможностями в написании кода, рассуждениях и письме.

  • Сторонние
  • Zero data retention
Логотип OpenAI

gpt-5.4

OpenAIГенерация текста

GPT-5.4 представляет собой флагманскую модель OpenAI с развитыми возможностями в написании кода, рассуждении и мультимодальности.

  • Сторонние
  • Zero data retention
Логотип OpenAI

gpt-5.4-mini

OpenAIГенерация текста

GPT-5.4 mini представляет собой более компактную, быструю и экономичную версию GPT-5.4 для простых задач.

  • Сторонние
  • Zero data retention
Логотип OpenAI

gpt-5.4-nano

OpenAIГенерация текста

GPT-5.4 nano представляет собой самую компактную и быструю модель OpenAI, оптимизированную для периферийных сценариев и задач с низкой задержкой.

  • Сторонние
  • Zero data retention
Логотип OpenAI

gpt-5.4-pro

OpenAIГенерация текста

GPT-5.4 pro использует Responses API от OpenAI со встроенными инструментами, улучшенным рассуждением и управлением контекстом с сохранением состояния.

  • Сторонние
  • Zero data retention
Логотип OpenAI

gpt-5.5

OpenAIГенерация текста

GPT-5.5 представляет собой флагманскую модель OpenAI с развитыми возможностями в написании кода, рассуждении и мультимодальности.

  • Сторонние
  • Zero data retention
Логотип OpenAI

gpt-5.5-pro

OpenAIГенерация текста

GPT-5.5 pro использует Responses API от OpenAI со встроенными инструментами, улучшенным рассуждением и управлением контекстом с сохранением состояния.

  • Сторонние
  • Zero data retention
Логотип OpenAI

gpt-5.6-luna

OpenAIГенерация текста

GPT-5.6 Luna представляет собой модель GPT-5.6 от OpenAI, оптимизированную для задач с ограниченным бюджетом и использующую Responses API для эффективной генерации текста.

  • Сторонние
Логотип OpenAI

gpt-5.6-sol

OpenAIГенерация текста

GPT-5.6 Sol представляет собой передовую модель GPT-5.6 от OpenAI для сложных профессиональных задач, использующую Responses API для рассуждения и управления контекстом с сохранением состояния.

  • Сторонние
Логотип OpenAI

gpt-5.6-terra

OpenAIГенерация текста

GPT-5.6 Terra представляет собой модель GPT-5.6 от OpenAI, сочетающую интеллект и экономичность, и использующую Responses API для рассуждения и управления контекстом с сохранением состояния.

  • Сторонние
Логотип OpenAI

gpt-image-1.5

OpenAIТекст в изображение

Модель генерации изображений от OpenAI, которая создаёт и редактирует изображения по текстовым промптам, с поддержкой нескольких уровней качества и размеров вывода.

  • Сторонние
  • Zero data retention
Логотип OpenAI

gpt-image-2

OpenAIТекст в изображение

Модель изображений нового поколения от OpenAI, которая создаёт и редактирует изображения по текстовым промптам, с поддержкой нескольких уровней качества, размеров и форматов вывода. Обратите внимание: прозрачные фоны не поддерживаются. Для прозрачных PNG используйте openai/gpt-image-1.5.

  • Сторонние
  • Zero data retention
Логотип OpenAI

o3

OpenAIГенерация текста

OpenAI разработала o3 как универсальную модель рассуждений, сочетающую высокую аналитическую производительность с разумными задержкой и стоимостью.

  • Сторонние
  • Zero data retention
Логотип OpenAI

o3-mini

OpenAIГенерация текста

o3-mini служит облегченным и недорогим вариантом модели рассуждений o3, хорошо подходящим для быстрых аналитических задач в большом масштабе.

  • Сторонние
  • Zero data retention
Логотип OpenAI

o4-mini

OpenAIГенерация текста

Быстрая, лёгкая модель OpenAI для рассуждений, оптимизированная для решения многошаговых задач по более низкой цене.

  • Сторонние
  • Zero data retention
Логотип OpenAI

tts-1

OpenAIТекст в речь

Модель text-to-speech от OpenAI, оптимизированная для использования в реальном времени с низкой задержкой.

  • Сторонние
  • Zero data retention
Логотип OpenAI

tts-1-hd

OpenAIТекст в речь

Модель text-to-speech высокой чёткости от OpenAI, обеспечивающая более качественное аудио на выходе.

  • Сторонние
  • Zero data retention
Логотип PixVerse

v5.6

PixVerseText-to-Video

Pixverse v5.6 представляет собой модель генерации видео, поддерживающую text-to-video и image-to-video с генерацией аудио, настраиваемыми соотношениями сторон и выходным разрешением до 1080p.

  • Сторонние
  • Zero data retention
Логотип PixVerse

v6

PixVerseText-to-Video

Pixverse v6 является новейшей видеомоделью Pixverse с поддержкой видео длительностью до 15 секунд, настраиваемой продолжительностью от 1 до 15 секунд и генерацией аудио.

  • Сторонние
  • Zero data retention
Логотип Pruna AI

p-image

Pruna AIТекст в изображение

P-Image от Pruna представляет собой сверхбыструю text-to-image модель с автоматическим улучшением промптов и двухэтапной доработкой, сочетающую исключительную скорость с высококачественным результатом и гибкими соотношениями сторон.

  • Сторонние
Логотип Pruna AI

p-image-edit

Pruna AIImage-to-Image

P-Image-Edit от Pruna редактирует и компонует от 1 до 5 референсных изображений с помощью текстовых инструкций. Модель поддерживает сложные композиции, перенос стиля и точечные правки с гибкими соотношениями сторон на выходе.

  • Сторонние
Логотип Pruna AI

p-image-try-on

Pruna AIImage-to-Image

P-Image Try-On от Pruna виртуально примеряет один или несколько предметов одежды на фотографию человека. Предоставьте фотографию человека и референсные изображения одежды, и модель реалистично одевает человека в предоставленную одежду.

  • Сторонние
Логотип Pruna AI

p-image-upscale

Pruna AIImage-to-Image

P-Image-Upscale от Pruna увеличивает разрешение изображения с помощью ИИ, охватывая диапазон от 1 до 128 мегапикселей с опциональным улучшением детализации и реалистичности для более чёткого и чистого результата.

  • Сторонние
Логотип Pruna AI

p-video

Pruna AIText-to-Video

P-Video от Pruna представляет собой премиальную модель генерации видео, поддерживающую text-to-video, image-to-video и генерацию с учётом аудио вплоть до 1080p при 24 или 48 кадрах в секунду, с настраиваемой длительностью до 20 секунд.

  • Сторонние
Логотип Pruna AI

p-video-animate

Pruna AIImage-to-Video

P-Video-Animate от Pruna принимает исходное видео и референсное изображение объекта, а затем анимирует этот объект, используя движение и аудио из исходного видео.

  • Сторонние
Логотип Pruna AI

p-video-avatar

Pruna AIImage-to-Video

P-Video-Avatar от Pruna создаёт видео с говорящей головой из одного портретного изображения на основе текстового сценария или аудиофайла, с поддержкой нескольких голосов, языков и выходных разрешений.

  • Сторонние
Логотип Pruna AI

p-video-replace

Pruna AIImage-to-Video

P-Video-Replace от Pruna принимает исходное видео и одно или несколько референсных изображений личности, а затем помещает указанного человека или людей в видео, сохраняя исходное движение и аудио.

  • Сторонние
Логотип Recraft

recraftv3

RecraftТекст в изображение

Recraft V3 представляет собой text-to-image модель предыдущего поколения от Recraft, хорошо подходящую для композиций дизайнерского качества, изображений с учётом бренда и точной передачи текста.

  • Сторонние
  • Zero data retention
Логотип Recraft

recraftv4

RecraftТекст в изображение

Recraft V4 создаёт художественно проработанные изображения с продуманной композицией, точной передачей текста и встроенным художественным вкусом. Быстрая и экономичная модель при стандартном разрешении.

  • Сторонние
  • Zero data retention
Логотип Recraft

recraftv4-1

RecraftТекст в изображение

Recraft V4.1 создаёт художественно проработанные изображения, настроенные на высокую эстетику, с продуманной композицией, точной передачей текста и утончённым художественным вкусом. Быстрая и экономичная модель при стандартном разрешении.

  • Сторонние
  • Zero data retention
Логотип Recraft

recraftv4-1-pro

RecraftТекст в изображение

Recraft V4.1 Pro создаёт изображения высокого разрешения от 2048px и выше, настроенные на высокую эстетику, с продуманной композицией, точной передачей текста и утончённым художественным вкусом. Создана для печати и производственных задач.

  • Сторонние
  • Zero data retention
Логотип Recraft

recraftv4-1-pro-vector

RecraftТекст в изображение

Создавайте подробную SVG-графику высокого разрешения по текстовым промптам с высоким эстетическим качеством и точной геометрией, масштабируемую до любого размера для печати и дизайна.

  • Сторонние
  • Zero data retention
Логотип Recraft

recraftv4-1-utility

RecraftТекст в изображение

Recraft V4.1 Utility представляет собой универсальную text-to-image модель, сочетающую качество и гибкость для широкого спектра повседневных задач при стандартном разрешении.

  • Сторонние
  • Zero data retention
Логотип Recraft

recraftv4-1-utility-pro

RecraftТекст в изображение

Recraft V4.1 Utility Pro представляет собой универсальную text-to-image модель, создающую изображения высокого разрешения от 2048px и выше для широкого спектра задач производства и печати.

  • Сторонние
  • Zero data retention
Логотип Recraft

recraftv4-1-utility-pro-vector

RecraftТекст в изображение

Создавайте подробную SVG-графику высокого разрешения по текстовым промптам с помощью универсальной модели, масштабируемую до любого размера для печати и масштабных дизайн-проектов.

  • Сторонние
  • Zero data retention
Логотип Recraft

recraftv4-1-utility-vector

RecraftТекст в изображение

Создавайте готовую к использованию SVG-графику по текстовым промптам с помощью универсальной модели, подходящей для широкого спектра задач дизайна и иллюстрации.

  • Сторонние
  • Zero data retention
Логотип Recraft

recraftv4-1-vector

RecraftТекст в изображение

Создавайте готовую к использованию SVG-графику по текстовым промптам с высоким эстетическим качеством, чистой геометрией, структурированными слоями и редактируемыми контурами.

  • Сторонние
  • Zero data retention
Логотип Recraft

recraftv4-pro

RecraftТекст в изображение

Recraft V4 Pro создаёт изображения высокого разрешения от 2048px и выше с продуманной композицией, точной передачей текста и хорошим художественным вкусом. Создана для печати и производственных задач.

  • Сторонние
  • Zero data retention
Логотип Recraft

recraftv4-pro-vector

RecraftТекст в изображение

Создавайте подробную, готовую к использованию SVG-графику по текстовым промптам с точной геометрией, масштабируемую до любого размера для печати и дизайна.

  • Сторонние
  • Zero data retention
Логотип Recraft

recraftv4-vector

RecraftТекст в изображение

Создавайте готовую к использованию SVG-графику по текстовым промптам с чистой геометрией, структурированными слоями и редактируемыми контурами.

  • Сторонние
  • Zero data retention
Логотип RunwayML

aleph-2

RunwayMLText-to-Video

Модель RunwayML для редактирования видео. Отредактируйте один кадр, чтобы обновить всё видео целиком, вносите изменения сразу в нескольких сценах и работайте с видео длительностью до 30 секунд. Поддерживает редактирование на основе ключевых кадров для точного контроля над отдельными моментами ролика.

  • Сторонние
Логотип RunwayML

gen-4.5

RunwayMLText-to-Video

Модель RunwayML для генерации видео с поддержкой text-to-video и image-to-video, настраиваемой длительностью, соотношением сторон и средствами модерации контента.

  • Сторонние

inkling

thinkingmachinesГенерация текста

Inkling представляет собой гибридную модель рассуждений с открытыми весами от компании Thinking Machines, построенную на архитектуре mixture-of-experts. По умолчанию она рассуждает, представляя цепочку рассуждений (chain-of-thought) в виде идущих первыми блоков контента типа thinking, а глубину рассуждений можно регулировать через специфичный для Tinker параметр output_config.effort. Модель доступна через бета-эндпойнт Tinker, совместимый с Anthropic Messages, наряду с использованием инструментов, потоковой передачей данных и многоходовыми диалогами. Сейчас она предназначена для тестирования при низкой нагрузке и внутреннего использования, а не для промышленных развёртываний с высокой пропускной способностью. Кеширование промптов, цитирование и ввод аудио через этот эндпойнт не поддерживаются.

  • Сторонние

inkling-256k

thinkingmachinesГенерация текста

256K-вариант Inkling, гибридной модели рассуждений MoE с открытыми весами от компании Thinking Machines. Поддерживает то же гибридное рассуждение, использование инструментов и потоковую передачу данных, что и базовая модель, с расширенным контекстным окном для более длинных диалогов и документов. Сейчас предназначен для тестирования при низкой нагрузке и внутреннего использования, а не для промышленных развёртываний с высокой пропускной способностью.

  • Сторонние
Логотип Vidu

q3-pro

ViduText-to-Video

Vidu Q3 Pro представляет собой высококачественную модель генерации видео, поддерживающую рабочие процессы text-to-video, image-to-video и start/end-frame-to-video со звуком и клипами длительностью до 16 секунд.

  • Сторонние
  • Zero data retention
Логотип Vidu

q3-turbo

ViduText-to-Video

Vidu Q3 Turbo представляет собой более быструю версию Vidu Q3, оптимизированную для генерации видео с меньшей задержкой при сохранении поддержки звука и клипов длительностью до 16 секунд.

  • Сторонние
  • Zero data retention
логотип xAI

grok-4.20-0309-non-reasoning

xAIГенерация текста

Grok 4.20 от xAI представляет собой модель без рассуждений. Пропускает трассировку рассуждений ради быстрых однопроходных ответов, сохраняя то же обучение, что и вариант с рассуждениями.

  • Сторонние
  • Zero data retention
логотип xAI

grok-4.20-0309-reasoning

xAIГенерация текста

Grok 4.20 от xAI представляет собой модель с рассуждениями. Использует расширенные рассуждения для решения сложных задач, возвращая трассировку рассуждений вместе с итоговым ответом.

  • Сторонние
  • Zero data retention
логотип xAI

grok-4.20-multi-agent-0309

xAIГенерация текста

Grok 4.20 от xAI представляет собой мультиагентную модель с контекстным окном на 2 млн токенов. Несколько агентов совместно работают над задачами глубокого исследования, используя вызов функций, структурированные выводы и возможности рассуждения.

  • Сторонние
  • Zero data retention
логотип xAI

grok-4.3

xAIГенерация текста

Grok 4.3 от xAI представляет собой модель с контекстным окном на 1 млн токенов и мощным агентным вызовом инструментов при минимальном количестве галлюцинаций. Принимает текст и изображения, поддерживает вызов функций, структурированные выводы и настраиваемый уровень рассуждений (none, low, medium, high).

  • Сторонние
  • Zero data retention
логотип xAI

grok-4.5

xAIГенерация текста

Grok 4.5 от xAI представляет собой передовую модель для программирования, агентных задач и интеллектуальной работы. Принимает текст и изображения, поддерживает вызов функций, структурированные выводы и настраиваемый уровень рассуждений (low, medium, high).

  • Сторонние
  • Zero data retention
логотип xAI

grok-4.6

xAIГенерация текста

Grok 4.6 от xAI представляет собой флагманскую модель с рассуждениями для программирования, агентных задач и работы с визуальным контентом. Принимает текст и изображения, поддерживает вызов функций и структурированные выводы.

  • Сторонние
  • Zero data retention
логотип xAI

grok-imagine-image

xAIТекст в изображение

Grok Imagine от xAI представляет собой модель для создания изображений. Генерирует и редактирует изображения на основе текста и референсных изображений с настраиваемым соотношением сторон и разрешением.

  • Сторонние
  • Zero data retention
логотип xAI

grok-imagine-image-2.0

xAIТекст в изображение

Grok Imagine Image 2.0 от xAI представляет собой точную модель для создания и редактирования изображений в творческих задачах, с высокой точностью следования инструкциям, работой с типографикой, компоновкой и сохранением референсных изображений.

  • Сторонние
логотип xAI

grok-imagine-image-quality

xAIТекст в изображение

Более точная text-to-image-модель от xAI, оптимизированная для чёткой детализации, точной композиции и качественного рендеринга текста. Поддерживает редактирование изображений с помощью референсных изображений и масок. Жертвует скоростью ради качества по сравнению с grok-imagine-image. Разрешение вывода по умолчанию: 2k.

  • Сторонние
  • Zero data retention
логотип xAI

grok-imagine-video

xAIText-to-Video

Модель xAI для генерации видео. Создаёт, редактирует и расширяет видео на основе текста и изображений со встроенным синхронизированным звуком, включая диалоги, звуковые эффекты и музыку. Поддерживает несколько творческих режимов (normal, fun, custom).

  • Сторонние
  • Zero data retention
логотип xAI

grok-imagine-video-1.5-preview

xAIImage-to-Video

Модель xAI нового поколения для генерации видео. Создаёт, редактирует и расширяет видео на основе текста и изображений. Поддерживает несколько соотношений сторон и разрешений с более высоким качеством по сравнению с предыдущим поколением.

  • Сторонние
  • Zero data retention
логотип xAI

grok-stt

xAIАвтоматическое распознавание речи

Grok от xAI представляет собой speech-to-text-модель. Транскрибирует аудиофайлы в текст на 25 языках с временными метками на уровне слов, многоканальной транскрипцией, диаризацией дикторов и настройкой приоритета ключевых терминов.

  • Сторонние
  • Zero data retention
логотип xAI

grok-tts

xAIТекст в речь

Grok от xAI представляет собой text-to-speech-модель. Генерирует высококачественную речь пятью выразительными голосами (eve, ara, rex, sal, leo) на более чем 20 поддерживаемых языках. Поддерживает встроенные речевые теги для смеха, шёпота и пауз.

  • Сторонние
  • Zero data retention
логотип xAI

grok-voice

xAIwebsocket

Модель xAI для голосового общения в реальном времени с низкой задержкой потоковой передачи аудио на входе и выходе.

  • Сторонние
  • Zero data retention
Логотип Deepgram

aura-1

DeepgramТекст в речь

Aura представляет собой контекстно-зависимую модель синтеза речи (TTS, text-to-speech), которая подбирает естественный темп, выразительность и слова-паразиты с учетом контекста переданного текста. Качество текста на входе напрямую влияет на естественность звучания голоса на выходе.

  • Размещено в Cloudflare
  • Batch
  • Партнёр
  • В реальном времени
Логотип Deepgram

aura-2-en

DeepgramТекст в речь

Aura-2 представляет собой контекстно-зависимую модель синтеза речи (TTS, text-to-speech), которая подбирает естественный темп, выразительность и слова-паразиты с учетом контекста переданного текста. Качество текста на входе напрямую влияет на естественность звучания голоса на выходе.

  • Размещено в Cloudflare
  • Batch
  • Партнёр
  • В реальном времени
Логотип Deepgram

aura-2-es

DeepgramТекст в речь

Aura-2 представляет собой контекстно-зависимую модель синтеза речи (TTS, text-to-speech), которая подбирает естественный темп, выразительность и слова-паразиты с учетом контекста переданного текста. Качество текста на входе напрямую влияет на естественность звучания голоса на выходе.

  • Размещено в Cloudflare
  • Batch
  • Партнёр
  • В реальном времени
Логотип Meta

bart-large-cnn

Бета
MetaСуммаризация

BART представляет собой модель-трансформер типа encoder-encoder (seq2seq) с двунаправленным энкодером (как в BERT) и авторегрессивным декодером (как в GPT). Эту модель можно использовать для суммаризации текста.

  • Размещено в Cloudflare
  • Устарело
Логотип BAAI

bge-base-en-v1.5

BAAIТекстовые эмбеддинги

Модель BAAI general embedding (Base), которая преобразует любой текст в 768-мерный вектор

  • Размещено в Cloudflare
  • Batch
Логотип BAAI

bge-large-en-v1.5

BAAIТекстовые эмбеддинги

Модель BAAI general embedding (Large), которая преобразует любой текст в 1024-мерный вектор

  • Размещено в Cloudflare
  • Batch
Логотип BAAI

bge-m3

BAAIТекстовые эмбеддинги

Модель эмбеддингов с мультифункциональностью, мультиязычностью и мультигранулярностью.

  • Размещено в Cloudflare
Логотип BAAI

bge-reranker-base

BAAIКлассификация текста

В отличие от модели эмбеддингов, reranker принимает на входе вопрос и документ и сразу выдает оценку сходства, а не эмбеддинг. Чтобы получить оценку релевантности, достаточно передать в reranker запрос и фрагмент текста. С помощью сигмоидальной функции эту оценку можно преобразовать в число с плавающей точкой в диапазоне [0,1].

  • Размещено в Cloudflare
Логотип BAAI

bge-small-en-v1.5

BAAIТекстовые эмбеддинги

Модель BAAI general embedding (Small), которая преобразует любой текст в 384-мерный вектор

  • Размещено в Cloudflare
  • Batch
Логотип DeepSeek

deepseek-r1-distill-qwen-32b

DeepSeekГенерация текста

DeepSeek-R1-Distill-Qwen-32B представляет собой модель, дистиллированную из DeepSeek-R1 на основе Qwen2.5. Она превосходит OpenAI-o1-mini по целому ряду тестов, достигая новых лучших результатов среди плотных моделей.

  • Размещено в Cloudflare
  • Рассуждения
Логотип DeepSeek

deepseek-v4-flash-0731

DeepSeekГенерация текста

DeepSeek-V4-Flash-0731 представляет собой официальный релиз DeepSeek-V4-Flash, который заменяет предварительную версию и предлагает значительно расширенные агентные возможности.

  • Размещено в Cloudflare
  • Вызов функций
  • Рассуждения
Логотип DeepSeek

deepseek-v4-pro-0813

DeepSeekГенерация текста

DeepSeek V4 Pro представляет собой высокопроизводительную модель для рассуждений от DeepSeek с окном контекста в один миллион токенов, созданную для долгосрочных агентных сценариев работы и решения сложных многоэтапных задач

  • Размещено в Cloudflare
  • Вызов функций
  • Рассуждения
Логотип Meta

detr-resnet-50

Бета
MetaОбнаружение объектов

Модель DEtection TRansformer (DETR), обученная сквозным способом на наборе данных COCO 2017 для обнаружения объектов (118 тыс. размеченных изображений).

  • Размещено в Cloudflare
Логотип HuggingFace

distilbert-sst-2-int8

HuggingFaceКлассификация текста

Дистиллированная модель BERT, дообученная на наборе данных SST-2 для классификации тональности текста

  • Размещено в Cloudflare

dreamshaper-8-lcm

lykonТекст в изображение

модель Stable Diffusion, дообученная для более высокой фотореалистичности без потери разнообразия.

  • Размещено в Cloudflare
Логотип Google

embeddinggemma-300m

GoogleТекстовые эмбеддинги

EmbeddingGemma представляет собой открытую модель эмбеддингов от Google с 300M параметров, лучшую в своем классе по размеру. Она построена на основе Gemma 3 (с инициализацией T5Gemma) и использует те же исследования и технологии, что и модели Gemini. EmbeddingGemma создает векторные представления текста, что делает её пригодной для задач поиска и извлечения информации, включая классификацию, кластеризацию и поиск по семантическому сходству. Модель обучена на данных более чем на 100 разговорных языках.

  • Размещено в Cloudflare
Логотип Deepgram

flux

DeepgramАвтоматическое распознавание речи

Flux представляет собой первую диалоговую модель распознавания речи, созданную специально для голосовых агентов.

  • Размещено в Cloudflare
  • Партнёр
  • В реальном времени
Логотип Black Forest Labs

flux-1-schnell

Black Forest LabsТекст в изображение

FLUX.1 [schnell] представляет собой rectified flow трансформер с 12 миллиардами параметров, способный генерировать изображения по текстовому описанию.

  • Размещено в Cloudflare
Логотип Black Forest Labs

flux-2-dev

Black Forest LabsТекст в изображение

FLUX.2 [dev] представляет собой модель для генерации изображений от Black Forest Labs, которая позволяет создавать высокореалистичные и детализированные изображения с поддержкой нескольких референсных изображений.

  • Размещено в Cloudflare
  • Партнёр
Логотип Black Forest Labs

flux-2-klein-4b

Black Forest LabsТекст в изображение

FLUX.2 [klein] представляет собой сверхбыструю дистиллированную модель генерации изображений. Она объединяет генерацию и редактирование изображений в единой модели, обеспечивая наилучшее в своем классе качество для интерактивных сценариев работы, предпросмотра в реальном времени и приложений, критичных к задержкам.

  • Размещено в Cloudflare
  • Партнёр
Логотип Black Forest Labs

flux-2-klein-9b

Black Forest LabsТекст в изображение

FLUX.2 [klein] 9B представляет собой сверхбыструю дистиллированную модель генерации изображений повышенного качества. Она объединяет генерацию и редактирование изображений в единой модели, обеспечивая наилучшее в своем классе качество для интерактивных сценариев работы, предпросмотра в реальном времени и приложений, критичных к задержкам.

  • Размещено в Cloudflare
  • Партнёр
Логотип Google

gemma-2b-it-lora

Бета
GoogleГенерация текста

Это базовая модель Gemma-2B, которую Cloudflare выделяет для инференса с адаптерами LoRA. Gemma представляет собой семейство лёгких, современных открытых моделей от Google, созданных на основе тех же исследований и технологий, что и модели Gemini.

  • Размещено в Cloudflare
  • LoRA
Логотип Google

gemma-3-12b-it

GoogleГенерация текста

Модели Gemma 3 хорошо подходят для широкого круга задач генерации текста и понимания изображений, включая ответы на вопросы, обобщение и рассуждение. Они мультимодальны: обрабатывают текстовый и графический ввод и генерируют текст на выходе, поддерживают большое контекстное окно 128K, работают более чем со 140 языками и доступны в большем числе размеров, чем предыдущие версии.

  • Размещено в Cloudflare
  • LoRA
  • Устарело
Логотип Google

gemma-4-26b-a4b-it

GoogleГенерация текста

Gemma 4 представляет собой самое интеллектуальное семейство открытых моделей Google, созданное на основе исследований Gemini 3, чтобы обеспечить максимальную интеллектуальность в расчете на параметр.

  • Размещено в Cloudflare
  • Вызов функций
  • Рассуждения
  • Компьютерное зрение
Логотип Google

gemma-7b-it

Бета
GoogleГенерация текста

Gemma представляет собой семейство легковесных передовых открытых моделей от Google, созданных на основе тех же исследований и технологий, что и модели Gemini. Это текстовые модели (text-to-text) с архитектурой decoder-only, то есть большие языковые модели, доступные на английском языке, с открытыми весами, в предобученных вариантах и вариантах, дообученных под инструкции.

  • Размещено в Cloudflare
  • LoRA
  • Устарело
Логотип Google

gemma-7b-it-lora

Бета
GoogleГенерация текста

Это базовая модель Gemma-7B, которую Cloudflare выделяет для инференса с адаптерами LoRA. Gemma представляет собой семейство легковесных современных открытых моделей от Google, созданных на основе тех же исследований и технологий, что и модели Gemini.

  • Размещено в Cloudflare
  • LoRA

gemma-sea-lion-v4-27b-it

aisingaporeГенерация текста

Название SEA-LION расшифровывается как Southeast Asian Languages In One Network. Это набор больших языковых моделей (LLM), предварительно обученных и дообученных по инструкциям специально для региона Юго-Восточной Азии (SEA).

  • Размещено в Cloudflare
Логотип Zhipu AI

glm-4.7-flash

Zhipu AIГенерация текста

GLM-4.7-Flash представляет собой быструю и эффективную многоязычную модель генерации текста с контекстным окном 131,072 токена. Модель оптимизирована для диалогов, следования инструкциям и многоходового вызова инструментов на более чем 100 языках.

  • Размещено в Cloudflare
  • Вызов функций
  • Рассуждения
Логотип Zhipu AI

glm-5.2

Zhipu AIГенерация текста

Флагманская агентная модель Z.ai для написания кода

  • Размещено в Cloudflare
  • Вызов функций
  • Рассуждения
Логотип Zhipu AI

glm-5.3-flash

Zhipu AIГенерация текста

Первая изначально мультимодальная модель в серии GLM-5. Имея 320B параметров в общей сложности и всего 18B активных параметров, она превосходит GLM-5.2 по бенчмаркам и в реальных рабочих нагрузках при цене в десять раз ниже, приближаясь по результатам бенчмарков на код и агентные задачи к уровню Claude Opus 4.8.

  • Размещено в Cloudflare
  • Вызов функций
  • Рассуждения
  • Компьютерное зрение
Логотип OpenAI

gpt-oss-120b

OpenAIГенерация текста

Модели OpenAI с открытыми весами, созданные для мощных рассуждений, агентных задач и разнообразных сценариев использования у разработчиков: gpt-oss-120b подходит для продакшена, задач общего назначения и сценариев с высокими требованиями к рассуждению.

  • Размещено в Cloudflare
  • Вызов функций
  • Рассуждения
Логотип OpenAI

gpt-oss-20b

OpenAIГенерация текста

Модели OpenAI с открытыми весами, созданные для мощных рассуждений, агентных задач и разнообразных сценариев использования у разработчиков: gpt-oss-20b подходит для сценариев с низкой задержкой, локального использования и специализированных задач.

  • Размещено в Cloudflare
  • Вызов функций
  • Рассуждения
Логотип IBM

granite-4.0-h-micro

IBMГенерация текста

Инструктивные модели Granite 4.0 показывают высокую производительность в тестах, демонстрируя лучшие в отрасли результаты в ключевых агентных задачах, таких как следование инструкциям и вызов функций. Благодаря этой эффективности модели хорошо подходят для широкого круга сценариев использования, включая retrieval-augmented generation (RAG), многоагентные рабочие процессы и развертывания на периферии.

  • Размещено в Cloudflare
  • Вызов функций

hermes-2-pro-mistral-7b

Бета
nousresearchГенерация текста

Hermes 2 Pro на базе Mistral 7B стал новой флагманской моделью линейки 7B Hermes! Hermes 2 Pro представляет собой улучшенную, переобученную версию Nous Hermes 2 и включает обновленную и очищенную версию набора данных OpenHermes 2.5, а также новый набор данных для Function Calling и JSON Mode, разработанный собственными силами.

  • Размещено в Cloudflare
  • Вызов функций
  • Устарело

indictrans2-en-indic-1B

ai4bharatПеревод

IndicTrans2 представляет собой первую многоязычную модель NMT (нейронного машинного перевода) с открытым исходным кодом на основе трансформера, которая поддерживает высококачественный перевод для всех 22 официально утверждённых индийских языков

  • Размещено в Cloudflare
Логотип Moonshot AI

kimi-k2.5

Moonshot AIГенерация текста

Kimi K2.5 представляет собой открытую (open source) модель класса frontier с контекстным окном 256k, поддержкой многошагового вызова инструментов, приёмом визуальных данных и структурированным выводом для агентных рабочих нагрузок.

  • Размещено в Cloudflare
  • Вызов функций
  • Устарело
  • Рассуждения
  • Компьютерное зрение
Логотип Moonshot AI

kimi-k2.6

Moonshot AIГенерация текста

Kimi K2.6 представляет собой открытую (open source) модель класса frontier с 1T параметров и контекстным окном 262.1k, поддержкой многошагового вызова инструментов, приёмом визуальных данных и структурированным выводом для агентных рабочих нагрузок.

  • Размещено в Cloudflare
  • Вызов функций
  • Рассуждения
  • Компьютерное зрение
Логотип Moonshot AI

kimi-k2.7-code

Moonshot AIГенерация текста

Kimi K2.7 представляет собой открытую (open source) модель класса frontier с 1T параметров и контекстным окном 262.1k, поддержкой многошагового вызова инструментов, приёмом визуальных данных и структурированным выводом для агентных рабочих нагрузок.

  • Размещено в Cloudflare
  • Вызов функций
  • Рассуждения
  • Компьютерное зрение
Логотип Meta

llama-2-7b-chat-fp16

MetaГенерация текста

Генеративная текстовая модель с полной точностью (fp16) и 7 миллиардами параметров от Meta

  • Размещено в Cloudflare
  • Устарело
Логотип Meta

llama-2-7b-chat-hf-lora

Бета
MetaГенерация текста

Это базовая модель Llama2, которую Cloudflare выделила для инференса с адаптерами LoRA. Llama 2 представляет собой набор предобученных и fine-tuned генеративных текстовых моделей с масштабом от 7 до 70 миллиардов параметров. Это репозиторий fine-tuned модели 7B, оптимизированной для диалоговых сценариев использования и преобразованной в формат Hugging Face Transformers.

  • Размещено в Cloudflare
  • LoRA
Логотип Meta

llama-2-7b-chat-int8

MetaГенерация текста

Квантованная (int8) генеративная текстовая модель с 7 миллиардами параметров от Meta

  • Размещено в Cloudflare
  • Устарело
Логотип Meta

llama-3-8b-instruct

MetaГенерация текста

От поколения к поколению Meta Llama 3 демонстрирует передовую производительность в широком спектре отраслевых тестов и предлагает новые возможности, включая улучшенные рассуждения.

  • Размещено в Cloudflare
  • Устарело
Логотип Meta

llama-3-8b-instruct-awq

MetaГенерация текста

Квантованная (int4) генеративная текстовая модель с 8 миллиардами параметров от Meta.

  • Размещено в Cloudflare
  • Устарело
Логотип Meta

llama-3.1-70b-instruct

MetaГенерация текста

Коллекция многоязычных больших языковых моделей (LLM) Meta Llama 3.1 объединяет предобученные и настроенные на инструкции генеративные модели. Текстовые модели Llama 3.1 с настройкой на инструкции оптимизированы для многоязычных диалоговых сценариев использования и превосходят многие доступные модели с открытым исходным кодом и закрытые чат-модели по распространённым отраслевым бенчмаркам.

  • Размещено в Cloudflare
  • Устарело
Логотип Meta

llama-3.1-8b-instruct

MetaГенерация текста

Коллекция многоязычных больших языковых моделей (LLM) Meta Llama 3.1 объединяет предобученные и настроенные на инструкции генеративные модели. Текстовые модели Llama 3.1 с настройкой на инструкции оптимизированы для многоязычных диалоговых сценариев использования и превосходят многие доступные модели с открытым исходным кодом и закрытые чат-модели по распространённым отраслевым бенчмаркам.

  • Размещено в Cloudflare
  • Устарело
Логотип Meta

llama-3.1-8b-instruct-awq

MetaГенерация текста

Квантованная (int4) генеративная текстовая модель с 8 миллиардами параметров от Meta.

  • Размещено в Cloudflare
  • Устарело
Логотип Meta

llama-3.1-8b-instruct-fast

MetaГенерация текста

[Быстрая версия] Meta Llama 3.1 представляет собой набор многоязычных больших языковых моделей (LLM), включающий предобученные и дообученные с учётом инструкций генеративные модели. Текстовые модели Llama 3.1, дообученные с учётом инструкций, оптимизированы для многоязычного диалога и превосходят многие доступные модели с открытым и закрытым исходным кодом на популярных отраслевых бенчмарках.

  • Размещено в Cloudflare
Логотип Meta

llama-3.1-8b-instruct-fp8

MetaГенерация текста

Llama 3.1 8B, квантованная до точности FP8

  • Размещено в Cloudflare
Логотип Meta

llama-3.2-11b-vision-instruct

MetaГенерация текста

Модели Llama 3.2-Vision, дообученные для выполнения инструкций, оптимизированы для распознавания образов, анализа изображений, создания подписей и ответов на общие вопросы об изображении.

  • Размещено в Cloudflare
  • LoRA
  • Компьютерное зрение
Логотип Meta

llama-3.2-1b-instruct

MetaГенерация текста

Текстовые модели Llama 3.2 с настройкой на инструкции оптимизированы для многоязычных диалоговых сценариев, включая агентный поиск и задачи суммаризации.

  • Размещено в Cloudflare
Логотип Meta

llama-3.2-3b-instruct

MetaГенерация текста

Текстовые модели Llama 3.2 с настройкой на инструкции оптимизированы для многоязычных диалоговых сценариев, включая агентный поиск и задачи суммаризации.

  • Размещено в Cloudflare
Логотип Meta

llama-3.3-70b-instruct-fp8-fast

MetaГенерация текста

Llama 3.3 70B, квантованная до точности fp8 и оптимизированная для более высокой скорости работы.

  • Размещено в Cloudflare
  • Batch
  • Вызов функций
Логотип Meta

llama-4-scout-17b-16e-instruct

MetaГенерация текста

Llama 4 Scout от Meta представляет собой модель с 17 миллиардами параметров и 16 экспертами, изначально мультимодальную. Эти модели используют архитектуру mixture-of-experts, обеспечивающую лучшую в отрасли производительность в понимании текста и изображений.

  • Размещено в Cloudflare
  • Batch
  • Вызов функций
  • Компьютерное зрение
Логотип Meta

llama-guard-3-8b

MetaГенерация текста

Llama Guard 3 представляет собой предобученную модель Llama-3.1-8B, дообученную для классификации безопасности контента. Как и предыдущие версии, её можно использовать для классификации контента как во входных данных LLM (классификация промптов), так и в ответах LLM (классификация ответов). Она работает как LLM: генерирует в своём выводе текст, который указывает, безопасен ли данный промпт или ответ, а если нет, также перечисляет нарушенные категории контента.

  • Размещено в Cloudflare
  • LoRA

llava-1.5-7b-hf

Бета
llava-hfImage-to-Text

LLaVA представляет собой чат-бот с открытым исходным кодом, обученный путём fine-tuning LLaMA/Vicuna на мультимодальных данных для следования инструкциям, сгенерированных GPT. Это авторегрессионная языковая модель на основе архитектуры трансформера.

  • Размещено в Cloudflare
Логотип Leonardo

lucid-origin

LeonardoТекст в изображение

Lucid Origin от Leonardo.AI на сегодняшний день является их самой адаптивной и точно реагирующей на промпты моделью. Независимо от того, генерируете ли вы изображения с чётким графическим дизайном, эффектные рендеры в полном HD или следуете предельно конкретному творческому замыслу, модель точно следует вашим промптам, точно отображает текст и поддерживает широкий спектр визуальных стилей и эстетик: от стилизованного концепт-арта до аккуратных макетов продуктов.

  • Размещено в Cloudflare
  • Партнёр
Логотип Meta

m2m100-1.2b

MetaПеревод

Многоязычная модель энкодер-декодер (seq-to-seq), обученная для мультиязычного перевода по принципу Many-to-Many

  • Размещено в Cloudflare
  • Batch
Логотип MyShell

melotts

MyShellТекст в речь

MeloTTS представляет собой высококачественную многоязычную библиотеку преобразования текста в речь от MyShell.ai.

  • Размещено в Cloudflare
Логотип Meta

meta-llama-3-8b-instruct

MetaГенерация текста

От поколения к поколению Meta Llama 3 демонстрирует передовую производительность в широком спектре отраслевых тестов и предлагает новые возможности, включая улучшенные рассуждения.

  • Размещено в Cloudflare
  • Устарело
Логотип MistralAI

mistral-7b-instruct-v0.1

MistralAIГенерация текста

Дообученная instruct-версия генеративной текстовой модели Mistral-7b с 7 миллиардами параметров

  • Размещено в Cloudflare
  • LoRA
  • Устарело
Логотип MistralAI

mistral-7b-instruct-v0.2

Бета
MistralAIГенерация текста

Mistral-7B-Instruct-v0.2 представляет собой большую языковую модель (LLM) и fine-tuned версию Mistral-7B-v0.2, оптимизированную для выполнения инструкций. По сравнению с Mistral-7B-v0.1 в Mistral-7B-v0.2 внесены следующие изменения: окно контекста 32k (вместо 8k в v0.1), rope-theta = 1e6 и отсутствие Sliding-Window Attention.

  • Размещено в Cloudflare
  • LoRA
  • Устарело
Логотип MistralAI

mistral-7b-instruct-v0.2-lora

Бета
MistralAIГенерация текста

Mistral-7B-Instruct-v0.2 представляет собой большую языковую модель (LLM) и fine-tuned версию Mistral-7B-v0.2, оптимизированную для выполнения инструкций.

  • Размещено в Cloudflare
  • LoRA
Логотип MistralAI

mistral-small-3.1-24b-instruct

MistralAIГенерация текста

Модель Mistral Small 3.1 (2503) развивает Mistral Small 3 (2501): она добавляет передовое понимание изображений и расширяет возможности работы с длинным контекстом до 128k токенов без потери качества обработки текста. Имея 24 миллиарда параметров, эта модель показывает результаты высочайшего уровня как в текстовых, так и в визуальных задачах.

  • Размещено в Cloudflare
  • Вызов функций

moondream3.1-9B-A2B

moondreamImage-to-Text

Moondream 3 представляет собой быструю и эффективную модель компьютерного зрения и языка mixture-of-experts на 9B параметров (2B активных параметров), которая обеспечивает визуальное мышление передового уровня для таких задач, как обнаружение объектов, указание на объекты, OCR и структурированный вывод.

  • Размещено в Cloudflare
  • Компьютерное зрение
Логотип NVIDIA

nemotron-3-120b-a12b

NVIDIAГенерация текста

NVIDIA Nemotron 3 Super представляет собой гибридную модель MoE с ведущей точностью для мультиагентных приложений и специализированных агентных ИИ-систем.

  • Размещено в Cloudflare
  • Вызов функций
  • Рассуждения
Логотип Deepgram

nova-3

DeepgramАвтоматическое распознавание речи

Транскрибирование аудио с помощью модели преобразования речи в текст от Deepgram

  • Размещено в Cloudflare
  • Batch
  • Партнёр
  • В реальном времени
Логотип Microsoft

phi-2

Бета
MicrosoftГенерация текста

Phi-2 представляет собой модель на основе Transformer с задачей предсказания следующего слова, обученную на 1.4T токенов за несколько проходов по смеси синтетических и веб-датасетов для задач NLP и написания кода.

  • Размещено в Cloudflare
  • Устарело
Логотип Leonardo

phoenix-1.0

LeonardoТекст в изображение

Phoenix 1.0 представляет собой модель от Leonardo.Ai, которая генерирует изображения с исключительным соответствием промпту и связным текстом.

  • Размещено в Cloudflare
  • Партнёр

plamo-embedding-1b

pfnetТекстовые эмбеддинги

PLaMo-Embedding-1B представляет собой японскую модель эмбеддинга текста, разработанную компанией Preferred Networks, Inc. Она преобразует входной японский текст в числовые векторы и может применяться для широкого круга задач, включая информационный поиск, классификацию текста и кластеризацию.

  • Размещено в Cloudflare
Логотип Qwen

qwen2.5-coder-32b-instruct

QwenГенерация текста

Qwen2.5-Coder представляет собой новейшую серию крупных языковых моделей Qwen, специализированных для кода (ранее известных как CodeQwen). На данный момент линейка Qwen2.5-Coder охватывает шесть основных размеров моделей: 0.5, 1.5, 3, 7, 14 и 32 миллиарда параметров, чтобы удовлетворить потребности разных разработчиков. По сравнению с CodeQwen1.5 в Qwen2.5-Coder внесены следующие улучшения:

  • Размещено в Cloudflare
  • LoRA
Логотип Qwen

qwen3-30b-a3b-fp8

QwenГенерация текста

Qwen3 представляет собой новейшее поколение крупных языковых моделей серии Qwen и предлагает полный набор плотных моделей и моделей mixture-of-experts (MoE). Благодаря масштабному обучению Qwen3 обеспечивает значительный прогресс в области рассуждений, следования инструкциям, агентных возможностей и поддержки многоязычности.

  • Размещено в Cloudflare
  • Batch
  • Вызов функций
  • Рассуждения
Логотип Qwen

qwen3-embedding-0.6b

QwenТекстовые эмбеддинги

Серия моделей Qwen3 Embedding представляет собой новейшую проприетарную модель семейства Qwen, разработанную специально для задач эмбеддинга текста и ранжирования.

  • Размещено в Cloudflare
Логотип Qwen

qwen3.8-27b

QwenImage-Text-to-Text

Qwen 3.8 27B представляет собой языковую модель с 27 миллиардами параметров, дообученную по инструкциям, из семейства Qwen компании Alibaba, предназначенную для работы со зрением, эффективной генерации текста общего назначения и агентных задач.

  • Размещено в Cloudflare
  • Вызов функций
  • Рассуждения
  • Компьютерное зрение
Логотип Qwen

qwq-32b

QwenГенерация текста

QwQ представляет собой модель рассуждений из серии Qwen. По сравнению с обычными моделями, дообученными по инструкциям, QwQ способна мыслить и рассуждать, благодаря чему достигает значительно более высокой производительности в прикладных задачах, особенно в сложных. QwQ-32B представляет собой модель рассуждений среднего размера, способную показывать результаты, конкурентоспособные по сравнению с современными моделями рассуждений, например DeepSeek-R1, o1-mini.

  • Размещено в Cloudflare
  • LoRA
  • Рассуждения
Логотип Microsoft

resnet-50

MicrosoftКлассификация изображений

Свёрточная нейронная сеть (CNN) для классификации изображений глубиной 50 слоёв, обученная более чем на 1 млн изображений из ImageNet

  • Размещено в Cloudflare
Логотип Pipecat

smart-turn-v2

PipecatОбнаружение голосовой активности

Модель с открытым исходным кодом при поддержке сообщества для нативного определения смены реплик в аудио, вторая версия

  • Размещено в Cloudflare
  • Batch
  • В реальном времени
Логотип Defog

sqlcoder-7b-2

Бета
DefogГенерация текста

Эта модель предназначена для того, чтобы нетехнические пользователи могли разбираться в данных внутри своих SQL-баз данных.

  • Размещено в Cloudflare
  • Устарело
Логотип RunwayML

stable-diffusion-v1-5-img2img

Бета
RunwayMLТекст в изображение

Stable Diffusion представляет собой латентную диффузионную модель генерации изображений по тексту, способную создавать фотореалистичные изображения. Img2img создаёт новое изображение на основе исходного с помощью Stable Diffusion.

  • Размещено в Cloudflare
Логотип RunwayML

stable-diffusion-v1-5-inpainting

Бета
RunwayMLТекст в изображение

Stable Diffusion Inpainting представляет собой латентную диффузионную модель генерации изображений по тексту, способную создавать фотореалистичные изображения по любому текстовому запросу, а также инпейнтить их с помощью маски.

  • Размещено в Cloudflare
Логотип Stability.ai

stable-diffusion-xl-base-1.0

Бета
Stability.aiТекст в изображение

Диффузионная генеративная модель преобразования текста в изображение от Stability AI. Создает и изменяет изображения на основе текстовых запросов.

  • Размещено в Cloudflare
Логотип ByteDance

stable-diffusion-xl-lightning

Бета
ByteDanceТекст в изображение

SDXL-Lightning представляет собой сверхбыструю модель генерации изображений по текстовому описанию. Она способна создавать высококачественные изображения 1024px всего за несколько шагов.

  • Размещено в Cloudflare
Логотип Unum

uform-gen2-qwen-500m

Бета
UnumImage-to-Text

UForm-Gen представляет собой небольшую генеративную модель класса vision-language, разработанную прежде всего для описания изображений и ответов на визуальные вопросы. Модель прошла предварительное обучение на внутреннем наборе данных для описания изображений и дообучение на общедоступных наборах инструкций: SVIT, LVIS и VQAs.

  • Размещено в Cloudflare
  • Устарело
Логотип OpenAI

whisper

OpenAIАвтоматическое распознавание речи

Whisper представляет собой универсальную модель распознавания речи. Она обучена на большом наборе разнородных аудиоданных и, будучи многозадачной, умеет выполнять многоязычное распознавание речи, перевод речи и определение языка.

  • Размещено в Cloudflare
Логотип OpenAI

whisper-large-v3-turbo

OpenAIАвтоматическое распознавание речи

Whisper представляет собой предобученную модель автоматического распознавания речи (ASR) и перевода речи.

  • Размещено в Cloudflare
  • Batch
Логотип OpenAI

whisper-tiny-en

Бета
OpenAIАвтоматическое распознавание речи

Whisper представляет собой предобученную модель автоматического распознавания речи (ASR) и перевода речи. Модели Whisper обучены на 680k часов размеченных данных и хорошо обобщаются на разные наборы данных и предметные области без дообучения. Это англоязычная версия модели Whisper Tiny, обученной для задачи распознавания речи.

  • Размещено в Cloudflare