LPU вместо GPU
Чип спроектирован под генерацию токенов подряд, а не под обучение моделей.
AIR для разработчиков
Groq — платформа инференса на собственных чипах LPU, а не чат-бот Grok от xAI: имена похожи, продукты разные. Своих моделей компания не обучает — хостит открытые веса и отдает токены с низкой задержкой.
Chat Completions API
Запрос к моделям для кода через OpenAI-совместимый API
Стримом: пул соединений упирается в 100 одновременных, что крутить в SQLAlchemy
Потолок дает max_overflow, а не pool_size. Поднимите overflow до 30 и задайте pool_timeout, иначе воркеры ждут молча.
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.air.fail/v1",
apiKey: process.env.AIR_API_KEY,
});
const reply = await client.chat.completions.create({
model: "deepseek",
messages: [{ role: "user", content: "Стримом: пул соединений упирается в 100 одновременных, что крутить в SQLAlchemy" }],
});
Разложи 200 тикетов по категориям: оплата, доступ, баг, прочее. Отдай CSV
Готово: оплата — 74, доступ — 51, баг — 38, прочее — 37. CSV с колонками id и category ниже.
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.air.fail/v1",
apiKey: process.env.AIR_API_KEY,
});
const reply = await client.chat.completions.create({
model: "qwen",
messages: [{ role: "user", content: "Разложи 200 тикетов по категориям: оплата, доступ, баг, прочее. Отдай CSV" }],
});
Достань из письма номер заказа, сумму и дату. Строго JSON по схеме, без текста вокруг
Вернул order A-10482, amount 5490, date 2026-08-14. Валюта в письме не указана, поле currency оставил пустым.
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.air.fail/v1",
apiKey: process.env.AIR_API_KEY,
});
const reply = await client.chat.completions.create({
model: "gpt",
messages: [{ role: "user", content: "Достань из письма номер заказа, сумму и дату. Строго JSON по схеме, без текста вокруг" }],
});
Ревью диффа: заменил синхронный requests на httpx.AsyncClient, что сломается под нагрузкой
Клиент создается на каждый вызов, пул не переиспользуется. Вынесите его в lifespan приложения и закройте на shutdown.
import OpenAI from "openai";
const client = new OpenAI({
baseURL: "https://api.air.fail/v1",
apiKey: process.env.AIR_API_KEY,
});
const reply = await client.chat.completions.create({
model: "claude",
messages: [{ role: "user", content: "Ревью диффа: заменил синхронный requests на httpx.AsyncClient, что сломается под нагрузкой" }],
});
Groq и более 80 моделей в одном сервисе
ОткрытьGroq строит ускоритель под одну операцию: последовательную выдачу токенов уже обученной моделью. Веса чужие, продукт — конвейер вывода.
Чип спроектирован под генерацию токенов подряд, а не под обучение моделей.
Платформа хостит открытые веса: своей флагманской модели у Groq нет.
Запросы идут в формате chat completions — клиент под OpenAI менять не нужно.
Продукт продает время до первого токена и плотность потока, а не размер каталога.
Grok — чат-бот xAI, Groq — инфраструктура инференса. Общего только созвучие имен.
Сайт открывается, и на этом хорошие новости заканчиваются. Барьера два, и VPN снимает только первый.
Запросы с российских адресов отклоняются на стороне платформы, регистрация упирается в геопроверку. VPN это лечит, но в продакшене прокси на CI-раннере и в контейнере с сервисом — лишний узел и постоянная точка отказа.
Тарификация в долларах, списание только с зарубежной карты: российские, включая «Мир», не привязываются. Виртуальные карты и посредники добавляют комиссию и риск — при проверке платежного профиля аккаунт блокируют вместе с остатком на балансе.
AIR — российский агрегатор нейросетей с OpenAI-совместимым API: один baseURL, один ключ, оплата рублями.
Обычный chat completions со стримингом: системный промпт, история сообщений, потоковый ответ.
Модели каталога читают стектрейс, пишут тесты и правки — из редактора, CI или скрипта.
Классификация тикетов, извлечение полей, суммаризация логов — пачками через один эндпоинт.
baseURL и ключ меняются в двух строках, остальной клиент остается как был.
OpenAI-совместимый эндпоинт
Клиент openai работает без правок: меняются baseURL и ключ, остальной код прежний.
Работа без VPN
AIR — российский сервис, api.air.fail отвечает напрямую из офисной сети и с CI-раннера.
Документация на русском
Справочник по эндпоинтам, параметрам и ошибкам ведется на русском, переводчик не нужен.
Стартовые лимиты
После регистрации есть лимиты на пробу: модель проверяется на своем запросе до оплаты.
Мост нужен не для демо, а для сервиса, который дежурит ночью. Важнее рекордов здесь предсказуемость: один договор, один ключ, документация на русском.
Один ключ на каталог
Чат, код и генерация медиа живут за одним ключом, отдельный аккаунт под задачу не нужен.
Смена модели строкой
Идентификатор модели — параметр запроса: кандидатов гоняют на своем трафике, а не по бенчмаркам.
Расходы в рублях
Карта российского банка, включая «Мир», без посредников и чужого курса.
Минимальный запрос — curl и Python. Код под OpenAI API переносится заменой двух значений.
curl — без SDK, из любого окружения
curl https://api.air.fail/v1/chat/completions \
-H "Authorization: Bearer $AIR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek",
"stream": true,
"messages": [
{"role": "user", "content": "Определи категорию тикета: оплата, доступ, баг или прочее"}
]
}'
openai — меняется только base_url и ключ
from openai import OpenAI
client = OpenAI(
base_url="https://api.air.fail/v1",
api_key="AIR_API_KEY",
)
stream = client.chat.completions.create(
model="qwen", # id модели — из каталога в кабинете
messages=[
{"role": "user", "content": "Извлеки из письма номер заказа и сумму, верни JSON"}
],
stream=True,
)
for chunk in stream:
print(chunk.choices[0].delta.content or "", end="")
Выбор идет по задаче, а не по площадке: открытые модели закрывают поток, флагманские — сложное.
| Модель | Сильная сторона | Когда выбирать |
|---|---|---|
| DeepSeek | Экономичная генерация и рассуждение | Поток запросов, черновики, классификация |
| Qwen | Многоязычность и структурный вывод | Извлечение полей, JSON по схеме |
| GLM | Ровное качество на длинных инструкциях | Агентные цепочки, разбор документов |
| Claude | Ревью, рефакторинг, длинный контекст | Сложные правки в большом проекте |
| GPT-5 | Универсальная кодогенерация | Повседневные задачи и чужой код |
Похожие имена — разные продукты. Таблица, чтобы не искать дальше.
Email или Яндекс ID: иностранный номер и зарубежная карта не нужны.
В кабинете это одна кнопка, ключ открывает весь каталог сразу.
Укажите в клиенте https://api.air.fail/v1 и свой ключ, остальной код не трогайте.
Сравните две-три модели на своих данных на стартовых лимитах и оставьте рабочую.
Нет. Groq — компания, которая делает чипы LPU и хостит на них открытые модели. Grok — чат-бот xAI. Совпадение в названии случайное.
Нет. AIR — российский сервис, api.air.fail отвечает напрямую: из офиса, из дома и с CI-раннера, где VPN обычно запрещен политикой безопасности.
Картой российского банка, включая «Мир», прямо в кабинете AIR. Договор в российском правовом поле, закрывающие документы есть — расходы проводятся через бухгалтерию.
Регистрация бесплатна, стартовых лимитов хватает, чтобы прогнать свои запросы и сравнить модели. Дальше — подписка или оплата по токенам, цифры в кабинете.
Не обещаем. LPU-железо стоит у Groq, и мост его не переносит. Задержка в AIR зависит от модели и нагрузки — померить ее можно на стартовых лимитах.
Да, если клиент говорит в формате OpenAI chat completions — так работает большинство обвязок. Меняются baseURL и ключ, id моделей берутся из каталога AIR.
Открытые модели каталога — DeepSeek, Qwen, GLM, Kimi — и флагманские линейки Claude, GPT-5, Gemini. Тем же ключом идет генерация изображений, видео и звука.