Visaginas360 · База знаний

Нейро-База
воркфлоу, модели, агенты

Рабочая копилка по нейросетям: проверенные пайплайны генерации видео и изображений, актуальные модели и цены. Всё, что попадает сюда, сначала проверяется по первоисточникам.

7записей
22.07.26обновлено
1воркфлоу
01

Воркфлоу: 10-секундное видео с консистентным персонажем

Связка Krea 2 → Google Flow (agent mode) → Omni Flash. Главная идея: не просить модель «сделай видео», а сначала собрать раскадровку из согласованных кадров и отдать её как последовательность.

01

Кадр-основа в Krea 2 krea.ai

Krea 2 — первая foundation-модель Krea, обученная с нуля под эстетику и контроль стиля. Три варианта: Medium (повседневка), Large (фотореализм, текстура, зерно), Turbo (быстрый перебор идей).

  • Собери мудборд — до 4 референсов, у каждого свой слайдер силы. Модель кластеризует их и вытягивает taste profile, keywords и avoids.
  • Оптимум — 6–12 плотно подобранных референсов на борд, а не 30 случайных.
  • Creativity dial: raw ↔ high — насколько буквально модель читает промт.
  • Цель шага: один кадр, который тебя устраивает. Лучше портрет — персонажа потом легче держать консистентным.
02

Раскадровка в Google Flow flow.google

Добавляем кадр из шага 1 как референс и включаем режим агента.

  • Запрос агенту: «создай 10 кадров с разных ракурсов, тот же персонаж, та же локация».
  • Здесь решается консистентность — не в видеомодели, а на этапе кадров.
  • Отбираем лучшие. Реалистично: 3–5 попыток на кадр, чтобы персонаж и свет совпали.
03

Сборка промта

Кладём 5 отобранных кадров в промт и явно пишем: создать видео, соблюдая последовательность кадров. Формулировка про порядок — ключевая, без неё модель трактует кадры как набор стилевых референсов, а не как раскадровку.

04

Рендер на Omni Flash 15 кредитов

Переключаемся в режим видео, выбираем Omni Flash. Первая модель семейства Omni от Google DeepMind, показана 19 мая 2026 на I/O. Принимает любую комбинацию текста, изображений, аудио и видео на входе и выдаёт 10-секундный клип с синхронным звуком.

50бесплатных кредитов в сутки
15кредитов за генерацию
40кредитов за правку
10 секжёсткий потолок клипа

Подводные камни — проверено по источникам

  • Правка дороже генерации. Один edit-проход стоит ~40 кредитов против 15 за свежий клип — он переобрабатывает каждый кадр. Три круга доработки съедают дневной лимит. Промт-инжиниринг тут окупается буквально.
  • Реальный расход в 1.5–2× выше «чистой» математики из-за неудачных генераций и попыток свести консистентность.
  • 10 секунд — не ограничение модели, а решение о деплое (Nicole Brichtova, Google DeepMind). Доплатить за 30 секунд нельзя: только генерировать клипы и сшивать.
  • Доступ рваный. Наличие кредитов не равно наличию Omni Flash в аккаунте — влияют регион, тариф и стадия раскатки. Проверяй сам пункт Omni Flash, а не остаток кредитов.
  • Бесплатные обходы: YouTube Shorts и приложение YouTube Create дают Omni Flash даром (с вотермаркой, те же 10 сек), причём Create отдаёт готовый файл, а не запирает его в ленте. Тарифы Google Workspace включают Flow со 100 кредитами в месяц.
  • Расхождение в цифрах: ролик даёт 15 кредитов за 10-секундный клип, часть внешних разборов относит 15 кредитов к 4-секундному. Перед прогоном сверься с дашбордом Flow.
02

Записи

Модели и инструменты, отобранные по критерию «применимо в работе». Каждая карточка — что это, факты по первоисточникам и вывод под наш стек.

2026 · майKrea

Krea 2

foundation image model · krea.ai

Первая собственная foundation-модель Krea, обученная с нуля. Ставка на эстетику и управляемость, а не на буквальное следование промту.

  • Варианты Medium / Large / Turbo
  • Мудборды: кластеризация + LLM вытягивают концепты, персонажей, настроение
  • Style transfer с регулировкой силы, стековка 2–3 референсов
  • Кастомные LoRA под стиль, персонажа или объект (Max/Business)
  • Есть бесплатный тариф
ВыводТочка входа в видео-пайплайн. Мудборд = переиспользуемый стиль-пресет: один раз собрал под бренд — держишь визуал одинаковым во всех кадрах.
видеоизображенияпайплайн
19.05.2026Google DeepMind

Omni Flash

видеомодель · flow.google

Первая модель семейства Omni. В отличие от Veo 3, работавшей в основном text-to-video, принимает текст, изображения, аудио и готовое видео одновременно и рассуждает по всем входам сразу.

  • 10 секунд с синхронным звуком
  • Диалоговое редактирование: «поменяй фон на пляж» вместо перепрома
  • Доступ: Gemini app, Google Flow (AI Plus/Pro/Ultra), YouTube Shorts и Create — бесплатно
  • API анонсирован, публичных цен на момент запуска нет
ВыводРабочая лошадь для коротких роликов. Экономика жёстче, чем кажется — планируй под «попал с первого раза», а не под итерации.
видеомультимодальность
08.07.2026ByteDance

Seedream 5.0 Pro

генерация изображений · Volcano Engine, BytePlus, fal, ComfyUI

Модель под редактирование, а не под one-shot генерацию. Главное — послойный вывод и нативный текст на 14 языках.

  • Разбивает один рендер на 10+ независимых слоёв в прозрачных PNG — тянутся в Figma/Photoshop
  • Точечная правка: point, lasso, box, скетч, цветовой сэмпл, референс материала
  • Текст генерируется нативно на 14 языках, включая русский, — не перевод с наклейкой поверх
  • Инфографика целиком за один проход: данные и длинный текст в готовый лейаут
  • $0.045 за выход, плоская цена; до 2K (Lite умеет 4K)
  • Арабский раскладывается в RTL, а не разворачивается задом наперёд
ВыводКандидат на замену связки HTML → Playwright → ffmpeg в нашем пайплайне инфографики. Проверять надо именно кириллицу под нагрузкой текста.
изображенияинфографикакириллица
08.07.2026xAI / SpaceXAI + Cursor

Grok 4.5

LLM · Grok Build, Cursor, API

Первая модель, обученная совместно с Cursor — на триллионах токенов реальных взаимодействий разработчиков с кодовыми базами, а не на чистом коде.

  • $2 / $6 за миллион токенов против $5 / $25 у Opus 4.8
  • Контекст 500K, режимы reasoning low / medium / high, 80 TPS
  • Примерно в 4.2× меньше выходных токенов, чем Opus 4.8 (max), на SWE-Bench Pro
  • Artificial Analysis: 4-е место Intelligence Index (54) — позади Fable 5, GPT-5.5 и Opus 4.8
  • Cursor честно признал: результат на CursorBench завышен, ранний снапшот их кодовой базы попал в обучение
  • ЕС был заблокирован по AI Act как GPAI с системным риском — разблокирован в середине июля
Вывод«Уровень Opus» — маркетинг. Реальная ниша: массовые фоновые агенты, CI-фиксы, батч-рефакторинг, где важна цена за задачу. Литве доступен.
LLMагентыкодинг
09.07.2026Meta Superintelligence Labs

Muse Spark 1.1

LLM · Meta Model API (public preview)

Вторая модель MSL и первая модель Meta с публичным платным API. Разворот от открытой Llama к закрытой коммерческой модели окончательно оформлен.

  • $1.25 / $4.25 за миллион токенов, $20 стартовых кредитов
  • Контекст 1M, прирост в tool use, computer use, кодинге, мультимодальности
  • Zero-shot обобщается на новые нативные инструменты, MCP-серверы и кастомные скиллы
  • Умеет делегировать выполнение параллельным сабагентам
  • Слабое место: длинные агентные задачи проигрывают GPT-5.5 и Opus 4.8
  • Веса закрыты: ни скачать, ни развернуть локально, ни дообучить
ВыводДешёвый слой оркестрации поверх наших MCP-серверов. Кандидат под A2A SaaS там, где не нужен потолок качества.
LLMMCPоркестрация
20.01.2026 · GA 05.06Vercel Labs

Agent Skills / skills.sh

CLI + каталог · npx skills

Открытый стандарт упаковки переиспользуемых инструкций для кодинг-агентов. Скилл = папка с SKILL.md, опциональными scripts/ и references/.

  • npx skills add owner/repo — ставит в нужную папку агента автоматически
  • Поддержка Claude Code, Cursor, Codex, Copilot, Windsurf, Gemini CLI и ещё 60+
  • skills.sh — директория с лидербордом: категории, популярность, статистика установок
  • skills use — резолвит скилл во временную папку и печатает готовый промт, без установки
  • На GA — около 600 000 открытых скиллов
ВыводУже в нашем рабочем процессе. Забрать надо skills use для пробы без установки и лидерборд для отбора.
агентыинструментыCLI
30.06.2026Anthropic

Claude Science

рабочая среда · macOS, Linux · beta

Не новая модель, а слой рабочего процесса поверх существующих Claude, включая Opus 4.8. Профиль сугубо life sciences.

  • 60+ научных баз: геномика, single-cell, протеомика, структурная биология, хемоинформатика
  • Нативный рендер 3D-структур белков, геномных треков, химических структур
  • Оркестрация задач на своём HPC / Slurm через SSH, облачный компьют через Modal
  • Отдельный агент-ревьюер проверяет цитаты
  • Beta для Pro, Max, Team, Enterprise
ВыводПрямого применения нет. Переносим один приём: к каждой фигуре сохраняется точный код, окружение, описание и полная история сообщений — готовый шаблон воспроизводимости для Loop-скриптов.
инструментывоспроизводимость