Что такое Llama: модели Meta AI простыми словами

Что такое Llama от Meta: open-weight LLM, линейка Llama 4 Scout/Maverick, чем отличается от ChatGPT, лицензия и когда выгоднее self-host для бизнеса.

← Все статьи

что такое Llama

Что такое Llama — семейство больших языковых моделей (LLM) от Meta AI. Название расшифровывают как Large Language Model Meta AI. Главное отличие от ChatGPT, Claude или Gemini: у Llama открыты веса (open-weight) — модель можно скачать и запускать на своём железе или в своём облаке, а не только через чужой API. Первая Llama вышла в феврале 2023; актуальная линейка Llama 4 (Scout и Maverick) — 5 апреля 2025, с архитектурой Mixture-of-Experts и нативной мультимодальностью. Ниже — как устроена линейка, чем лицензия отличается от «настоящего open source» и когда Llama оправдана в продукте.

что такое Llama

Кратко

  • Llama — линейка LLM Meta с открытыми весами: download → self-host / fine-tune, не только chat-API.
  • Llama 4 Scout: 17B активных / 109B всего, контекст до 10M токенов; Maverick: 17B активных / 400B всего, контекст 1M (по model card).
  • Лицензия — Community License (коммерция для большинства компаний), это не OSI open source; порог ~700M MAU требует отдельного разрешения Meta.
  • Русский язык не входит в 12 официально поддерживаемых языков Llama 4 — для RU-продуктов нужны тесты качества или fine-tune / другая модель.
  • В связке с RAG Llama часто берут для внутренних агентов, где данные не должны уходить во внешний API.

Определение: open-weight LLM от Meta

По Wikipedia, Llama — семейство LLM, которое Meta AI выпускает с 2023 года. Пользователь обычно встречает Llama не как отдельный «чат Meta для всех», а как движок внутри продуктов, облачных inference-площадок или локального стека (Ollama, vLLM, llama.cpp и аналоги).

Open-weight значит: доступны параметры модели для запуска и дообучения. Это не то же самое, что полностью открытый код обучения и датасет. Meta публикует веса и правила использования по своей Community License — для большинства команд этого достаточно, но юридически это не Apache/MIT.

Краткая история поколений

  1. Llama 1 (2023) — исследовательский релиз, сильный импульс open-weight экосистеме.
  2. Llama 2–3.x — коммерчески ориентированные релизы, рост размеров и качества чата/кода; вокруг них выросла инфраструктура inference и fine-tune.
  3. Llama 4 (апрель 2025) — переход на MoE и early fusion для текста+изображений; публично вышли Scout и Maverick.

На момент статьи (июль 2026) Llama 4 остаётся основной открытой линейкой Meta для self-host. Флагманские закрытые модели у разных вендоров обновляются чаще — сравнивать нужно по задаче и бюджету, а не только по номеру поколения.

Llama 4 Scout и Maverick

МодельПараметрыКонтекстЗачем обычно берут
Llama 4 Scout (17B×16E)17B активных / 109B всегодо 10M токеновДлинные документы, эффективный деплой, long-context сценарии
Llama 4 Maverick (17B×128E)17B активных / 400B всего1M токеновУниверсальный чат, reasoning, код, мультимодальные задачи

Обе модели — autoregressive MoE с early fusion (зрение и язык обучаются совместно, а не «накручены» адаптером поверх). Обучение Scout — ~40T токенов, Maverick — ~22T; knowledge cutoff в card — август 2024. Источник цифр: официальный MODEL_CARD.md.

Llama vs закрытый API (ChatGPT / Claude / Gemini)

КритерийLlama (self-host / свой хостинг)Закрытый API
Контроль данныхВысокий: периметр у васЗависит от договора и региона
СтоимостьGPU/Ops постоянные; при большом трафике часто дешевлеPay-per-token; старт дешевле
Скорость внедренияНужен DevOps/MLOpsБыстрый прототип
Качество «из коробки»Сильное, но frontier API часто впередиОбычно максимум на момент релиза
КастомизацияFine-tune, квантизация, свой стекПромпты, tools, иногда fine-tune вендора

Практическое правило Compiny: прототип и внешний B2C-чат часто быстрее на API; внутренний контур с ПДн, регламентами и RAG — кандидат на Llama (или другую open-weight модель) в своём контуре.

Лицензия: коммерция да, «open source» — условно

Llama 4 Community License разрешает коммерческое использование для большинства компаний, но:

  • это не лицензия OSI open source;
  • есть Acceptable Use Policy;
  • если у лицензиата (и affiliates) было >700 млн MAU в месяце перед датой релиза версии — нужно отдельное разрешение Meta;
  • обычно требуется attribution / «Built with Llama» по условиям соглашения.

Для типичного SMB и студийных проектов порог 700M не релевантен, но юристу всё равно стоит прочитать актуальную лицензию выбранной версии перед продом.

Когда Llama подходит — и когда нет

Подходит, если нужен контроль над данными, предсказуемый TCO при высоком объёме запросов, fine-tune под домен или offline/on-prem контур. Хорошо стыкуется с корпоративной базой знаний и агентами с tools.

Слабее подходит, если:

  • нужен быстрый MVP без GPU-команды — дешевле стартовать с API;
  • критичен максимум frontier-качества «прямо сейчас» без своей оценки;
  • продукт на русском без готовности тестировать/дообучать — RU не в списке 12 supported languages Llama 4 (в card указаны AR, EN, FR, DE, HI, ID, IT, PT, ES, TL, TH, VI); Meta допускает fine-tune на другие языки при соблюдении лицензии;
  • нет бюджета на inference, мониторинг и обновление весов.

Как обычно внедряют в продукт

  1. Зафиксировать use case и метрики (точность, latency, стоимость 1k запросов).
  2. Сравнить baseline на закрытом API и на Llama (или другой open-weight) на одном золотом наборе вопросов.
  3. Выбрать режим: облачный managed inference или свой GPU; для старта часто хватает квантизованного Scout/аналога через Ollama/vLLM.
  4. Подключить знания через RAG и правила отказа; при необходимости — tools/CRM для агента.
  5. Проверить лицензию, логи, доступ к ПДн и эскалацию человеку — затем feature flag в прод.

Связь с ИИ-агентами и RAG

Llama — это модель-движок. Польза для бизнеса появляется, когда поверх неё есть retrieval по вашим документам и/или действия в системах. Разбор слоёв: что такое RAG, ИИ-агент vs чат-бот. Заказ пилота: разработка ИИ-агентов.

FAQ

Что такое Llama простыми словами?

Это набор нейросетей Meta, которые понимают и генерируют текст (а в Llama 4 — ещё и работают с изображениями). Их можно скачать и запускать у себя, в отличие от большинства закрытых чат-сервисов.

Llama — это бесплатный ChatGPT?

Нет. Веса модели бесплатны для разрешённых сценариев, но вы платите железом, облаком или сервисом хостинга. Отдельного «официального чата Llama для всех» как у потребительских ботов у Meta нет в том же смысле.

Можно ли использовать Llama в коммерческом продукте?

В большинстве случаев да — по Community License. Исключения: Acceptable Use Policy, порог очень крупных MAU и отдельные условия attribution. Перед продом сверьте текст лицензии вашей версии.

Чем Llama 4 отличается от Llama 3?

Llama 4 перешла на MoE (активна только часть экспертов на токен) и нативную мультимодальность. Scout даёт экстремально длинный контекст; Maverick — более «универсальный» флагман открытой линейки.

Нужна ли Llama, если уже есть RAG на API-модели?

Не обязательно. RAG работает с любой LLM. Llama имеет смысл, когда важны периметр данных, стоимость при масштабе или fine-tune. Иначе API + RAG может быть проще в поддержке.

Нужен пилот на open-weight или API с RAG: ИИ-агенты, автоматизация с ИИ, что такое RAG, агент vs чат-бот.