[Документация Yandex Cloud](../../../index.md) > [Yandex MetaData Hub](../../index.md) > Apache Hive™ Metastore > Пошаговые инструкции > Мониторинг состояния кластера

# Мониторинг состояния кластера Apache Hive™ Metastore

Данные о состоянии кластера и его хостов доступны в [консоли управления](https://kz.console.yandex.cloud). Их можно посмотреть на вкладке **Мониторинг** страницы управления кластером  или в сервисе [Yandex Monitoring](../../../monitoring/concepts/index.md).

Диагностическая информация о состоянии кластера представлена в виде графиков.

Графики обновляются раз в 15 секунд.

{% note info %}

На графиках автоматически применяются наиболее подходящие кратные единицы измерения (мегабайты, гигабайты и т. д.).

{% endnote %}

Вы можете [настроить алерты](#monitoring-integration) в сервисе Yandex Monitoring для получения уведомлений о сбоях в работе кластера. В Yandex Monitoring используются два порога срабатывания алерта: `Warning` и `Alarm`. При превышении заданного порога вы получите оповещения через настроенные [каналы уведомлений](../../../monitoring/concepts/alerting/notification-channel.md).

## Мониторинг состояния кластера {#monitoring-cluster}

Для просмотра детальной информации о состоянии кластера Apache Hive™ Metastore:

{% list tabs group=instructions %}

- Консоль управления {#console}

  1. В [консоли управления](https://kz.console.yandex.cloud) выберите каталог.
  1. [Перейдите](https://kz.console.yandex.cloud/link/metadata-hub) в сервис **Yandex MetaData Hub**.
  1. На панели слева выберите ![image](../../../_assets/console-icons/database.svg) **Metastore-сервер**.
  1. Нажмите на имя нужного кластера и выберите вкладку **Мониторинг**.

  1. Чтобы перейти к работе с метриками, дашбордами или алертами в сервисе Yandex Monitoring, нажмите кнопку **Открыть в Monium** на панели сверху.

  На странице отображаются графики:

  * В блоке **API**:

    * **API Calls (rps)** — методы с наибольшим количеством выполненных запросов для каждого инстанса кластера. Список методов обновляется динамически. График может отображать до десяти методов.
    * **API Latency (p95)** — 95-й процентиль общего времени выполнения запросов с разбивкой по инстансам.
    * **Active Calls** — количество находящихся в обработке запросов.
    * **API Latency by method (p95)** — методы с наибольшим 95-м процентилем времени выполнения запросов для каждого инстанса кластера. Список методов обновляется динамически. График может отображать до десяти методов.

  * В блоке **Transactions & Errors**:

    * **Open Transactions / Connections** — количество активных транзакций и подключений:
      * **Open Transactions** — количество активных [ACID](https://ru.wikipedia.org/wiki/ACID)-транзакций.
      * **Open Connections** — количество активных подключений к кластеру Apache Hive™ Metastore по протоколу Thrift.
    * **Compaction Cycle Duration** — продолжительность цикла сжатия.
    * **DirectSQL Errors** — количество ошибок при выполнении DirectSQL-запросов, после которых Apache Hive™ Metastore перешел к выполнению запросов через JDO.

  * В блоке **Connection Pools** (только для Apache Hive™ Metastore версии `4.2`):

    * **Connection States** — количество JDBC-подключений:
      * **Active Connections** — активные подключения.
      * **Idle Connections** — простаивающие подключения.
      * **Pending Connections** — количество запросов, ожидающих выделения подключения.
      * **Total Connections** — общее количество подключений.

    * **Pool Usage (p95)** — 95-й процентиль времени, в течение которого приложение удерживает установленное подключение.
    * **Connection Creation (p95)** — 95-й процентиль продолжительности создания подключения.
    * **Pool Connection Timeouts (rps)** — количество запросов в секунду, завершившихся таймаутом из-за отсутствия доступных подключений.

  * В блоке **DB Objects**:

    * **Object Counts** — количество баз данных, таблиц и партиций в хранилище кластера Apache Hive™ Metastore.
    * **Object Operations (rps)** — количество операций создания и удаления баз данных, таблиц и партиций в секунду.

  * В блоке **Resources**:

    * **Instances** — количество инстансов в кластере.
    * **CPU Usage** — использование процессорного времени каждым инстансом в процентах от общего количества доступного времени.
    * **Memory Usage** — использование оперативной памяти каждым инстансом в процентах от общего объема доступной памяти.

  * В блоке **JVM Memory**:

    * **JVM Heap** — максимальный объем heap-памяти JVM и ее использование каждым инстансом.
    * **JVM Memory Pools** — пулы с наибольшим объемом использованной каждым инстансом памяти JVM. График отображает до шести пулов. Список пулов формируется динамически.

  * В блоке **JVM Runtime**:

    * **GC Rate** — скорость работы сборщиков мусора старого (G1_Old_Generation) и нового (G1_Young_Generation) поколения на каждом инстансе.
    * **JVM Pauses** — количество остановок всех потоков JVM, длительность которых превысила заданные пороги для информирования и предупреждения.

{% endlist %}

## Настройка алертов в Yandex Monitoring {#monitoring-integration}

Чтобы настроить алерты показателей состояния [кластера](#monitoring-cluster):

{% list tabs group=instructions %}

- Консоль управления {#console}

  1. В [консоли управления](https://kz.console.yandex.cloud) выберите каталог с кластером, для которого нужно настроить алерты.
  1. [Перейдите](https://kz.monitoring.yandex.cloud) в сервис ![image](../../../_assets/console-icons/display-pulse.svg) **Monitoring**.
  1. В блоке **Сервисные дашборды** выберите **Managed Service For Hive Metastore — Cluster Overview**.
  1. На нужном графике нажмите на значок ![options](../../../_assets/console-icons/ellipsis.svg) и выберите пункт **Создать алерт**.
  1. Если на графике несколько показателей, выберите запрос данных для формирования метрики и нажмите **Продолжить**. Подробнее о языке запросов в [документации Yandex Monitoring](../../../monitoring/concepts/querying.md).
  1. Задайте пороговые значения `Alarm` и `Warning` для срабатывания алерта.
  1. Нажмите кнопку **Создать алерт**.

{% endlist %}

Чтобы настроить автоматический мониторинг других показателей состояния кластера:

{% list tabs group=instructions %}

- Консоль управления {#console}

    1. [Создайте алерт](../../../monitoring/operations/alert/create-alert.md).
    1. Добавьте метрику состояния.
    1. В параметрах алерта задайте значения порогов для оповещения.

{% endlist %}

Рекомендуемые значения порогов для некоторых метрик:

| Метрика                               | Обозначение                | `Alarm`                   | `Warning`                 |
|---------------------------------------|:--------------------------:|:-------------------------:|:-------------------------:|
| Использование процессорного времени                   | `cpu_usage` | 90%                      | 80%                       |
| Использование оперативной памяти     | `memory_usage`        | 90% | 80% |
| 95-й процентиль общего времени выполнения запросов     | `metastore_api_calls_duration_seconds`    | 10 секунд                         | 3 секунды                    |
| Количество запросов, ожидающих выделения подключения      | `metastore_pool_pending_connections`          | —  | Больше нуля в течение пяти минут  |
| Количество запросов, завершившихся таймаутом из-за отсутствия доступных подключений | `metastore_pool_connection_timeouts_total` | Больше нуля | — |
| Количество ошибок при выполнении DirectSQL-запросов, после которых Apache Hive™ Metastore перешел к выполнению запросов через JDO | `metastore_directsql_errors_total` | — | Больше нуля |

Полный список поддерживаемых метрик в [документации Monitoring](../../../monitoring/metrics-ref/managed-metastore-ref.md).

## Состояние и статус кластера {#cluster-health-and-status}

_Состояние_ кластера указывает на его исправность, а _Статус_ показывает, запущен кластер, остановлен или находится в промежуточном состоянии.

Для просмотра состояния и статуса кластера:

1. В [консоли управления](https://kz.console.yandex.cloud) выберите каталог.
1. [Перейдите](https://kz.console.yandex.cloud/link/metadata-hub) в сервис **Yandex MetaData Hub**.
1. На панели слева выберите ![image](../../../_assets/console-icons/database.svg) **Metastore-сервер**.
1. В строке нужного кластера наведите курсор на индикатор в столбце **Доступность**.

### Состояния кластера {#cluster-health}

#|
|| Состояние | Описание | Предлагаемые действия ||
|| **ALIVE** | Кластер работает в штатном режиме. | Действий не требуется. ||
|| **DEGRADED** | Кластер работает не на полную мощность. |
[Составьте обращение в службу поддержки](https://kz.center.yandex.cloud/support), указав:
* Идентификатор кластера.
* Идентификаторы последних операций, которые на нем выполнялись.
* Время по [графикам доступности](#monitoring-cluster), когда кластер перешел в состояние `DEGRADED`. ||
|| **DEAD** | Кластер неработоспособен. |
[Составьте обращение в службу поддержки](https://kz.center.yandex.cloud/support), указав:
* Идентификатор кластера.
* Идентификаторы последних операций, которые на нем выполнялись.
* Время по [графикам доступности](#monitoring-cluster), когда кластер перешел в состояние `DEAD`. ||
|| **UNKNOWN** | Состояние кластера неизвестно. |
[Составьте обращение в службу поддержки](https://kz.center.yandex.cloud/support), указав:
* Идентификатор кластера.
* Идентификаторы последних операций, которые на нем выполнялись.
* Время по [графикам доступности](#monitoring-cluster), когда кластер перешел в состояние `UNKNOWN`. ||
|#

### Статусы кластера {#cluster-status}

Статус | Описание | Предлагаемые действия
:--- | :--- | :---
**CREATING** | Идет подготовка к первому запуску | Подождите немного и приступайте к работе. Время создания кластера зависит от класса хостов.
**RUNNING** | Кластер работает в штатном режиме | Действий не требуется.
**STOPPING** | Кластер останавливается | Через некоторое время кластеру будет присвоен статус `STOPPED`, и он будет выведен из работы. Действий не требуется.
**STOPPED** | Кластер остановлен | Запустите кластер, чтобы вернуть его в работу.
**STARTING** | Остановленный ранее кластер запускается | Через некоторое время кластеру будет присвоен статус `RUNNING`. Подождите немного и приступайте к работе.
**UPDATING** | Обновляется конфигурация кластера | По завершении обновления кластеру будет присвоен статус, который был до обновления: `RUNNING` или `STOPPED`.
**ERROR** | Произошла ошибка при выполнении операции с кластером или во время окна технического обслуживания | Если кластер долго находится в этом статусе, [обратитесь в службу поддержки](https://kz.center.yandex.cloud/support). Доступность кластера можно определить по его состоянию.
**STATUS_UNKNOWN** | Кластер не может определить свой статус | Если кластер долго находится в этом статусе, [обратитесь в службу поддержки](https://kz.center.yandex.cloud/support).