指标 s
schema_change_mem_bytes
- 单位:字节
- 描述:Schema Change使用的内存。
segment_flush_queue_count
- 单位:计数
- 描述:segment flush线程池中排队的任务数量。
segment_metadata_mem_bytes
- 单位:字节
- 描述:segment元数据使用的内存。
segment_read
- 单位:计数
- 描述:segment读取总数。
segment_replicate_queue_count
- 单位:计数
- 描述:Segment Replicate线程池中排队的任务数量。
segment_zonemap_mem_bytes
- 单位:字节
- 描述:segment zonemap使用的内存。
short_key_index_mem_bytes
- 单位:字节
- 描述:短键索引使用的内存。
small_file_cache_count
- 单位: 计数
- 描述: 小文件缓存的数量。
spill_disk_bytes_used
- 单位: 字节
- 标签:
storage_type - 描述: 所有溢出存储目录当前已占用的磁盘字节数。
storage_type=local汇总 BE 溢出DirManager管理的每个目录中正在使用的字节数。storage_type=remote为对称保留,当前始终为 0,因为远端溢出存储由单独的查询实例各自管理,没有全局的聚合数据。
spm_baseline_count
- 单位:个
- 类型:瞬时值
- 描述:FE Leader 上当前全局 SQL Plan Management(SPM)基线的数量。
spm_capture_candidate_total
- 单位:个
- 类型:累积值
- 标签:
result(captured、skipped_duplicate、skipped_table_count、skipped_table_missing、skipped_db_missing、skipped_pattern_mismatch或failed) - 描述:SPM Auto-Capture 候选处理结果的总次数。不同标签值表示查询历史中的候选 SQL 在自动捕获流程中的不同归类结果。
spm_rewrite_total
- 单位:个
- 类型:累积值
- 标签:
result(hit、miss或error) - 描述:SPM 改写尝试结果的总次数。
hit表示成功匹配并应用了基线,miss表示执行了改写流程但没有命中可用基线,error表示 SPM 改写过程中发生异常并回退到原始查询。
snmp
- 单位: -
- 描述:
/proc/net/snmp返回的指标。
starrocks_be_clone_task_copy_bytes
- 单位: 字节
- 类型: 累积
- 描述: BE 节点中 Clone 任务复制的总文件大小,包括 INTER_NODE 和 INTRA_NODE 类型。
starrocks_be_clone_task_copy_duration_ms
- 单位: 毫秒
- 类型: 累积
- 描述: BE 节点中 Clone 任务复制消耗的总时间,包括 INTER_NODE 和 INTRA_NODE 类型。
starrocks_be_exec_state_report_active_threads
- 单位: 计数
- 类型: 瞬时
- 描述: 报告 Fragment 实例执行状态的线程池中正在执行的任务数量。
starrocks_be_exec_state_report_queue_count
- 单位: 计数
- 类型: 瞬时
- 描述: 报告 Fragment 实例执行状态的线程池中排队的任务数量,最多 1000 个。
starrocks_be_exec_state_report_running_threads
- 单位: 计数
- 类型: 瞬时
- 描述: 报告 Fragment 实例执行状态的线程池中的线程数量,最少 1 个,最多 2 个。
starrocks_be_exec_state_report_threadpool_size
- 单位: 计数
- 类型: 瞬时
- 描述: 报告 Fragment 实例执行状态的线程池中的最大线程数量,默认为 2。
starrocks_be_files_scan_num_bytes_read
- 单位: 字节
- 描述: 从外部存储读取的总字节数。标签:
file_format,scan_type。
starrocks_be_files_scan_num_files_read
- 单位: 计数
- 描述: 从外部存储读取的文件数量 (CSV, Parquet, ORC, JSON, Avro)。标签:
file_format,scan_type。
starrocks_be_files_scan_num_raw_rows_read
- 单位: 计数
- 描述: 在格式验证和谓词过滤之前从外部存储读 取的总原始行数。标签:
file_format,scan_type。
starrocks_be_files_scan_num_rows_return
- 单位: 计数
- 描述: 谓词过滤后返回的行数。标签:
file_format,scan_type。
starrocks_be_files_scan_num_valid_rows_read
- 单位: 计数
- 描述: 读取的有效行数(不包括格式无效的行)。标签:
file_format,scan_type。
starrocks_be_lake_tablet_metadata_get_not_found_total
- 单位: 计数
- 类型: 累积值
- 描述: 仅存算分离模式。从远程存储读取 Lake Tablet 元数据时返回
NotFound的尝试总数。Tablet 元数据要么存放在其独立的元数据文件中,要么存放在 Bundle 元数据文件中,二者必居其一且不会同时存在;对这两种位置的读取 均会计入该指标,包括 Vacuum 流程发起的 Bundle 文件读取。每次失败的回退读取均会单独计数。缓存未命中和读取成功不会增加该指标。复制流程中对源集群元数据的读取、以及恢复流程中对快照元数据的读取不计入该指标。
starrocks_be_mem_pool_mem_limit_bytes
- 单位: 字节
- 类型: 瞬时
- 描述: 每个内存池的内存限制,以字节为单位。
starrocks_be_mem_pool_mem_usage_bytes
- 单位: 字节
- 类型: 瞬时
- 描述: 每个内存池当前使用的总内存,以字节为单位。
starrocks_be_mem_pool_mem_usage_ratio
- 单位: -
- 类型: 瞬时
- 描述:内存池的内存使用量与内存池的内存限制之比。
starrocks_be_mem_pool_workgroup_count
- 单位:计数
- 类型:瞬时
- 描述:分配给每个内存池的资源组数量。
starrocks_be_pipe_prepare_pool_queue_len
- 单位:计数
- 类型:瞬时
- 描述:管道准备线程池任务队列长度的瞬时值。
starrocks_be_priority_exec_state_report_active_threads
- 单位:计数
- 类型:瞬时
- 描述:报告Fragment实例最终执行状态的线程池中正在执行的任务数量。
starrocks_be_priority_exec_state_report_queue_count
- 单位:计数
- 类型:瞬时
- 描述:报告Fragment实例最终执行状态的线程池中排队等待的任务数量,最大值为2147483647。
starrocks_be_priority_exec_state_report_running_threads
- 单位:计数
- 类型:瞬时
- 描述:报告Fragment实例最终执行状态的线程池中的线程数量,最小值为1,最大值为2。
starrocks_be_priority_exec_state_report_threadpool_size
- 单位:计数
- 类型:瞬时
- 描述:报告Fragment实例最终执行状态的线程池中的最大线程数量,默认为2。
starrocks_be_resource_group_cpu_limit_ratio
- 单位:-
- 类型:瞬时
- 描述:资源组CPU配额比的瞬时值。
starrocks_be_resource_group_cpu_use_ratio
- 单位:-
- 类型:平均
- 描述:资源组使用的CPU时间与所有资源组CPU时间之比。
starrocks_be_resource_group_mem_inuse_bytes
- 单位:字节
- 类型:瞬时
- 描述:资源组内存使用量的瞬时值。
starrocks_be_resource_group_mem_limit_bytes
- 单位:字节
- 类型:瞬时
- 描述:资源组内存配额的瞬时值。
starrocks_be_segment_file_not_found_total
- 单位:计数
- 描述:在段打开期间未找到段文件(文 件丢失)的总次数。持续增加的值可能表示数据丢失或存储不一致。
starrocks_be_staros_shard_info_fallback_total
- 单位:计数
- 类型:累积
- 描述:仅存算分离模式。BE 的 StarOSWorker 因本地缓存中没有所需的 shard 信息(即 FE 在查询 / 合并 / lake 操作引用该 shard 之前尚未将其推送到该 BE)而实际向 starmgr 发起的 RPC(
g_starlet->get_shard_info())总次数。仅在 starlet 就绪检查通过且 RPC 实际发出后才计入;starlet 尚未就绪的超时不包含在内。正常情况下该值应接近零。持续或上升的速率是一个强烈信号,表明 FE 端的任务或节点选择正把任务调度到尚未拥有该 shard 的 BE,或者 FE 端的 shard 推送存在滞后。建议告警:单个 BE 在 5 分钟窗口内的速率过高。
starrocks_be_staros_shard_info_fallback_failed_total
- 单位:计数
- 类型:累积
- 描述:仅存算分离模式。
starrocks_be_staros_shard_info_fallback_total中 starmgr RPC 返回非 OK 状态的子集。可使用比率failed_total / fallback_total将 starmgr 的瞬时错误与正常 的成功回退区分开来进行告警。
starrocks_be_staros_shard_count
- 单位:计数
- 类型:瞬时值
- 描述:仅存算分离模式。当前分配给该 BE 的 StarOSWorker 的 shard 数量(即 worker 本地 shard 表的大小)。该值在
StarOSWorker::add_shard与StarOSWorker::remove_shard内同步写入(mutation 时推送),不是在指标采集时重新计算;因此采集到的值反映的是最近一次 shard 表的变更结果。BE 关闭时该 gauge 不会被清零,会保留到下一次发生 mutation 为止。可用于观测各 BE 之间的 shard 分布均衡情况,并发现与 FE 端调度结果的偏差。
starrocks_fe_alter_duration_ms
- 单位:毫秒
- 类型:摘要
- 标签:
execution_mode(fse、legacy_fse或rewrite)、is_leader - 描述:应用一次 ALTER TABLE 变更的耗时(毫秒),按语句统计。仅由 Leader FE 上报(
is_leader="true")。包含 0.75、0.95、0.98、0.99、0.999 分位数及_sum、_count。execution_mode标签表示变更的应用方式:fse:当前的 Fast Schema Evolution(FSE),在语句执行期间 立即完成。legacy_fse:旧版 FSE 路径,在后台执行,通常慢得多。仅出现在存算分离集群且表未开启cloud_native_fast_schema_evolution_v2时(默认开启,此时走fse)。rewrite:该变更需要物理重写表数据(例如修改列类型),同样在后台执行。
starrocks_fe_alter_operation_total
- 单位:计数
- 类型:累积
- 标签:
type(add_column、drop_column或modify_column)、is_leader - 描述:ALTER TABLE 列操作的次数,按类型统计。一条语句可以包含多个操作——例如
ADD COLUMN a, DROP COLUMN b——每个操作按其类型分别计数。重命名、调整列顺序以及仅修改注释不计入。仅由 Leader FE 上报(is_leader="true")。
starrocks_fe_clone_task_copy_bytes
- 单位:字节
- 类型:累积
- 描述:集群中Clone任务复制的总文件大小,包括INTER_NODE和INTRA_NODE类型。
starrocks_fe_clone_task_copy_duration_ms
- 单位:毫秒
- 类型:累积
- 描述:集群中Clone任务消耗的总复制时间,包括INTER_NODE和INTRA_NODE类型。
starrocks_fe_clone_task_success
- 单位:计数
- 类型:累积
- 描述:集群中成功执行的克隆任务数量。
starrocks_fe_clone_task_total
- 单位:计数
- 类型:累积
- 描述:集群中克隆任务的总数。
starrocks_fe_last_finished_job_timestamp
- 单位:毫秒
- 类型:瞬时
- 描述:表示特定仓库下最后一次查询或加载的结束时间。对于存算一体集群,此项仅监控默认仓库。
starrocks_fe_max_journal_replay_lag
- 单位:计数
- 类型:瞬时
- 描述:所有存活的 Follower 或 Observer FE 中,为追上 Leader 仍需回放的元数据日志的最大条数。仅由 Leader FE 上报(
is_leader="true"),因为只有 Leader 同时知道自身的日志写入位置以及通过心跳获取的其他各节点已回放的日志 ID。非存活的 FE 节点会被排除,因为它们最后上报的日志 ID 停留在最后一次成功心跳时的值;此类节点请通过SHOW FRONTENDS的Alive列来发现。当其他节点均已追上、没有其他存活的 FE 节点,以及单 FE 集群时,该值为0。该值较高或持续增长,说明至少有一个节点的元数据回放已落后,将导致该节点提供陈旧的元数据,并在超过meta_delay_toleration_second后把查询转发给 Leader。
starrocks_fe_memory_usage
- 单位:字节或计数
- 类型:瞬时
- 描述:表示特定仓库下各种模块的内存统计信息。对于存算一体集群,此项仅监控默认仓库。
starrocks_fe_meta_log_count
- 单位:计数
- 类型:瞬时
- 描述:没有检查点的编辑日志数量。
100000范围内的值被认为是合理的。
starrocks_fe_publish_version_daemon_loop_total
- 单位:计数
- 类型:累积
- 描述:此FE节点上
publish-version-daemon循环的总运行次数。
以下指标是summary类型的指标,提供事务不同阶段的延迟分布。这些指标仅由Leader FE节点报告。
每个指标包括以下输出:
- 分位数:不同百分位边界的延迟值。这些通过
quantile标签公开,其值可以是0.75、0.95、0.98、0.99和0.999。 <metric_name>_sum:此阶段花费的总累积时间,例如starrocks_fe_txn_total_latency_ms_sum。<metric_name>_count:此阶段记录的事务总数,例如starrocks_fe_txn_total_latency_ms_count。
所有事务指标共享以下标签:
type:按加载作业源类型(例如,all、stream_load、routine_load)对事务进行分类。这允许监控整体事务性能和特定加载类型的性能。报告组可以通过FE参数配置txn_latency_metric_report_groups。is_leader:指示报告的FE节点是否为Leader。只有Leader FE (is_leader="true") 报告实际指标值。Follower将具有is_leader="false"并报告无数据。
starrocks_fe_query_resource_group
- 单位:计数
- 类型:累积
- 描述:表示在特定资源组下执行的查询总数。
starrocks_fe_query_resource_group
- 单位:计数
- 类型:累积
- 描述:每个资源组的查询数量。
starrocks_fe_query_resource_group_err
- 单位:计数
- 类型:累积
- 描述:表示在特定资源组下失败的查询数量。
starrocks_fe_query_resource_group_err
- 单位:计数
- 类型:累积
- 描述:每个资源组的错误查询数量。
starrocks_fe_query_resource_group_latency
- 单位:毫秒
- 类型:累积
- 描述:表示特定资源组下查询的延迟统计信息。
starrocks_fe_query_resource_group_latency
- 单位:秒
- 类型:平均
- 描述:每个资源组的查询延迟百分位数。
starrocks_fe_routine_load_error_rows
- 单位:计数
- 描述:所有例行加载作业在数据加载过程中遇到的错误行总数。
starrocks_fe_routine_load_jobs
-
单位:计数
-
描述:处于不同状态的例行加载作业总数。例如:
starrocks_fe_routine_load_jobs{state="NEED_SCHEDULE"} 0
starrocks_fe_routine_load_jobs{state="RUNNING"} 1
starrocks_fe_routine_load_jobs{state="PAUSED"} 0
starrocks_fe_routine_load_jobs{state="STOPPED"} 0
starrocks_fe_routine_load_jobs{state="CANCELLED"} 1
starrocks_fe_routine_load_jobs{state="UNSTABLE"} 0
starrocks_fe_routine_load_max_lag_of_partition
- 单位:-