EXPLORE / 06
术语索引
AI 与软件开发中的专用名词及其说明
RECORDS
实体记录
70 条记录 · 1/2
- 001
熔断降级
熔断降级(Circuit Breaker Fallback)是分布式 Agent 路由中的高可用防御机制,当慢轨大模型调用发生超时(如 > 600ms)或错误率超标时,立即切断外部阻塞调用并自动移交至通用兜底 Agent 处理。
官网待补 - 002
特异度评分
特异度评分(Specificity Scoring)是解决多条规则同时命中冲突的加权仲裁算法,依据正则表达式长度、复合条件嵌套深度与约束强度计算分值,确保精细化业务规则优先胜出。
官网待补 - 003
评估图
评估图(Evaluation Graph)是在意图慢轨中用于消解复杂长尾意图的有向评估图,结合语义向量聚类、上下文依赖分析与多目标加权打分,协同推导出带有置信度的最优执行分支。
官网待补 - 004
双轨制路由
双轨制路由(Dual-Track Routing)是一种结合了确定性规则快轨(Fast-Path)与多维大模型评估图慢轨(Slow-Path)的 Agent 混合分流架构,兼顾高频场景的极速低成本响应与复杂模糊场景的高鲁棒性决策。
官网待补 - 005
FastIntent
快速意图(FastIntent)是 AI Agent 中的确定性快轨分流机制,通过前缀、正则表达式、上下文元数据与会话状态等纯函数算子在网关层进行毫秒级原子校验,命中后直接拉起经验或预置脚本执行,实现 0-Token 的极速响应。
官网待补 - 006
自愈调试
自愈调试(Self-Debugging)是指 Agent 根据代码执行器返回的 Traceback 异常堆栈信息,自主分析报错根因并重新生成修复代码的闭环纠错机制,显著提升多步任务的自主执行成功率。
官网待补 - 007
上下文屏蔽
上下文屏蔽(Context Shielding)是一种在 Code-as-Action 范式下降低 Token 消耗的优化策略。海量中间数据直接保留在代码沙箱的内存中,仅将汇总统计或过滤后的必要结果返回至 Prompt 上下文,避免挤爆上下文窗口。
官网待补 - 008
REPL 沙箱
REPL 沙箱(REPL Sandbox)是为 Agent 提供代码解释执行的隔离运行时环境。它支持跨多轮交互的状态与变量持久化,同时具备内存配额、执行超时、系统调用过滤与网络出口安全防护机制。
官网待补 - 009
Code-as-Action
代码即动作(Code-as-Action,CodeAct)是将 Agent 的工具调用与控制逻辑统一建模为可执行 Python 代码并在沙箱 REPL 中运行的 Agent 架构范式。相较于传统单步 JSON 工具调用,它原生支持循环、条件分支、变量内存传递与自愈调试。
官网待补 - 010
Embedding 模型
Embedding 模型是能够将离散文本或多模态输入编码映射为连续高维实向量的神经网络模型。向量在特征空间中的几何距离直接反映了对应文本语义的相关程度。
官网待补 - 011
文本切分器
文本切分器(Text Splitter)负责将长文档拆解为具有独立语义的 Chunk。相较于按字符固定截断,层级或递归切分策略能更好地保留上下文结构与标量元数据。
官网待补 - 012
文档加载器
文档加载器(Document Loader)是屏蔽异构数据源格式差异的软件封装器。它能将 PDF、Markdown、JSON 以及第三方 API/数据库内容解析并统一标准化为包含文本与元数据的文档对象。
官网待补 - 013
向量数据库
向量数据库(Vector Database)是专为存储、索引和高效检索高维向量表征(Embedding)而设计的专用数据引擎。通过近似最近邻(ANN)算法与向量距离度量,在低延迟下实现 Top-K 相似度召回。
官网待补 - 014
Evaluation Harness
评测底盘,用于自动化评测智能体决策与工具调用能力的基准驱动平台,提供用例注入、环境隔离、多轮交互记录与自动化断言评分。
官网待补 - 015
Agent Harness
智能体运行底盘,包裹在 Agent 认知大脑外围的确定性宿主脚手架与控制面,管理沙箱环境生命周期、工具网关鉴权拦截、状态持久化快照与资源熔断。
官网待补 - 016
上下文缓存
上下文缓存(Context Caching)是指服务端将长提示词(System Prompt、代码库或长文档)计算得到的 KV Cache 在显存或内存中持久化保存的技术。当后续请求复用相同前缀上下文时,无需重新计算注意力矩阵,从而大幅降低首 Token 延迟(TTFT)与计算成本。
官网待补 - 017
长程任务
长程任务(Long-Horizon Task)是指需要 AI 系统跨越较长时间跨度、执行数十至数百步连续动作、维护中间状态并自主处理环境异常的复杂目标任务。区别于单轮对话,长程任务要求模型具备深度的规划能力、稳定的上下文记忆与自我纠错机制。
官网待补 - 018
TPOT
单 Token 生成延迟(Time Per Output Token,TPOT)指模型在输出首个 Token 后的自回归生成阶段中,平均生成每个后续 Token 所花费的时间(通常以毫秒为单位),其倒数对应单请求生成速度(Tokens/s)。TPOT 主要受模型参数量、KV Cache 内存带宽、量化计算效率与批处理并发度制约。
官网待补 - 019
TTFT
首 Token 延迟(Time to First Token,TTFT)指大模型推理服务从接收到客户端请求,到完成 Prompt 上下文 Prefill 计算并输出第一个生成 Token 所经历的端到端耗时。TTFT 主要受输入 Prompt 长度、计算并行度、Prefix Cache 命中率及排队等待时间影响,是衡量交互式应用首屏体感响应速度的关键指标。
官网待补 - 020
连续批处理
连续批处理(Continuous Batching / Iteration-level Scheduling)是现代 LLM 推理引擎(如 vLLM、TGI)的核心调度机制。不同于传统按请求粒度等待全 Batch 结束的静态批处理,连续批处理在每个生成迭代(Token Step)动态插入新到达的请求并移出已完成生成的请求,消除不同生成长度造成的 GPU 算力闲置,极大提升吞吐量。
官网待补 - 021
模型路由
模型路由(Model Routing / Dynamic LLM Routing)在多模型服务网关层根据入站任务的推理复杂度、安全风险等级、上下文长度、实时各供应商延迟健康度与财务预算,动态将请求分流至最适宜的模型(如将简单分类派发给轻量小模型,将复杂代码与长链推理派发给前沿推理模型),以实现系统性能、准确率与成本的最优平衡。
官网待补 - 022
模型量化
模型量化(Model Quantization)将大模型的权重矩阵或激活张量从高精度浮点数(如 FP32、FP16、BF16)转换为低位宽定点数表示(如 INT8、INT4、AWQ、GPTQ 或 GGUF),在保持可接受下游任务精度的前提下成倍压缩显存占用并提升计算吞吐。量化后的模型必须在目标任务与工具调用准确率上重新进行全面评测。
官网待补 - 023
Prefix Cache
前缀缓存(Prompt Prefix Caching)指推理服务引擎(如 vLLM、SGLang)在显存中缓存跨请求共享的静态 Prompt 前缀(如长系统提示词、固定工具 Schema 注册表或 RAG 公共背景)对应的 KV 状态。当新请求命中相同前缀时可直接复用计算结果,大幅缩短首 Token 响应时间(TTFT)并节省算力。
官网待补 - 024
KV Cache
键值缓存(Key-Value Cache,KV Cache)在大模型自回归解码(Autoregressive Decoding)过程中,将已计算历史 Token 的注意力键(Key)和值(Value)张量持久保存在显存中,避免每个新生成 Token 都对历史全量上下文进行重复前向计算。KV Cache 显著降低推理延迟,但随并发量与上下文长度呈线性增长,成为显存容量的主要瓶颈。
官网待补 - 025
灾难性遗忘
灾难性遗忘(Catastrophic Forgetting)指神经网络在特定下游数据集上进行微调或持续学习时,由于权重发生大幅更新,导致其在先前掌握的通用知识、推理逻辑或代码能力上发生急剧退化或丧失的现象。在 Agent 微调中,通常通过混入通用与安全数据、采用 LoRA 等参数高效方法以及建立通用回归评测集来预防。
官网待补 - 026
Agentic RL
智能体强化学习(Agentic Reinforcement Learning,Agentic RL)将强化学习优化目标从单轮文本生成扩展至多步骤环境交互与动作轨迹(Trajectory)。它依据 Agent 在沙箱或真实环境中的任务最终成功率、工具调用有效性、执行步数及环境反馈计算奖励,直接优化 Agent 的长链条规划、工具选择与自我纠错策略。
官网待补 - 027
RLHF
基于人类反馈的强化学习(Reinforcement Learning from Human Feedback,RLHF)通过收集人类对模型输出的偏好对比数据训练奖励模型(Reward Model),并利用 PPO 等强化学习算法优化策略网络,以最大化生成奖励同时惩罚与基线模型的 KL 散度。它广泛用于提升前沿模型的通用推理、多轮对话与安全对齐能力。
官网待补 - 028
DPO
直接偏好优化(Direct Preference Optimization,DPO)是一种跳过显式奖励模型构建与强化学习采样的模型对齐算法。它直接利用同一 Prompt 下的偏好与拒绝响应对(Chosen/Rejected Pairs),通过解析推导的闭式损失函数直接优化策略模型,使模型输出更符合人类偏好的风格、语气、简洁度与安全拒答边界。
官网待补 - 029
QLoRA
量化低秩适配(Quantized Low-Rank Adaptation,QLoRA)在 LoRA 基础上,将冻结的底座模型权重压缩为 4 位精度(如 NF4 数据类型),并通过双重量化与分页优化器进一步削减显存峰值,使得在单张消费级 GPU 上微调百亿参数大模型成为可能。训练时梯度反向传播仍以高精度(FP16/BF16)更新 LoRA 适配层。
官网待补 - 030
LoRA
低秩适配(Low-Rank Adaptation,LoRA)是一种参数高效微调(PEFT)技术。它冻结预训练模型的全部骨干权重,仅在注意力投影或全连接层旁路引入两个低秩可训练矩阵(A 与 B,满足 rank ≪ d),大幅降低训练显存占用与优化器状态开销。LoRA 允许在单套底座模型上针对不同业务场景热插拔多个轻量适配器。
官网待补 - 031
SFT
监督微调(Supervised Fine-Tuning,SFT)使用高质量的输入提示词与理想标准回答示例对(Prompt-Response Pairs),通过交叉熵损失优化预训练大模型的参数权重,使其精确模仿目标任务的输出格式、专业术语表达并提高指令遵循能力。在 Agent 架构中,SFT 常用于将复杂分类、信息提取或结构化工具调用协议蒸馏至轻量小模型中。
官网待补 - 032
角色身份漂移
角色身份漂移(Character Identity Drift)是指在长视频或多镜头生成过程中,同一人物的面部特征、发型、体态或服装细节随时间帧推进而逐渐发生形变或不一致的现象。这是长序列视频生成模型在上下文记忆与跨帧注意力衰减时的常见技术瓶颈。
官网待补 - 033
局部视频编辑
局部视频编辑(Local Video Editing)是指在已有视频片段的基础上,限定时间戳区间或空间遮罩(Mask),对背景、道具或人物属性进行定向修改的技术。该方法能够锁定未编辑区域的时序一致性与运动节奏,避免全段重新渲染带来的高昂计算成本与画面抖动。
官网待补 - 034
多模态参考
多模态参考(Multimodal Reference)是指在视频生成过程中,同时引入图像、视频、音频或 3D 白模等多种媒介形式作为条件引导(Conditioning)。该技术通过交叉注意力机制提取参考素材的身份、姿态、风格与时序特征,以实现对生成画面的高精度控制。
官网待补 - 035
Autonomous Execution
自主执行(Autonomous Execution)指 Agent 在预设的最大步数与权限控制边界内,无需人工按步干预而自主完成规划、调用工具与判断停止条件的闭环运行方式。它与 Human-in-the-Loop 互为补充,构成了 Agent 系统的动态运行区间。
官网待补 - 036
InMemorySaver
内存检查点(InMemorySaver)是 LangGraph 中基于内存字典实现的轻量级 Checkpointer。它在进程生命周期内保存状态快照,用于本地开发、单元测试与临时 demo 快速验证,但在服务重启后状态即丢失,不能直接作为生产环境的持久化方案。
官网待补 - 037
Trajectory Evaluation
轨迹评估(Trajectory Evaluation)是一种超越单一终点答案的 Agent 评测方法,重点审计 Agent 在执行过程中的工具选择合理性、参数精准度、步骤数量、死循环频率与越权行为。通过对比黄金轨迹(Golden Trajectory),能及时发现 Agent 的低效冗余动作。
官网待补 - 038
Time Travel Replay
时间回放(Time Travel Replay)利用 Checkpointer 保存的历史状态快照,将 Agent 重置回先前的任意执行节点,修改状态或分支路径后重新分叉(Fork)运行。它常用于生产事故故障排查、A/B 逻辑分支对照测试与调试人工修正介入。
官网待补 - 039
Deterministic Boundary
确定性安全边界(Deterministic Boundary)指在 Agent 架构中将模型决策与系统确定性代码明确分隔的技术边界。模型仅获权建议下一步意图或生成候选文本,而身份鉴权、敏感权限、金额上限、Schema 校验与重试规则必须强制由硬编码逻辑控制,拦截非预期行为。
官网待补 - 040
Human-in-the-Loop
人工介入机制(Human-in-the-Loop,HITL)在 Agent 触发高风险动作(如资金转账、代码部署、写数据库或删除敏感数据)时中断自动控制流,将结构化状态呈现给人工审查者,待接收显式批准或修正参数后再恢复执行,防止模型越权或误操作。
官网待补