返回
Control Barrier Function for Aligning Large Language Models
DOI:10.1109/TCST.2026.3675329.png)
摘要
En 中文
本文提出了一种基于控制的框架,用于通过利用控制 Barrier 函数(CBF)来对齐大型语言模型(LLMs),以确保生成用户期望的文本。所提出的框架将 CBF 安全滤波器应用于来自基准 LLM 的预测标记,以干预生成的文本。该安全滤波器具有两个显著优势:首先,该安全滤波器是附加类型,允许在不微调基准 LLM 的情况下用于对齐目的;其次,如果有关于期望对齐的评估模型,它可以直接应用于滤波器设计。整个文本生成系统使用开源语言模型实现,旨在生成积极文本。
Keyword:
Alignment
control barrier function (CBF)
large language models (LLMs)
safe control
期刊
IF:
3.9
论文数:
4.9K
被引数:
1.7W
机构
引用论文
暂无论文信息

