ShinyInfo AI Guardrail Gateway

输入先检 · 输出再拦 · Agent 也能防

圣一 AI 护栏网关:生成式 AI 的内容安全防线

圣一 AI 护栏网关部署在 AI 应用、AI Agent 与大模型之间,对用户输入、上传附件和模型输出做实时风险检测与主动防御。企业无需改业务代码,即可获得内容合规、隐私防护和提示词攻击免疫能力。

  • 01
    输入先检: 拦截恶意指令、越狱尝试和敏感信息外泄
  • 02
    输出再拦: 过滤有害建议、违规生成内容和隐私回显
  • 03
    Agent 也能防: 适配 Claude Code、Codex CLI、Kimi、Qwen Code、DeepSeek Harness、WorkBuddy 及扣子、Dify、FastGPT 等客户端,检测多轮对话、工具返回与文档中的间接注入
AI 内容安全提示词注入防护LLM Guardrail私有化部署

AGENT COMPATIBILITY

多种 Agent 客户端,改地址即可接入

网关按入站协议识别请求,拦截、脱敏后仍返回客户端可解析的原生 JSON / SSE——不必为每个 Agent 改业务代码

编码助手 Claude Code · Codex · DeepSeek Harness · WorkBuddy

Claude Code

Anthropic Messages(/v1/messages)

配置 ANTHROPIC_BASE_URL 指向网关

Codex CLI

OpenAI Responses(/v1/responses)

配置 Responses 兼容 Base URL

Kimi CLI

OpenAI Responses

配置 Responses 兼容 Base URL

Qwen Code

DashScope 原生或 OpenAI 兼容层

指向对应路由

DeepSeek Harness

Chat Completions / Responses / Anthropic

自定义 Provider 的 Base URL 指向网关

WorkBuddy

Chat Completions(/v1/chat/completions)

自定义模型 base_url 指向网关

企业平台 扣子 · Dify · FastGPT · MaxKB

扣子 Coze Bot v3 抽取 additional_messages,支持对话 SSE
Dify Chat / Completion / Workflow,抽取 query、inputs.* 与 answer
FastGPT / MaxKB OpenAI 兼容层,随 Chat Completions 天然覆盖
Cherry Studio 等聚合客户端 按所选上游协议走对应抽取与拦截编码
OpenAI Chat CompletionsOpenAI ResponsesAnthropic MessagesGeminiDashScopeSSE 流式

走同一协议的其它编码助手(部分 IDE 插件、OpenAI 兼容 CLI)可随协议接入,无需单独适配。LangChain、Spring AI、n8n 等只要仍发 OpenAI 兼容 messages[],同样走标准路径。

CORE CAPABILITIES

四大核心防护能力

圣一 AI 护栏网关(ShinyInfo AI Guardrail Gateway)不是事后审核后台,而是一条跑在流量路径上的安全网关:用户请求到达大模型之前先检测,模型回复到达用户之前再检测。

输入指令 → 上传附件 → 模型输出 → Agent 交互 全链路四段式防护

01

风险输入指令识别

实时检测并拦截用户输入中的恶意提示词。覆盖越狱与策略规避、系统指令篡改、角色诱导、间接注入,以及暴力、色情剥削、仇恨、欺诈等有害内容。命中后可直接拦截,也可按规则对隐私字段脱敏后继续调用模型。

适用开放域对话、AI 教育、智能客服、AIGC 创作平台

02

风险输入附件识别

对用户上传给 AI 处理的文档和图片做安全解析。支持 PDF、Word、Excel、TXT、CSV 及常见图片格式,可启用 OCR 识别扫描件文字,再对抽取文本做敏感信息与有害内容检测。

适用智能简历解析、合同问答、票据/证件识别、知识库构建

03

风险生成内容识别

在模型输出到达用户前做最后一道过滤。拦截有害建议、露骨违规内容和可执行的违法指导;对身份证号、手机号、银行卡、邮箱、健康信息和企业机密等回显做脱敏或阻断。

适用客服、医疗辅助、金融问答、内容生产等所有对用户可见的生成式回复

04

风险交互审计与 Agent 防护

为 AI Agent 和工具调用场景提供全链检测:不仅看用户最后一句话,也可检查多轮历史、工具返回和不可信文档中的隐蔽指令。每一次拦截、脱敏或放行都写入审计。

适用Claude Code / Codex / DeepSeek Harness / WorkBuddy、扣子与 Dify 等企业平台

PLATFORM

可视化治理与全链路审计

从插件扩展、路由策略到拦截率统计与日志追查,四项平台能力均可对照产品界面阅读

插件扩展

插件灵活化,按需扩展护栏网关能力

插件灵活化是圣一 AI 护栏网关的核心功能。通过插件可以实现各种业务逻辑和功能扩展:认证、限流、日志、监控等网关能力,以及内容安全、提示词护栏、注入检测、输出过滤等 AI 防护,都以插件形式提供。企业按路由启用、组合和配置,即可叠加安全策略、扩展网关能力。

  • 安全插件链 协议适配 → 本地提示词护栏 → 注入检测 → 语义内容安全 → 文件处理 → 上游模型 → 输出护栏
  • 灵活组合 按路由启用、组合和配置,叠加安全策略、扩展网关能力
插件灵活化,按需扩展护栏网关能力
插件灵活化,按需扩展护栏网关能力产品界面:网关能力:认证、限流、日志、监控;AI 防护:内容安全、提示词护栏、注入检测、输出过滤;配置方式:按路由启用、热更新

网关能力

  • 认证
  • 限流
  • 日志
  • 监控

AI 防护

  • 内容安全
  • 提示词护栏
  • 注入检测
  • 输出过滤

配置方式

  • 按路由启用
  • 热更新

路由策略

路由级策略,精细化流量治理

管理平台支持路由级安全策略配置,可按不同 AI 应用、模型上游和客户端类型设定独立的护栏规则。拦截、脱敏或仅审计均可按路由灵活配置,实现精细化的 AI 流量治理。

  • 路由级策略 按 AI 应用、模型上游和客户端类型设定独立护栏规则
  • 多协议转发 请求按路由策略转发至开源或商业大模型,交互过程可拦、可放、可脱敏
路由级策略,精细化流量治理
路由级策略,精细化流量治理产品界面:策略粒度:路由级、客户端级;处置方式:拦截、脱敏、仅审计;上游模型:OpenAI、Anthropic、Gemini、DashScope 等

策略粒度

  • 路由级
  • 客户端级

处置方式

  • 拦截
  • 脱敏
  • 仅审计

上游模型

  • OpenAI
  • Anthropic
  • Gemini
  • DashScope 等

可视化治理

可视化治理,拦截率一目了然

管理平台把过去 24 小时的请求量、成功率、拦截率和错误率放在同一屏,并给出时序趋势与成功/拦截/失败分布。运营不用翻日志,就能判断护栏是否在工作、流量是否正常。需要复查时,再从总览下钻到审计明细。

  • 运营总览 请求量、成功率、拦截率、错误率时序趋势与分布
  • 三分类统计 成功 / 拦截 / 错误三分类统计,拦截率一目了然
可视化治理,拦截率一目了然
可视化治理,拦截率一目了然产品界面:核心指标:请求量、成功率、拦截率、错误率;趋势分析:时序趋势、成功/拦截/失败分布;下钻能力:从总览下钻到审计明细

核心指标

  • 请求量
  • 成功率
  • 拦截率
  • 错误率

趋势分析

  • 时序趋势
  • 成功/拦截/失败分布

下钻能力

从总览下钻到审计明细

日志审计

全链路日志审计,拦截可查、合规可证

每一次请求的放行、拦截或脱敏都会留下记录,可按时间、客户端、接口和检测结果检索复查。除汇总指标外,还可按有害信息、敏感信息等类别查看拦截原因,并下钻到单条日志中的命中规则、原始输入和处置建议,满足安全运营与合规留痕。

  • 全链路留痕 每一次放行、拦截或脱敏写入审计,日志可进入检索平台供安全运营复查
  • 多维检索 按时间、客户端、接口和检测结果检索,按有害信息、敏感信息等类别查看拦截原因
全链路日志审计,拦截可查、合规可证
全链路日志审计,拦截可查、合规可证产品界面:检索维度:时间、客户端、接口、检测结果;拦截原因:有害信息、敏感信息等类别;下钻详情:命中规则、原始输入、处置建议

检索维度

  • 时间
  • 客户端
  • 接口
  • 检测结果

拦截原因

  • 有害信息
  • 敏感信息等类别

下钻详情

  • 命中规则
  • 原始输入
  • 处置建议

常见问题

关于 AI 护栏定义、与内容审核区别、Prompt Injection 防护、Agent 客户端接入及部署方式的简要说明

什么是 AI 护栏(AI Guardrail)?

AI 护栏是加在大模型应用前后的安全策略层,用来检测和处置违规输入、敏感数据和有害输出。圣一把它做成网关,应用侧几乎不用改代码。