风险输入指令识别
实时检测并拦截用户输入中的恶意提示词。覆盖越狱与策略规避、系统指令篡改、角色诱导、间接注入,以及暴力、色情剥削、仇恨、欺诈等有害内容。命中后可直接拦截,也可按规则对隐私字段脱敏后继续调用模型。
适用开放域对话、AI 教育、智能客服、AIGC 创作平台
ShinyInfo AI Guardrail Gateway
输入先检 · 输出再拦 · Agent 也能防
圣一 AI 护栏网关部署在 AI 应用、AI Agent 与大模型之间,对用户输入、上传附件和模型输出做实时风险检测与主动防御。企业无需改业务代码,即可获得内容合规、隐私防护和提示词攻击免疫能力。
AGENT COMPATIBILITY
网关按入站协议识别请求,拦截、脱敏后仍返回客户端可解析的原生 JSON / SSE——不必为每个 Agent 改业务代码
Claude Code
Anthropic Messages(/v1/messages)
配置 ANTHROPIC_BASE_URL 指向网关
Codex CLI
OpenAI Responses(/v1/responses)
配置 Responses 兼容 Base URL
Kimi CLI
OpenAI Responses
配置 Responses 兼容 Base URL
Qwen Code
DashScope 原生或 OpenAI 兼容层
指向对应路由
DeepSeek Harness
Chat Completions / Responses / Anthropic
自定义 Provider 的 Base URL 指向网关
WorkBuddy
Chat Completions(/v1/chat/completions)
自定义模型 base_url 指向网关
走同一协议的其它编码助手(部分 IDE 插件、OpenAI 兼容 CLI)可随协议接入,无需单独适配。LangChain、Spring AI、n8n 等只要仍发 OpenAI 兼容 messages[],同样走标准路径。
CORE CAPABILITIES
圣一 AI 护栏网关(ShinyInfo AI Guardrail Gateway)不是事后审核后台,而是一条跑在流量路径上的安全网关:用户请求到达大模型之前先检测,模型回复到达用户之前再检测。
输入指令 → 上传附件 → 模型输出 → Agent 交互 全链路四段式防护
实时检测并拦截用户输入中的恶意提示词。覆盖越狱与策略规避、系统指令篡改、角色诱导、间接注入,以及暴力、色情剥削、仇恨、欺诈等有害内容。命中后可直接拦截,也可按规则对隐私字段脱敏后继续调用模型。
适用开放域对话、AI 教育、智能客服、AIGC 创作平台
对用户上传给 AI 处理的文档和图片做安全解析。支持 PDF、Word、Excel、TXT、CSV 及常见图片格式,可启用 OCR 识别扫描件文字,再对抽取文本做敏感信息与有害内容检测。
适用智能简历解析、合同问答、票据/证件识别、知识库构建
在模型输出到达用户前做最后一道过滤。拦截有害建议、露骨违规内容和可执行的违法指导;对身份证号、手机号、银行卡、邮箱、健康信息和企业机密等回显做脱敏或阻断。
适用客服、医疗辅助、金融问答、内容生产等所有对用户可见的生成式回复
为 AI Agent 和工具调用场景提供全链检测:不仅看用户最后一句话,也可检查多轮历史、工具返回和不可信文档中的隐蔽指令。每一次拦截、脱敏或放行都写入审计。
适用Claude Code / Codex / DeepSeek Harness / WorkBuddy、扣子与 Dify 等企业平台
PLATFORM
从插件扩展、路由策略到拦截率统计与日志追查,四项平台能力均可对照产品界面阅读
插件扩展
插件灵活化是圣一 AI 护栏网关的核心功能。通过插件可以实现各种业务逻辑和功能扩展:认证、限流、日志、监控等网关能力,以及内容安全、提示词护栏、注入检测、输出过滤等 AI 防护,都以插件形式提供。企业按路由启用、组合和配置,即可叠加安全策略、扩展网关能力。
网关能力
AI 防护
配置方式
路由策略
管理平台支持路由级安全策略配置,可按不同 AI 应用、模型上游和客户端类型设定独立的护栏规则。拦截、脱敏或仅审计均可按路由灵活配置,实现精细化的 AI 流量治理。
策略粒度
处置方式
上游模型
可视化治理
管理平台把过去 24 小时的请求量、成功率、拦截率和错误率放在同一屏,并给出时序趋势与成功/拦截/失败分布。运营不用翻日志,就能判断护栏是否在工作、流量是否正常。需要复查时,再从总览下钻到审计明细。
核心指标
趋势分析
下钻能力
从总览下钻到审计明细
日志审计
每一次请求的放行、拦截或脱敏都会留下记录,可按时间、客户端、接口和检测结果检索复查。除汇总指标外,还可按有害信息、敏感信息等类别查看拦截原因,并下钻到单条日志中的命中规则、原始输入和处置建议,满足安全运营与合规留痕。
检索维度
拦截原因
下钻详情
关于 AI 护栏定义、与内容审核区别、Prompt Injection 防护、Agent 客户端接入及部署方式的简要说明
AI 护栏是加在大模型应用前后的安全策略层,用来检测和处置违规输入、敏感数据和有害输出。圣一把它做成网关,应用侧几乎不用改代码。
内容审核平台多用于社区帖子、图片的事后或旁路审核。护栏网关在模型调用当时工作,能防提示词注入、越狱和 Agent 工具滥用,并按大模型协议返回结果。
能。产品提供专用提示词攻击检测,覆盖指令覆盖、越狱规避、系统提示词套取、间接注入和工具外泄诱导,并可与本地关键词规则叠加。
作为网关对接 OpenAI 兼容接口、Anthropic、Gemini、DashScope 等常见协议,也可对接到企业已有的模型代理。安全策略跟协议走,不绑死某一家模型。
支持。可按角色检测 user 与 tool 消息,检查完整对话历史,识别藏在文档或工具结果里的间接注入。
编码助手侧覆盖 Claude Code、Codex CLI、Kimi CLI、Qwen Code、DeepSeek Harness、WorkBuddy 及 OpenAI 兼容 CLI;企业平台侧覆盖扣子 Coze、Dify、FastGPT / MaxKB 等。机制是适配其使用的 API 协议,拦截时仍返回该协议可解析的结果。把客户端的 Base URL 指到网关即可。