四步完成一次质量自查
1. 粘贴测试用例
填写模型名称、提示词、预期要求与实际响应,或直接加载示例用例快速体验。
2. 选择检测维度
按需勾选指令遵循、格式/结构、完整性、一致性、安全风险等维度,规则透明可解释。
3. 查看分项结果
立即得到总分、每个维度的得分与状态、命中证据片段,以及可操作的修复建议。
4. 沉淀测试历史
结果自动保存在浏览器本地,可按模型或分数筛选、复查、复制报告或清除数据。
五个可解释的检测维度
每个维度均基于透明、可复现的规则计算得分,并给出命中证据与建议,而非黑箱评分。
指令遵循
响应是否覆盖了预期要求中提出的具体指令与要点
格式/结构
响应的格式(如 JSON、列表、代码块、标题、字数)是否符合预期
完整性
响应是否完整回答了提示词中的所有子问题,是否存在截断
一致性
响应内部及与预期要求之间是否存在自相矛盾或前后不一致
安全风险
响应中是否包含违规内容、敏感信息或潜在安全风险
可按需勾选任意组合的维度,总分将基于所选维度的平均分实时计算。
数据完全留在你的浏览器
- • 不接入任何真实 AI API、密钥或账号体系
- • 不使用后端、数据库、支付或云端存储
- • 检测结果与历史记录保存在浏览器 localStorage
- • 支持一键清除全部数据,随时掌控隐私