LY
LIU YIPENGliuyipeng.com · 已备案
返回作品入口

EVIDENCE-DRIVEN AGENTS / 证据驱动智能体

不只会回答,
还要调用、验证、恢复

两个 AI Agent(人工智能体)项目覆盖实时游戏运维与长时事件研究,并提供两支可直接播放的普通话配音演示。每个结论都有工具证据,每个关键动作都有权限边界,每次运行都有可复验轨迹。

120/120 确定性评测 100% 引用有效率7,522 次模型角色运行 2 支完整配音演示
agent://evidence-runLIVE TRACE
GOAL定位奖励到账提示异常,并给出可复验结论
  1. 01

    ASSESS分类事故与风险边界

    DONE
  2. 02

    RETRIEVE检索运行手册与历史证据

    7 SOURCES
  3. 03

    CALL TOOLS查询资源快照与奖励流水

    VERIFIED
  4. 04

    EVALUATE校验引用、哈希与结论

    PASS
RESULTSUCCESS · confidence 0.94

AI AGENT LAB / 智能体实验室

把模型放进可恢复、可验证的工程流程。

两个智能体项目,分别解决实时运维诊断与长时事件研究。

A / GAMEOPS AGENT

游戏运维证据智能体

在 Go 权威游戏后端之上增加可审计的智能运维控制面:接入事故、调用真实工具、检索运行手册、形成带引用诊断;任何高风险写操作都停在人工审批点之后。

PythonFastAPILangGraphMCPQdrantOllamaKubernetes
120/120
确定性评测
100%
引用有效率
710
当前可校验知识块
340/340
调查 V3 重复运行
gameops / run_20260806_042COMPLETED
INCIDENT玩家奖励流水已经生成,但客户端提示资源未到账。
  1. 01
    事件接入

    JetStream 将重复告警收敛到同一运行。

    DONE
  2. 02
    有界调查

    LangGraph 根据首轮证据选择第二批工具并确定停止原因。

    DONE
  3. 03
    权威查询

    MCP 读取资源、行军、支付、Outbox、奖励流水和 GM 审计。

    DONE
  4. 04
    证据检索

    混合召回与领域重排保留路径、行号和内容哈希。

    DONE
  5. 05
    结论门禁

    伪造引用或证据缺失会直接使运行失败。

    DONE
  6. 06
    人工审批

    补偿与支付重发绑定 dry-run、参数哈希、审批人和幂等键。

    REVIEW
DIAGNOSIS / 置信度 94%资产已经入账;异常位于 resource.changed 通知重放链路。7 条工具证据 · 引用哈希全部通过

DEMO 01 / INCIDENT TO RECOVERY

从支付权益缺口,到一次性幂等补发

03:16 · 720p 网页版 · 普通话配音 · 中文字幕

本地真实故障演练:两轮自适应调查、运行手册引用、dry-run、参数哈希、人工审批与 exactly-once 恢复形成完整闭环。

下载 MP4
真实模型与检索证据 展开证据

真实 BGE Embedding(嵌入模型)路径的 Recall@5 / MRR / nDCG@5 为 0.7333 / 0.7792 / 0.6813。RTX 4070 本地运行量化 qwen3:8b,固定事故冷启动 51.79 秒、热运行 8.21 秒;这些数据只对应固定评测口径,不外推为生产 SLA(服务等级协议)。

权限、审批与恢复 展开边界

MCP(模型上下文协议)提供 11 个只读工具和 2 个审批写工具。资源通知、行军停滞、支付权益与 Outbox 积压分别走证据驱动路径;V3 的 17 个案例各重复 20 次,340/340 通过。真实 PostgreSQL 演练会制造持久行军调度漂移和事件重试积压;支付补发在 dry-run 中核对订单归属与奖励账本,再由短期签名票据执行订单级幂等重发。

B / EVENT RESEARCH AGENT

事件研究智能体

面向 A 股公告事件研究,把采集、事实提取、独立复核、样本冻结、历史模拟和策略审查组织成长时任务。收益数据与候选生成隔离,防止未来信息进入历史样本。

TypeScriptNode.jsSQLiteCodexMCPOpenTelemetry
7,522
模型角色运行
13,597
持久任务
172
自动化测试
10/10
稳定性样本
EVENT RESEARCH PIPELINEREAL TRADING OFF
  1. 01
    采集

    来源、事件时间、可见时间同时保存

  2. 02
    提取

    模型只输出受约束的结构化事实

  3. 03
    复核

    独立角色分别给出证据与反证

  4. 04
    冻结

    候选队列与评测样本进入后不可变

  5. 05
    回测

    口径固定;不可执行时主动停止

双时间证据事件时间 / 可见时间

冻结样本进入评测后不可变

独立反证同一角色不自我批准

DEMO 02 / EVIDENCE TO PORTFOLIO GATE

让研究智能体在证据不足时可靠停下

05:09 · 720p 网页版 · 普通话配音 · 中文字幕

使用当前真实报告展示冻结协议、独立反证、数据时点完整性、策略工厂与组合门禁;最终 0 权重的 BLOCKED 结论同样被完整保留。

下载 MP4
长任务为什么可恢复 展开机制

任务、租约、重试、检查点与失败记忆全部持久化;退避重试、孤儿恢复、预算上限和确定性恢复规则共同约束长时运行,进程中断后从已确认状态继续。

研究边界如何保持可信 展开门禁

候选队列和样本冻结后不可变,收益数据不参与候选生成;真实交易功能保持关闭。样本不足、执行不可行或结果不稳定时,系统主动停止并保留原因。

HOW I BUILD / 工程方法

我不把“能跑”当成完成。

真正可交付的系统,需要权威边界、证据、恢复能力与量化验证。
01

先确定权威边界

谁拥有状态、谁能写入、谁只负责表现,在第一条链路里就说清楚。

02

让结论可以复验

来源、请求、轨迹、内容哈希和评测口径一起保留,不用漂亮回答替代证据。

03

按故障设计恢复

超时、重复投递、进程退出和响应丢失都进入设计,不只覆盖成功路径。

04

用数字完成闭环

压力测试、覆盖率、稳定性和成本都有固定口径,也明确数字不代表什么。