Skip to content

[Feature]Upgrade pure-text skills to deterministic scripts (Fixing LLM training bias in academic scanning) #132

Description

@Shen-Yukang

Upgrade pure-text skills to deterministic scripts (Fixing LLM training bias in academic scanning)

目前的 colleague-skill 主要依赖纯文本(如 skill.md 或是基于自然语言的 Prompt 描述)来定义 Agent 的技能。然而,但是大语言模型(LLM)天然存在**训练偏执(Training Bias)与幻觉,纯文本定义的技能(Skills)在高频、动态或平台底层的交互场景中,表现可能出严重的缺乏实证性(Not Grounded)**和不可控性或不遵守 skill 里面 的系统提示词规程。

纯文本的技能只适合做高层规划,底层执行急需从纯文本描述升级为具备强类型、确定性的“可执行脚本(Scripts)”。

Proposed solution / 建议方案

建议将技能的设计泛化为 "From Text to Script" 的混合架构,将纯文本的声明式 Skill 编译/映射为底层的结构化脚本:

  1. 硬化数据解析与学术 API 采集(Deterministic Scraping Scripts):

    • 将针对论文 PDF/XML 的解析、公式提取、以及第三方学术数据库(如 Crossref, DOI 验证)的调用彻底脚本化(使用专门的 Python/Go 库处理)。例如接入MinerU做一次 grounded 扫描,有证据梯子可以查证。
    • 屏蔽大模型在数据采集阶段的介入,确保输入给 Agent 的文献元数据(Metadata)是 100% 准确的真实数据。
  2. 结构化参数路由与算法隔离(Schema-based Algorithm Execution):

    • 大模型仅负责理解审查规则、提取待检测的线索(如语义冲突点、潜在造假假设),并输出结构化的参数(JSON Schema)。
    • 真正的数值比对、文本查重、图表重复率计算交由预设好、经过严格密码学与数字图像处理验证的底层脚本(如基于 NumPy, OpenCV, Clean-text 的脚本)来确定性执行。
  3. 可复现性验证环境(Reproducible Runtime Grounding):

    • 为每个扫描技能提供一个轻量级的受控 Runtime 容器。每一次学术不端扫描的脚本执行轨迹、对比日志、中间哈希值都需要被硬编码脚本持久化记录,确保打假结果具有法律/学术层面的可复现性(Reproducibility),而非大模型的随机输出。

Would you be willing to submit a PR? / 你愿意提 PR 吗?

  • Yes, I can work on this / 我愿意
  • I can help test / 我可以帮忙测试
  • Just suggesting / 只是建议

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions