开源多智能体 AI 实验室 / OPEN-SOURCE MULTI-AGENT AI LAB

训练一个蜂群,
让它在未知环境中生存。

这是一个确定性蜂群模拟器:策略在完全相同的世界中竞争,学习策略必须通过预先声明的安全门槛,失败实验也会永久留在记录里。

53项测试通过 / tests
6种审计场景 / scenarios
Apache 2.0开源许可 / open source
蜂群 COLONY / 042● 运行中 LIVE
蜂蜜 HONEY223.68+52.6%
存活 SURVIVAL100%6 / 6
无效动作 INVALID0.00%安全 SAFE

第一次来?先理解问题,再看术语

一个蜜蜂小游戏,
一个严肃的协作问题。

01

先建立世界

蜂巢、花朵、能量、天气和几只虚拟蜜蜂。季节结束后,统计蜂蜜、存活和无效动作。

02

尝试不同思维

人工规则和学习策略解决同一个问题:各自行动,同时不浪费蜂群共享资源。

03

参加同一场考试

相同随机种子重建相同世界,策略不能仅仅因为拿到更简单的地图而获胜。

04

带着证据发布

预先声明的门槛、隔离的最终测试、模型哈希和失败记录,让晋级结果可追溯。

我不熟悉 AI先理解游戏和问题阅读零基础指南 →
我是 ML 从业者查看训练与证据打开模型目录 →
我是 DEVOPS / MLOPS 从业者追踪交付与控制阅读工程交接 →

完整路线:蜂群模拟器 → 规则基线 → 学习策略 → 公平考试 → 有证据的发布。

蜜蜂之外,为什么有意义

用一个小世界,
训练高要求的工程习惯。

SweetGold 不是在销售蜜蜂策略。它用一个端到端系统,把协作、公平评测、模型晋级和审计证据变得可理解。工作流可能迁移,但每个行业声明仍需领域验证。

今天的实际价值

看懂完整 AI 生命周期

从模拟器和基线,到学习策略、隔离最终测试、经验证模型和可审计决策。

潜在迁移场景

共享资源下的协作

仓储与机器人集群、无人机巡检、交通研究、游戏、AI 评测和技术教育。

客户假设

教授、测试或治理 AI 的团队

大学、企业学院、ML 平台、治理团队、仿真研发团队和技术咨询机构。

优势证据本身就是产品

确定性比较、预先声明门槛、失败保留、模型完整性和双语解释形成一套连贯工作流。

限制当前领域仍是代理场景

尚无客户调研、付费试点、真实车队集成、多用户加固或经过衡量的业务结果。

01访谈

验证一个反复出现且紧迫的买方问题。

02迁移

接入一个外部或客户仿真器。

03试点

衡量时间、缺陷或审计成本下降。

04产品化

只标准化反复出现的核心。

最可信的第一条路径是教育与能力建设,其次是适配器式评测和晋级工具包。在出现领域证据前,直接工业控制仍然只是一个假设。

阅读完整客户、优劣势、商业化与路线分析 →
竞争方式占据评测与晋级层

集成 PettingZoo、RLlib、Isaac Lab 和模型注册表,不竞争环境数量、算法广度、GPU 规模或通用跟踪。

开源现实代码可以被复制

Apache-2.0 允许合规使用、修改、再分发和商业复用。防御来自可信上游、品牌、适配器、证据、社区和客户上下文。

下一项特性先证明可迁移

客户访谈后,接入一个 PettingZoo 环境并发布稳定证据格式,再考虑更多算法或 SaaS 仪表盘。

产品工作流 · M15

输入实验依据,
输出可审计决策。

决策目标 OBJECTIVES3

平衡 · 产量 · 安全

安全约束 CONSTRAINTS2

存活率 · 无效动作率

证据格式 EVIDENCE2

JSON · Markdown

决策方式 DECISION确定性

明确推荐或明确拒绝

M15 从已有策略中做选择,不训练新策略;M16 是最新工程里程碑。

先问清问题,再理解结论

先从最重要的
几个区别开始。

01 · 项目定位

SweetGold 只是蜜蜂游戏吗?

不是。蜂群是多智能体协作的参考环境,真正可复用的产品是可复现的评测与证据工作流。

02 · 证据强度

一场 Arena 胜利能证明鲁棒性吗?

不能。小型联赛属于演示;正式结论需要预声明门槛、隔离最终种子和跨场景证据。

03 · 使用边界

现在可以控制真实机器人吗?

不能。工作流可能迁移,但每个物理领域仍需自己的仿真、集成、安全和法规验证。

为访客、学习者、研究人员、工程人员、贡献者、合作伙伴和治理团队整理。

浏览常见问题

最新晋级策略 · M14

最新策略的
正式性能结果。

148.47%蜂蜜中位数 / Assignment 基线
101.16%最差场景产量花蜜稀缺 scarce nectar
100%最低存活率所有场景
0%无效动作率所有场景

M14 · 每个场景 50 个从未使用的最终种子 · 只用相互隔离的验证种子选型 · M15 不改变这些结果

策略竞技场 / STRATEGY ARENA

同一个世界,
不同的思维。

让两个策略从同一随机种子出发,实时比较蜂蜜、存活率、效率和无效动作,并回放每一帧。

  • 01 配对种子锦标赛 Matched-seed tournament
  • 02 已验证模型注册表 Verified registry
  • 03 可审计智能体建议 Auditable recommendation
比赛 MATCH 04 / SEED 202607季节 SEASON 86%
A分层 CTDE
218
B任务分配 Assignment
146
蜂蜜差 Δ HONEY+72所有蜜蜂存活

工程保障 / ENGINEERING GUARANTEES

把研究严谨性,
构建进系统。

01

确定性执行

种子化环境和配对回合让每次策略比较都能重复。

02

评测数据隔离

预检阻止训练、验证、选型和最终测试之间发生泄漏。

03

策略即代码的门槛

置信度、产量和安全阈值保存在有版本的实验配置中。

04

经验证的模型供应链

不可变发布、精确大小、SHA-256、许可证和原子安装保护检查点。

05

可追溯产物

JSON 运行包保存提交、环境、种子清单、指标和决策链接。

06

自动化回归防线

核心测试和端到端 ML 冒烟流水线进入 CI,失败审计保持可见。

采用企业级工程实践,同时明确边界:内置服务器是本地实验接口,不是经过加固的多用户生产服务。

最新工程里程碑 · M16CPU、Apple MPS 和 NVIDIA CUDA 都是显式执行目标。

在实测的小型行为克隆任务中,M1 Pro CPU 约比 MPS 快 6.4 倍,因为加速器开销超过了有效并行计算。决策依据是硬件证据,而不是“GPU 永远更快”。

阅读硬件基准 →

15 个里程碑,一条完整审计轨迹

失败实验造就了最终策略。

M4

模仿学习 Imitation

行为克隆 Behavior Cloning + DAgger

M7

去中心化 Decentralize

局部行动者,全局评论家

M10–12

诚实失败 Fail honestly

完整保留鲁棒性缺口

M14

通过门槛 Pass gates

分层返航控制

M15

循证决策 Evidence

可审计智能体工作流

M10–M12 没有通过预先声明的门槛;SweetGold 记录原因,没有事后降低标准。

M14 是最新晋级策略;M15 是最新完成的工作流,把 Arena 证据转化为受约束、可审计的策略建议。

零依赖启动 / ZERO-DEPENDENCY START

三条命令,
从源码进入蜂群。

sweetgold — zsh
$ git clone https://github.com/alanthssss/sweetgold.git
$ cd sweetgold
$ python3 main.py play --port 8080

✓ 策略竞技场已就绪:http://127.0.0.1:8080