pwn 0.5.643 → 0.5.650
This diff represents the content of publicly available package versions that have been released to one of the supported registries. The information contained in this diff is provided for informational purposes only and reflects changes between package versions as they appear in their respective public registries.
- checksums.yaml +4 -4
- data/documentation/Agent-Tool-Registry.md +10 -5
- data/documentation/Cron.md +3 -2
- data/documentation/Home.md +2 -2
- data/documentation/How-PWN-Works.md +1 -1
- data/documentation/Mistakes.md +13 -0
- data/documentation/Reinforcement-Learning.md +72 -3
- data/documentation/Skills-Memory-Learning.md +5 -3
- data/documentation/What-is-PWN.md +1 -1
- data/documentation/diagrams/dot/pwn-ai-feedback-learning-loop.dot +3 -3
- data/documentation/diagrams/dot/reinforcement-learning.dot +8 -8
- data/documentation/diagrams/pwn-ai-feedback-learning-loop.svg +318 -319
- data/documentation/diagrams/reinforcement-learning.svg +188 -187
- data/documentation/pwn-ai-Agent.md +6 -5
- data/lib/pwn/ai/agent/curriculum.rb +491 -35
- data/lib/pwn/ai/agent/extrospection.rb +18 -4
- data/lib/pwn/ai/agent/learning.rb +308 -54
- data/lib/pwn/ai/agent/loop.rb +145 -11
- data/lib/pwn/ai/agent/metrics.rb +200 -11
- data/lib/pwn/ai/agent/mistakes.rb +26 -8
- data/lib/pwn/ai/agent/registry.rb +24 -2
- data/lib/pwn/ai/agent/reward.rb +447 -7
- data/lib/pwn/ai/agent/tools/curriculum.rb +23 -0
- data/lib/pwn/ai/agent/tools/reward.rb +86 -0
- data/lib/pwn/ai/agent/tools/ruby_eval.rb +29 -6
- data/lib/pwn/cron.rb +14 -2
- data/lib/pwn/version.rb +1 -1
- data/spec/integration/reinforced_feedback_loop_spec.rb +806 -12
- data/spec/lib/pwn/ai/agent/reward_spec.rb +64 -1
- data/spec/lib/pwn/ai/agent/tools/ruby_eval_spec.rb +39 -1
- data/third_party/pwn_rdoc.jsonl +33 -4
- metadata +1 -1
|
@@ -81,7 +81,7 @@ $ pwn --ai "run bin/pwn_sast against ./src and push findings to DefectDojo"
|
|
|
81
81
|
|
|
82
82
|
## What the agent can call
|
|
83
83
|
|
|
84
|
-
|
|
84
|
+
12 toolsets · **78 tools** - full table at
|
|
85
85
|
[Agent Tool Registry](Agent-Tool-Registry.md).
|
|
86
86
|
|
|
87
87
|
The two that matter most:
|
|
@@ -118,10 +118,11 @@ full `Loop.run` under a persona overlay) that share a JSONL bus. See
|
|
|
118
118
|
local.
|
|
119
119
|
- `PWN::AI::Agent::Learning.export_finetune` + `Reward.export_dpo` turn every
|
|
120
120
|
successful session and every preference pair into supervised / DPO
|
|
121
|
-
datasets under `~/.pwn/finetune/`
|
|
122
|
-
LoRA-tunes the local model
|
|
123
|
-
|
|
124
|
-
|
|
121
|
+
datasets under `~/.pwn/finetune/` — `Curriculum.train_and_gate` then
|
|
122
|
+
LoRA-tunes the local model and promotes only under **gate v2** (resolved
|
|
123
|
+
margin + mean judge + frozen smoke set). Preference pairs use trajectory
|
|
124
|
+
geometry (P9/P14/P15): revised answers / winning traces, not `CORRECTION:` prose; `scrub_preferences` + export filter; practice lands `shape: :winning_trace`.
|
|
125
|
+
See [Reinforcement Learning](Reinforcement-Learning.md).
|
|
125
126
|
|
|
126
127
|
## RL feature flags (`PWN::Env[:ai][:agent]`)
|
|
127
128
|
|