Skip to content

agents: stat-reviewer i stat-assessor — rozdzielone wg bazy dowodowej - #6

Open
kicrazom wants to merge 1 commit into
mainfrom
feat/stat-reviewer-agent
Open

kicrazom wants to merge 1 commit into
mainfrom
feat/stat-reviewer-agent

Conversation

@kicrazom

Copy link
Copy Markdown
Owner

Dodaje dwa agenty domykające warstwę recenzyjną Scriptorium. Rozdzielone celowo — różnią się bazą dowodową, nie głębokością.

Dlaczego dwa, a nie jeden

Agent Pracuje na Uruchamia kod Sieć
statistician danych użytkownika tak tak
peer-reviewer manuskrypcie pod recenzją nie nie
stat-assessor tekście opracowania jedno twierdzenie naraz tak
stat-reviewer kodzie i danych przelicza tak

peer-reviewer nie ma narzędzi wykonawczych celowo — manuskrypt pod recenzją jest poufny wg COPE i nie może opuścić maszyny ani zostać uruchomiony. stat-reviewer jest przypadkiem odwrotnym: wchodzi na materiał, który użytkownik ma prawo wykonać (własne laboratorium, repozytorium współpracownika, preprint z publicznymi danymi, pipeline przed submisją). Oba oddają pełną re-analizę do statistician.

stat-reviewer (VERIFY)

Rdzeń:

Zgłoszona statystyka, której nie odtworzyłeś, jest twierdzeniem, a nie faktem.

Audytuje projekt badania i jednostkę analizy, specyfikację modelu, założenia istotne dla tej konkretnej inferencji, wielokrotność, przecieki danych w pracach predykcyjnych oraz zgodność liczb między tekstem, tabelami i rycinami.

Do tego audyt reprodukowalności end-to-end, którego nie wykonuje żaden inny komponent: czy zarchiwizowany kod biegnie od surowego wejścia do finalnej tabeli bez nieudokumentowanych kroków ręcznych, czy wersja danych jest przypięta, czy środowisko jest uchwycone, czy ziarna są ustawione, i czy każda liczba w manuskrypcie wywodzi się ze skryptu, a nie z ręcznego wpisania.

Rozjazd wersji jest osobnym ustaleniem — manuskrypt cytujący w tekście liczby z jednego przebiegu, a w tabelach z późniejszego, jest wewnętrznie niespójny nawet wtedy, gdy każdy przebieg z osobna był poprawny.

Narzędzia: Read, Grep, Glob, Bash, Write.

stat-assessor (APPRAISE)

Ocena krytyczna z tego, co napisane — Methods/Results, tabele wyjściowe albo skrypt — bez wymagania surowych danych i uruchamialnego pipeline'u. Kod uruchamia wyłącznie do sprawdzenia pojedynczego twierdzenia, nigdy do odbudowy analizy.

Narzędzia: Read, Grep, Glob, Bash.

Wspólne reguły twarde

  • nigdy nie cytują statystyki spoza materiału, który mają przed sobą
  • rozróżniają trzy werdykty i nigdy ich nie zlewają: to jest błędne, to jest niedomocowane, tego nie oceniono
  • obowiązkowa sekcja Not assessed — także gdy pusta; żadnego sugerowania pokrycia, którego nie ma
  • wielkości efektu z przedziałami przed werdyktami z p-wartości

Weryfikacja

Frontmatter wszystkich sześciu agentów parsuje się poprawnie (yaml.safe_load), name zgadza się z nazwą pliku w każdym przypadku.

⚠ Przy okazji złapany błąd, który uniemożliwiłby wczytanie agenta: dwukropek w opisie stat-reviewer (reproducibility: that archived code...) rozwalał YAML we frontmatterze — plugin po prostu by go nie zobaczył. Poprawione przeformułowaniem.

Do rozstrzygnięcia osobno (nie w tym PR)

Wersje się rozjeżdżają: pyproject.toml → 1.3.0, .claude-plugin/plugin.json → 1.0.0. To drugie czyta Claude Code przy instalacji pluginu, więc rozjazd jest realny. Warto wyrównać przed następnym wydaniem.

🤖 Generated with Claude Code

https://claude.ai/code/session_01Mqf6TDHvvqPUMfNEUyhwHz

stat-reviewer (VERIFY): przelicza zamiast ufac. Zglaszana statystyka, ktorej nie
odtworzyl, jest twierdzeniem, nie faktem. Audyt reprodukowalnosci end-to-end: kod,
wersja danych, srodowisko, ziarna; kazda liczba ma sie wywodzic ze skryptu.
Osobne ustalenie: rozjazd wersji (tekst z jednego przebiegu, tabele z pozniejszego).
Narzedzia: Read, Grep, Glob, Bash, Write.

stat-assessor (APPRAISE): ocenia to, co napisane — Methods/Results, tabele wyjsciowe,
skrypt — bez wymagania surowych danych ani uruchamialnego pipeline'u. Kod uruchamia
wylacznie do sprawdzenia pojedynczego twierdzenia. Narzedzia: Read, Grep, Glob, Bash.

Roznia sie baza dowodowa, nie glebokoscia. Oba oddaja pelna re-analize do statistician,
a material pod poufna recenzja do peer-reviewer. Obowiazkowa sekcja Not assessed.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01Mqf6TDHvvqPUMfNEUyhwHz
@kicrazom kicrazom mentioned this pull request Sep 20, 2026
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant