CODEX 2,147,779 cutoff tokens · exact delta 約148 exec · 約18.14M tokens FABLE 5

COMPARABLE TELEMETRY v2 · PINNED AUDIT · 2026-07-17

CODEX vs FABLE 5 v2 実装・デバッグ実測比較

v2では「取得不能」を放置せず、初回の比較Pages公開検証後・finalized manifest公開前のgoal runtime checkpoint区間を保存した。 同時にFableの公開repositoryをcommit固定で監査し、正確な値、近似の手集計、 再計算できないheadlineを分ける。既存の約2,969万checksと同一Chrome 6,000 framesも消さずに残す。

LEGACY ARTICLE SCOPE v1 evidenceの表示範囲

既存v1記事比較の表示範囲。新しいpinned repository監査とv2 telemetryはこの切替の影響を受けない。

CODEX PUBLICATION CUTOFF
2,147,779exact aggregate delta
400,4442,548,223 · 7,655 s。agent別内訳なし
V2 DEEP SUITES
2separate · 0 failure
matrix / core atomic。重複可能・合算禁止
V2 DEBUG CONTRACT REPEATS
assertions
direct A/B frames · trials
FABLE PINNED REPO AUDIT
約18.14Msubagent tokens · manual
約148 task executions / 3,012 explicit checks
再実行実測 repository記録 pinned repository / 外部手集計 未取得 / 比較不能
EVIDENCE 00 · V2 COMPARABLE LOG CONTRACT

データ量の前に、単位と出所を揃える

Codexはgoal全体の正確なcheckpoint差分、Fableはcommit 03356fd9… のstructured worklog監査。母集団が違う値は同じ行に置いても、倍率にはしない。

公開JSONを検証中…

CODEX PUBLICATION CUTOFF正確・集約差分
2,147,779 goal token delta through public verification

400,4442,548,223 / 7,655 s。final manifest公開直前の固定境界。

FABLE SUBAGENT TOKENS近似・手集計
約18.14M reported cumulative

約148 task agent executions。normalized event logではない。

FABLE EXPLICIT CHECKSrepo監査
3,012 explicitly counted

Codex atomic checks / tests / browser trialsと同じ単位ではない。

v2で比較可能になったtelemetryと残る差
観測軸CODEX v2FABLE pinned main比較ルール
tokens 2,147,779publication-cutoff goal delta正確・集約 約18.14Msubagent cumulative近似・手集計 run scopeも集計方法も異なるため、token効率の倍率は出さない。
agent grain 14 task-path observationsroot + 13 bounded · peak 4個別token N/A 約148 executionsidentity countではない近似・手集計 Codexのrole / identity観測とFable task executionsを同じ「agent数」として足し引きしない。
checks 29,687,939v1 deep atomic / 0 fail再実行 3,012explicit numeric checksrepo監査 定義が一致しない。Codex v2 deepは下のfinalized JSON hookへ追加する。
browser raw 6,000 framesv1 same-Chrome direct A/B再実行 同じ6,000 framescurrent public artifact再実行 Fable worklogのpass / screenshot headlineはraw trial ledgerから再計算できないため、別欄へ混ぜない。
TOKEN ACCOUNTING

二重計上しない計算式

total = input + output

cached inputはinputの部分集合、reasoning outputはoutputの部分集合なので再加算しない。取得不能はnullであり0ではない。checkpointはagent別recordへ按分しない。runのwall-clock開始境界は未取得だが、goal counter差分は初回比較Pages公開検証後・finalized manifest公開前の境界で固定した。

V2+ EXEC HISTORY

exec / app-server usageをexact recordへ

利用可能な実行ではturn・thread境界のusageをそのまま取り込み、input / cached input / output / reasoning outputをidentity単位でreconcileする。

OTEL / EVENT LEDGER

時間・test・browser・deployを同じrun IDへ

OpenTelemetry spanまたはcollector eventへstart/end、command、exit、browser trial、artifact hashを記録。近似値から正確値を逆算しない。

V2 DEEP CORE SUITE

core JSON確認中

procedural core / streaming / growth / navigation / quality。

deep core JSON
V2 DEEP VALIDATION

finalized JSON待ち

既存v1値へ予定数を加算しない。確定manifestを受け取った時だけ表示する。

deep matrix JSON
V2 PUBLIC/PUBLIC SAME-CHROME A/B

public run確認中

Codex immutable Pages deploymentとFable public deploymentのstationary raw trialsを検証する。

raw 6,000-frame JSON
V2 BROWSER FUNCTIONAL CONTRACT

debug contract repeats確認中

fresh CDP target / debug mutation / fixed-stepのfunctional contractを確定JSONから描画する。

25-target raw ledger
V2 PERFORMANCE REPEAT CAMPAIGN

5-run分布を確認中

成功runだけを抜き出さず、5観測の分布と失敗gateを同じ分母で表示する。

5-run performance ledger
V2 PERFORMANCE · RUN 005

代表成功run確認中

5-run campaignとは別に、全gateを通過した単一runの詳細を表示する。

run 005 raw JSON
V2 UNIT REGRESSION

58 tests / 13,102 expects PASS

0 fail。deep suiteやbrowser assertionへ加算しない独立した通常回帰。

engineering worklog
TOKYO GAMEPLAY PARITY

同じgoal、違うスタート地点

機能の有無はperformance負荷の同等性を意味しない。定数が確認できた側だけ具体値を出す。

SOL v2とFableのTokyo gameplay feature比較
機能SOL ROLLER v2FABLE
舞台東京 実装契約東京 source確認
屋内スタート民家の中 実装契約戦国電気・electronics store source確認
最終goal東京スカイツリー 634m 実装契約東京スカイツリー 634m source確認
BGM / SEprocedural WebAudio 実装契約procedural WebAudio source確認
dash0.8s / cooldown 4s / 2.2× 定数Space dash gauge / Shift boost source確認
競技systemtimer・rare・score・rank 実装契約timer・rare collection・score・rank source確認
タイムアタック時計active foreground wall time 実装・browser検証fixed simulation time source確認
X shareresult intent URL 実装契約result intent URL source確認

時計の比較境界: rank定数に共通点があっても、Codexはforeground中の実経過時間、Fableはfixed simulation時間を採用しており、elapsed timeやrankを同一計測として直接比較しない。

EVIDENCE 01 · CODEX DEEP MATRIX

約793万ケースを、約2,969万回チェック

同じframeを別シナリオとして水増しせず、入力ケースとatomic assertionを別々に保存した決定論キャンペーン。

ATOMIC CHECKS 29,687,939

各ケース内の境界、同一性、保存則、誤差、budgetを個別に検査。

SEMANTIC CASES 7,936,949

seed・tier・chunk・trajectory・方位・品質traceの固有入力。

RESULT 0 failures

修正後の再実行。evidence digest c58f3b92 が一致。

RUNTIME 2.653 sec

Bun 1.3.11 / fixed seeds / CPU-side validation。

01 / WORLD

14,636,922 atomic

1,161,978 cases · 64 seeds × 6 tiers × 121 chunks × 24 objects

  • 1,115,136 descriptors
  • byte determinism
  • ID collision 0
02 / STREAMING

8,490,528 atomic

4,286,304 cases · 9,504 streamed worlds

  • 600 hard cap
  • 4,147,200 identity reuse checks
  • active ID collision 0
03 / GROWTH

2,709,785 atomic

369,971 cases · 4,096 complete trajectories

  • 319,003 accepted events
  • 30,865 rejected events
  • 16,007 boundary cases
04 / NAVIGATION

1,882,624 atomic

626,176 cases · bearing / distance / floating origin

  • 622,080 vector cases
  • 最大距離誤差 3.5e−10
  • 4,096 landmark cases
05 / QUALITY

1,968,080 atomic

1,492,520 cases · 2,048 adaptive traces

  • 491,520 samples
  • density / DPR budgets
  • 4,095 transitions
USED AGENTS

Main + 3 specialist tracks

Main + 3 specialist tracksというv1のrole記録。unique identity数を推測しない。v2のgoal aggregate tokenも各trackへ按分していない。

MAINIntegration

設計統合、実装、修正、最終判断

DEEP MATRIXDeterministic QA

約793万cases、境界bug 2件

CROSS GAMEDirect A/B

同一Chrome 6,000 frames

CAMPAIGN / AUDITRepeated E2E

35 attempts、Fable provenance監査

EVIDENCE 02 · DIRECT A/B

PUBLIC対PUBLIC、同じChrome、同じフレーム数

Codexのimmutable Pages deploymentとFable publicを同一CDP endpointで起動し、各5試行×600 framesを交互順序で測定した。両側に同じ方法の実測値がある比較軸。

Chrome150.0.7871.125 viewport1440 × 900 / DPR 1 trials5 per game frames600 per trial warmup60 rAF cachedisabled orderF→C / C→F alternating targetPUBLIC / new tab every trial
最終PUBLIC/PUBLIC同一Chrome stationary benchmark集計
測定値CODEX PUBLICFABLE PUBLIC読み方
successful trials5 / 55 / 510 trialすべて起動・採取・PNG保存まで成功
measured frames3,0003,000全体6,000 raw rAF intervals
frame p5027.1 ms28.7 ms同じPUBLIC/PUBLIC stationary run内の中央値
frame p9540.4 ms44.2 ms同一Chrome・同一採取方法のtail指標
frame p9948.5 ms52.8 ms機能量非同一のためゲーム全体へ外挿しない
maximum frame92.3 ms259.6 ms単一最大値は外れ値の影響が大きい
frames > 50 ms170.57%421.40%各3,000 frames、long-frame thresholdは50ms
draw calls / frame14p50 / p95固定44p50 / p95固定pre-navigation WebGL draw* wrapperで計測
mean JS heap after4.70 MB8.73 MBCDP Runtime.getHeapUsage、各trial終了時平均
mean navigation transfer3.77 KB12.24 KBCDP encodedDataLength
mean resource transfer168,237 B738,388 Bdocument以外。cold-cache平均
browser errors0console / runtime / log / network0console / runtime / log / network両側ともerrorなし
DRAW CALLS0.318×

Codex / Fable。API call数でありGPU時間ではない。

MEAN HEAP AFTER0.539×

ゲーム内容量・world content非同一の参考比。

RESOURCE TRANSFER0.228×

今回のPUBLIC/PUBLIC cold-cache stationary run。

FRAME P950.914×

stationary sample内だけの比。実走性能ではない。

PUBLIC/PUBLIC固定条件: Codex https://c42f196d.sol-katamari.pages.dev/対Fable public。5 trials × 600 frames / site、合計6,000 frames。ゲーム内容量が非同一なのでstationary baseline以外の優劣は主張しない。

EVIDENCE 03 · SCOPE & PROVENANCE

Fableの数字は「外部自己申告累計」として読む

現行公開物から再計測できる値と、記事で報告された開発累計を分離した。25 passes等をv1実測として扱わない。

CodexとFable外部報告リソース比較
指標CODEXFABLE v1根拠・注意
recorded tracks (v1)4role記録48外部CodexはMain + 3 specialist tracksで、unique identity数ではない。agent粒度は非同一。
total tokens2,147,779v2 publication-cutoff goal delta正確・集約約377万外部Codexはcheckpoint区間、Fableはversion報告。scopeが違うため効率比は出さない。
elapsed455 sgoal runtime delta正確・集約約134分外部5版累計scopeでは約19時間。wall-clockとgoal runtimeを同じ時間にはしない。
assertions29,687,939deep atomic checks再実行v1単体値なし外部pinned repo監査では5版に3,012 explicit checks。定義が違うため倍率比較禁止。
same-Chrome trials5direct A/B再実行5direct A/B再実行このページが同条件で採取したtrial。外部報告passとは別。
same-Chrome PNG51 per trial再実行51 per trial再実行両側合計10枚。代表2枚をheroへ掲載。
reported browser passes対象外raw再計算不可N/A記事headlineは存在するが、pinned structured rawから累計を再計算できない。
reported screenshots対象外raw再計算不可N/Aimmutable hash付きの完全manifestがないため、headlineを検証済み実測にしない。
CODEX v2 CURRENT ARTIFACT実Chrome

SOL ROLLER

民家から始まるprocedural Tokyo、6 scale tiers、固定instance予算、東京スカイツリーへのnavigation。

世界
home + Tokyo terrain / scenery
scale
HOME ROOM → SKYTREE SKYLINE
instance
600 steady / 1,200 transition
goal
東京スカイツリー 634m
game systems
dash / timer / rare / score / rank / X
FABLE CURRENT ARTIFACTmanifest実測

FABLE KATAMARI

OSM東京をstreamingし、2cmのネジから634mのスカイツリーまで成長する情報量重視の実装。

buildings
14,035 current records
roads
12,929 current records
reported buildings
14,563(公開資料)
scale
2cm → 634m
game systems
timer / combo / 実況 / collection
EVIDENCE 04 · DEBUGGING YIELD

検証量を増やした結果、2件の境界バグを発見

単にchecksを増やしたのではなく、既存suiteを通過していた失敗を再現し、修正後の回帰testまで残した。

BUG 01

ゴール境界のcube-root丸め

必要半径ぴったりの体積を設定しても、cube-rootの丸めで僅かに閾値を下回り、吸収可能にならない入力をdeep growth matrixが検出。

FIX境界判定に数値許容幅を導入し、exact-threshold regressionを追加。
BUG 02

4秒 / 12秒quality閾値の分割誤差

sample時間の足し上げが閾値直前に留まり、十分な低速・高速traceでもadaptive qualityが切り替わらないケースを検出。

FIX浮動小数誤差を吸収する時間比較とthreshold-partition regressionを追加。
BEFORE23standard tests
DEEP MATRIX2new confirmed bugs
AFTER26tests / 12,826 expect
RE-RUN0deep failures
CODEXREPRODUCIBLE LOCALLY

失敗入力をmatrixから回帰suiteへ降ろす

bun tests/deep-validation.ts
bun test
bun run test:cross
  • 固定seedとinput matrix
  • semantic / atomicを別集計
  • raw JSONとdigestを保存
  • 2件を通常suiteへ固定
FABLEEXTERNAL CUMULATIVE REPORT

多版・多agentで探索範囲を広げる

  • terminal speed到達不能
  • landmarkのtier gap
  • 人間確認でopening occlusion
  • OSM / Overpass外部検算

上記は記事報告。今回のrepositoryからFableの全suiteを再実行した結果ではない。

REVIEW ARITHMETIC9 / 30 = 30%

参照ページの「30指摘・21確定・9棄却」から計算すると棄却率は30%。36%表記には別分母が必要なため、このページでは30%とする。

EVIDENCE 05 · REPEATED E2E

2条件・45 attempts — 37 pass / 8 failure

主campaignとfresh-profile concurrent-load stressを混ぜずに併記し、合計でも失敗runを分母から除外しない。

PRIMARY VALIDATION CAMPAIGN · 35 ATTEMPTS

結果ファイルを確認中

未確定値はheadline・比較表・結論へ加算しません。

campaign summary JSON
3 FAILURES

失敗を除外しない

いずれもtimeoutではなく、公開版を同じChromeで反復した際に観測された不安定性またはperformance gate超過。

smoke-023 rAF停滞 / keyboard movement 0m

入力を送った観測窓で描画frameが進まず、before / afterの移動量が0。25 smoke中の1 failure。

perf-002 Tier 5 p95 gate failure

同trialで4,065.7msのp99 outlierを観測。performance runを成功扱いにしない。

perf-004 Streaming p95 49.1ms

chunk-crossing soakのp95 budgetを超過。10 performance runs中の2件目のfailure。

集計契約: 35 attemptsを分母に維持し、3 failuresを削除しない。compact summaryを表示元とし、sanitized full campaign JSONも公開対象に残す。

FOLLOW-UP · FRESH PROFILE + CONCURRENT HOST LOAD

追加10 attempts — smoke 5 / 5、performance 0 / 5

NOT ISOLATED
ATTEMPTS10
PASS / FAIL5 / 5
SMOKE5 / 5
PERFORMANCE0 / 5
SCREENSHOTS65
ALL 5 PERF FAILURES

全件がframe-time gate超過。一方で、instance pool・draw-call上限・geometry/texture plateau・heap構造budgetは維持された。負荷下の時間感度と構造上限を分けて読む。

COMBINED ATTEMPTS45two conditions
PASS / FAIL37 / 882.2% overall
SMOKE TOTAL29 / 3096.7%
PERF TOTAL8 / 1553.3%
SCREENSHOTS377312 + 65
VERDICT

v2で量は増えた。比較単位はあえて混ぜない

deep 2 suite、25回browser campaign、更新6,000-frame A/B、goal token checkpointを追加した。一方、重複可能性・機能非同等・Fable手集計のprovenanceは消えない。

SUPPORTED BY RE-RUN DATA

Codexで確証できたこと

  • v2 depth: feature matrix 5,834,730 cases / 42,969,756 checks、core 7,917,462 / 31,769,395を別表示、双方0 fail
  • v2 unit: 58 tests / 13,102 expects、0 fail
  • v2 browser: 25 / 25 fresh-CDP contract repeats、1,550 / 1,550 exact assertions、62 unique contracts
  • v2 performance repeat: 4 / 5 PASS(80%)。streaming.heap-plateau 1件を分母に残す
  • v2 direct A/B: 6,000 frames、10 / 10 trials、error 0 / 0
  • usage: publication cutoff 2,147,779 tokens / 7,655 secondsをexact aggregate deltaとして保存
  • orchestration: root + 13 bounded task paths、peak concurrency 4。個別tokenは取得不能
  • v1 continuity: 29,687,939 checks、45-attempt campaign、境界bug 2件の証拠も保持
SUPPORTED BY ARTIFACT + EXTERNAL REPORT

Fableで確認・報告されたこと

  • real data: 現行14,035 buildings / 12,929 roads
  • breadth: pinned repo報告 約148 task executions / 約18.14M subagent tokens
  • explicit QA: 3,012 checks。browser / screenshot headlineはraw再計算不可
  • game richness: timer・combo・実況・collection・OSM東京
DO NOT CLAIM

このデータから言えないこと

Codexがゲーム全体でFableより何倍優秀、token効率が何倍、同機能で何倍高速、とは言えない。Codex tokenはgoal区間のaggregate、Fable tokenは累計の近似手集計でscopeが違う。直接性能表は静止baseline、deep matrixとFable explicit checksも別単位だからだ。

RESULT

今回は「Codex側のデータが少ない比較」から、2系統のdeep matrix25回のfresh-tab browser reliability5回のperformance分布更新same-Chrome A/Bexact goal usage checkpointを持つ比較へ更新した。合算できない値を合算せず、失敗runも分母に残すことが検証結果の一部である。

METHODOLOGY & SOURCES

raw evidenceまで辿れる

v1実測生成日は2026-07-13、v2 telemetry / pinned repository監査は2026-07-17。近似の手集計は正確値から分ける。

  1. 01Codex deep validation — full JSON
  2. 02PUBLIC/PUBLIC Same-Chrome — raw 6,000 frames
  3. 03Legacy v1 Same-Chrome capture — retained history
  4. 04Repeated E2E campaign — final compact summary
  5. 05Repeated E2E campaign — sanitized full report
  6. 06Fresh-profile concurrent-load stress — summary
  7. 07Fresh-profile concurrent-load stress — sanitized full report
  8. V2Repeated Chrome performance — five-run ledger
  9. 08Codex engineering worklog
  10. 09Codex performance contract
  11. 10Fable 5 implementation report
  12. 11Fable current Tokyo manifest
  13. 12Reference: Sonnet 5 vs Fable 5

再実行実測repository script / current public artifact / raw JSON

repository記録test output・Worklog・architecture

外部自己申告Fable記事・参照比較ページの累計

比較不能母集団またはtelemetryが揃わない値