{"entity":{"display_name":"Evaluation OS","kind":"series","slug":"evaluation-os"},"facts":[{"id":"f_d525cd689bce3720f9320924","predicate":"mention","value":{"text":"released on GitHub"},"as_of_date":"2026-09-02","first_seen_at":1788519222,"last_verified_at":1788519222,"confidence":0.9,"sources_count":1},{"id":"f_5f0bcb78ae3057fdd99497db","predicate":"mention","value":{"text":"mechanically verifies whether an evaluation conclusion survives changes to the measurement criteria"},"as_of_date":"2026-09-02","first_seen_at":1788519222,"last_verified_at":1788519222,"confidence":0.9,"sources_count":1},{"id":"f_7f60b7c8fd8f4907812115ed","predicate":"mention","value":{"text":"in a case study, 60 evaluation conditions applied to On the Links all produced the same conclusion, with minimum value 70.0 clearing threshold 68.0"},"as_of_date":"2026-09-02","first_seen_at":1788519222,"last_verified_at":1788519222,"confidence":0.9,"sources_count":1},{"id":"f_a091ec15450ed76310e0b8e5","predicate":"mention","value":{"text":"rules, evidence, limitations, and code disclosed for third-party reproduction"},"as_of_date":"2026-09-02","first_seen_at":1788519222,"last_verified_at":1788519222,"confidence":0.9,"sources_count":1},{"id":"f_29df7bfe71ef04cc6133c90c","predicate":"mention","value":{"text":"reframes AI-era evaluation from a single score to a check of whether conclusions hold when the measurement ruler changes"},"as_of_date":"2026-09-02","first_seen_at":1788519222,"last_verified_at":1788519222,"confidence":0.9,"sources_count":1}],"relations_incoming":[],"relations_outgoing":[],"updated_at":"2026-09-13T14:59:51.000Z","verification_summary":{"contradicted":0,"disputed":0,"overall":"unverified","supported":0,"unverified":5}}
