Two tasks per difficulty level, five levels per benchmark: 10 tasks from each of nine scored benchmarks. Pairs favor different intents and technical domains. Difficulty levels are relative to each benchmark. No scored trial data: original SWE-bench, Pro V2, SWE Atlas, RealSWE; these four are omitted. Raw tags remain unchanged.
| # | Benchmark | Task intent | Technical domain | Technology stack | Context requirements | Change scope | Reasoning demands | Specification completeness | Constraints | Execution and verification | Difficulty (within benchmark) |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | deep | feature_implementation | static_analysis | Python | repository_exploration | public_interface_schema_change | algorithmic_reasoning; state_concurrency_reasoning | expected_behavior_stated | unknown | reproduction_check; edge_case_testing | very hard; mean reward 0.0550; 200 scored trials |
| 2 | deep | feature_implementation | compilers_language_tooling | CSS | repository_exploration | public_interface_schema_change | algorithmic_reasoning | expected_behavior_stated | unknown | reproduction_check; edge_case_testing | very hard; mean reward 0.2750; 200 scored trials |
| 3 | deep | feature_implementation | backend_api | unknown | repository_exploration | unknown | algorithmic_reasoning; state_concurrency_reasoning | expected_behavior_stated | unknown | reproduction_check; edge_case_testing | hard; mean reward 0.3250; 200 scored trials |
| 4 | deep | feature_implementation | terminal_ui | JavaScript | repository_exploration | unknown | algorithmic_reasoning; state_concurrency_reasoning | expected_behavior_stated; explicit_requirements | compatibility | reproduction_check; edge_case_testing | hard; mean reward 0.3400; 200 scored trials |
| 5 | deep | feature_implementation | data_serialization | Python | repository_exploration | public_interface_schema_change | algorithmic_reasoning; state_concurrency_reasoning | expected_behavior_stated | unknown | reproduction_check; edge_case_testing | medium; mean reward 0.6000; 200 scored trials |
| 6 | deep | feature_implementation | cli_tooling | unknown | repository_exploration | unknown | algorithmic_reasoning; state_concurrency_reasoning | expected_behavior_stated; environment_supplied | compatibility | reproduction_check; edge_case_testing | medium; mean reward 0.5250; 200 scored trials |
| 7 | deep | feature_implementation | cloud_infrastructure | Go | repository_exploration | public_interface_schema_change | algorithmic_reasoning; state_concurrency_reasoning | expected_behavior_stated | performance | reproduction_check; edge_case_testing | easy; mean reward 0.6850; 200 scored trials |
| 8 | deep | feature_implementation | data_processing | Go | repository_exploration | public_interface_schema_change | algorithmic_reasoning | expected_behavior_stated | unknown | reproduction_check; edge_case_testing | easy; mean reward 0.6250; 200 scored trials |
| 9 | deep | feature_implementation | developer_tools | GitHub_Actions | repository_exploration | unknown | algorithmic_reasoning | expected_behavior_stated | unknown | reproduction_check; edge_case_testing | very easy; mean reward 0.8250; 200 scored trials |
| 10 | deep | feature_implementation | databases_storage | SQL | repository_exploration | public_interface_schema_change | algorithmic_reasoning | expected_behavior_stated; explicit_requirements | unknown | artifact_verification; reproduction_check; edge_case_testing | very easy; mean reward 0.8600; 200 scored trials |
| 11 | frontier | data_compression | audio_processing; data_compression | Python | unknown | local_edit | algorithmic_reasoning | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | compatibility; dependency_restrictions | artifact_verification | very hard; mean reward 0.0230; 50 scored trials |
| 12 | frontier | performance_optimization | graphics_image_processing; performance_optimization | Zig; C_ABI; SIMD | external_api_documentation | coordinated_edits_within_component | algorithmic_reasoning; architectural_tradeoffs | explicit_requirements; location_supplied; environment_supplied | performance; compatibility; dependency_restrictions | performance_measurement; integration_tests | very hard; mean reward 0.0681; 50 scored trials |
| 13 | frontier | reimplementation | language_tooling; performance_optimization | x86_64_assembly; C_ABI; libc | external_api_documentation | unknown | state_concurrency_reasoning; architectural_tradeoffs | expected_behavior_stated; location_supplied; environment_supplied | performance; compatibility; dependency_restrictions | integration_tests; performance_measurement | hard; mean reward 0.1251; 50 scored trials |
| 14 | frontier | model_training | machine_learning; mathematics | Qwen3-14B; PEFT | external_api_documentation | unknown | algorithmic_reasoning | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | dependency_restrictions | artifact_generation | hard; mean reward 0.1243; 50 scored trials |
| 15 | frontier | model_training | machine_learning; games | Qwen3-8B; PEFT_LoRA | external_api_documentation | local_edit | algorithmic_reasoning | explicit_requirements; expected_behavior_stated; location_supplied; environment_supplied | dependency_restrictions; compatibility | artifact_generation | medium; mean reward 0.1776; 50 scored trials |
| 16 | frontier | reimplementation | scientific_software; numerical_computing | Rust | external_api_documentation | unknown | algorithmic_reasoning | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | compatibility; dependency_restrictions | model_evaluation | medium; mean reward 0.1768; 50 scored trials |
| 17 | frontier | reimplementation | game_development; audio_processing | C; Game_Boy_Advance | external_api_documentation | unknown | state_concurrency_reasoning | expected_behavior_stated; location_supplied; environment_supplied | compatibility; dependency_restrictions | integration_tests | easy; mean reward 0.2891; 50 scored trials |
| 18 | frontier | feature_implementation | scientific_software; statistical_inference | unknown | external_api_documentation | unknown | statistical_reasoning | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | compatibility; dependency_restrictions | model_evaluation | easy; mean reward 0.3607; 50 scored trials |
| 19 | frontier | feature_implementation | quantum_computing | Python | repository_architecture | local_edit | algorithmic_reasoning; architectural_tradeoffs | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | performance; dependency_restrictions | evaluation_harness | very easy; mean reward 0.6096; 50 scored trials |
| 20 | frontier | reimplementation | compilers_language_tooling; digital_logic | Swift; Foundation | supplied_snippet | unknown | state_concurrency_reasoning | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | dependency_restrictions; compatibility | unit_tests | very easy; mean reward 0.5523; 50 scored trials |
| 21 | program | reimplementation; reverse_engineering | unknown | unknown | supplied_binary; bundled_documentation | whole_program_implementation | black_box_behavioral_inference | location_supplied; environment_supplied; behavior_specified_by_executable | compatibility; no_internet; source_retrieval_prohibited; binary_wrapping_prohibited; no_decompilation_or_tracing; dependency_setup_required; fresh_build_required; artifact_exclusion | behavioral_testing; build_checking | very hard; mean reward 0.9463; 21 scored trials |
| 22 | program | reimplementation; reverse_engineering | unknown | unknown | supplied_binary; bundled_documentation | whole_program_implementation | black_box_behavioral_inference | location_supplied; environment_supplied; behavior_specified_by_executable | compatibility; no_internet; source_retrieval_prohibited; binary_wrapping_prohibited; no_decompilation_or_tracing; dependency_setup_required; fresh_build_required; artifact_exclusion | behavioral_testing; build_checking | very hard; mean reward 0.9658; 21 scored trials |
| 23 | program | reimplementation; reverse_engineering | unknown | unknown | supplied_binary; bundled_documentation | whole_program_implementation | black_box_behavioral_inference | location_supplied; environment_supplied; behavior_specified_by_executable | compatibility; no_internet; source_retrieval_prohibited; binary_wrapping_prohibited; no_decompilation_or_tracing; dependency_setup_required; fresh_build_required; artifact_exclusion | behavioral_testing; build_checking | hard; mean reward 0.9920; 21 scored trials |
| 24 | program | reimplementation; reverse_engineering | unknown | unknown | supplied_binary; bundled_documentation | whole_program_implementation | black_box_behavioral_inference | location_supplied; environment_supplied; behavior_specified_by_executable | compatibility; no_internet; source_retrieval_prohibited; binary_wrapping_prohibited; no_decompilation_or_tracing; dependency_setup_required; fresh_build_required; artifact_exclusion | behavioral_testing; build_checking | hard; mean reward 0.9975; 21 scored trials |
| 25 | program | reimplementation; reverse_engineering | unknown | unknown | supplied_binary; bundled_documentation | whole_program_implementation | black_box_behavioral_inference | location_supplied; environment_supplied; behavior_specified_by_executable | compatibility; no_internet; source_retrieval_prohibited; binary_wrapping_prohibited; no_decompilation_or_tracing; dependency_setup_required; fresh_build_required; artifact_exclusion | behavioral_testing; build_checking | medium; mean reward 0.9978; 21 scored trials |
| 26 | program | reimplementation; reverse_engineering | unknown | unknown | supplied_binary; bundled_documentation | whole_program_implementation | black_box_behavioral_inference | location_supplied; environment_supplied; behavior_specified_by_executable | compatibility; no_internet; source_retrieval_prohibited; binary_wrapping_prohibited; no_decompilation_or_tracing; dependency_setup_required; fresh_build_required; artifact_exclusion | behavioral_testing; build_checking | medium; mean reward 0.9991; 21 scored trials |
| 27 | program | reimplementation; reverse_engineering | unknown | unknown | supplied_binary; bundled_documentation | whole_program_implementation | black_box_behavioral_inference | location_supplied; environment_supplied; behavior_specified_by_executable | compatibility; no_internet; source_retrieval_prohibited; binary_wrapping_prohibited; no_decompilation_or_tracing; dependency_setup_required; fresh_build_required; artifact_exclusion | behavioral_testing; build_checking | easy; mean reward 0.9999; 21 scored trials |
| 28 | program | reimplementation; reverse_engineering | unknown | unknown | supplied_binary; bundled_documentation | whole_program_implementation | black_box_behavioral_inference | location_supplied; environment_supplied; behavior_specified_by_executable | compatibility; no_internet; source_retrieval_prohibited; binary_wrapping_prohibited; no_decompilation_or_tracing; dependency_setup_required; fresh_build_required; artifact_exclusion | behavioral_testing; build_checking | easy; mean reward 0.9996; 21 scored trials |
| 29 | program | reimplementation; reverse_engineering | unknown | unknown | supplied_binary; bundled_documentation | whole_program_implementation | black_box_behavioral_inference | location_supplied; environment_supplied; behavior_specified_by_executable | compatibility; no_internet; source_retrieval_prohibited; binary_wrapping_prohibited; no_decompilation_or_tracing; dependency_setup_required; fresh_build_required; artifact_exclusion | behavioral_testing; build_checking | very easy; mean reward 1.0000; 21 scored trials |
| 30 | program | reimplementation; reverse_engineering | unknown | unknown | supplied_binary; bundled_documentation | whole_program_implementation | black_box_behavioral_inference | location_supplied; environment_supplied; behavior_specified_by_executable | compatibility; no_internet; source_retrieval_prohibited; binary_wrapping_prohibited; no_decompilation_or_tracing; dependency_setup_required; fresh_build_required; artifact_exclusion | behavioral_testing; build_checking | very easy; mean reward 1.0000; 21 scored trials |
| 31 | swepro1 | bug_fix; feature_implementation | web_application; file_management; data_cleanup | NodeBB; Node.js; filesystem | supplied_reproduction; existing_behavior_description | public_interface_change; whole_program_implementation | filesystem_cleanup; path_validation; account_deletion | explicit_requirements; interface_specification | allowed_upload_path_constraint; handle_missing_file_constraint; supported_image_extension_constraint | reproduction_check; file_removal_verification; account_deletion_verification | very hard; mean reward 0.0000; 14 scored trials |
| 32 | swepro1 | refactoring | text_parsing; expression_language; security | Teleport; Go; AST; regular expressions | existing_codebase | cross_component_change | expression_ast_evaluation_reasoning; namespace_and_variable_validation_reasoning; function_arity_and_type_validation_reasoning | expected_behavior_stated; explicit_requirements; location_supplied | bounded_expression_depth; reject_unknown_or_unsupported_constructs; empty_interpolation_is_not_found | behavioral_testing | very hard; mean reward 0.0000; 11 scored trials |
| 33 | swepro1 | bug_fix | configuration_management; cloud_integration | Vuls; Go; TOML; UUID | existing_codebase | local_edit | conditional_persistence_reasoning; host_container_identity_link_reasoning | expected_behavior_stated; explicit_requirements | reuse_valid_existing_uuids; write_config_only_when_values_change; container_keeps_host_uuid | behavioral_testing | hard; mean reward 0.0714; 14 scored trials |
| 34 | swepro1 | feature_implementation | music_library_media_scanning; album_artwork_path_storage; database_schema_migration | Navidrome; Go; filepath | directory_scan_and_album_refresh_context; incremental_rescan_and_directory_deletion_context | whole_program_implementation; public_interface_change | per_directory_image_inventory; path_joining_and_platform_list_separator; directory_map_propagation_through_rescan | explicit_requirements; interface_specification | preserve_other_folder_scan_counters; sorted_deduplicated_media_directories; rescan_media_after_schema_migration | multiple_directory_image_path_join_case_check; incremental_rescan_directory_map_case_check; folder_change_signature_case_check | hard; mean reward 0.0714; 14 scored trials |
| 35 | swepro1 | bug_fix; feature_implementation; conflicting_requirements | trusted_cluster_heartbeat_status; audit_recording_and_upload | Teleport; Go | RemoteCluster_tunnel_connection_context; legacy_audit_session_recording_context | whole_program_implementation; public_interface_change | preserve_last_heartbeat_after_connection_removal; legacy_recording_unpack_detection; upload_checkpoint_and_completion_management | conflicting_requirements; explicit_requirements; interface_specification | retain_latest_valid_heartbeat_when_offline; only_persist_on_status_or_new_heartbeat_change; legacy_unpacked_recording_skips_download | offline_remote_cluster_heartbeat_case_check; unpacked_legacy_recording_download_skip_case_check | medium; mean reward 0.2308; 13 scored trials |
| 36 | swepro1 | type_annotation_refactoring; code_cleanup | list_data_model_and_seed_processing; static_type_analysis | Open Library; Python; TypedDict | polymorphic_list_seed_value_context; subject_pseudo_key_normalization_context | whole_program_implementation; public_interface_change | typed_dict_and_return_annotation_design; seed_type_guarding_and_normalization; duplicate_detection_by_normalized_key | explicit_requirements; interface_specification | support_Thing_SeedDict_and_SeedSubjectString_inputs; preserve_export_list_three_named_categories | subject_key_normalization_case_check; all_seed_forms_add_remove_case_check; typed_export_list_shape_case_check | medium; mean reward 0.1429; 14 scored trials |
| 37 | swepro1 | dependency_injection_refactoring; bug_fix | Subsonic_API_router_construction; playback_service_integration | Navidrome; Go | router_test_instantiation_context; playback_server_dependency_context | public_constructor_interface_change; localized_dependency_wiring_change | dependency_injected_playback_server_construction; generated_wire_injector | explicit_requirements; function_interface_specification | preserve_existing_Subsonic_API_functionality; integrate_playback_service_when_provided | router_instantiates_with_updated_signature_case_check; playback_dependency_integration_case_check | easy; mean reward 0.5385; 13 scored trials |
| 38 | swepro1 | security_fix | email_attachment_sanitization; cross_site_scripting_prevention | Tutanota; TypeScript; SVG; XML | inline_email_SVG_attachment_processing_context; user_opened_image_must_not_execute_embedded_script_context | whole_program_implementation; public_interface_change | SVG_XML_parsing_and_script_node_removal; safe_content_canonicalization; inline_attachment_pipeline_integration | explicit_requirements; method_interface_specification | non_SVG_attachments_return_unchanged; malformed_XML_returns_empty_data_with_original_metadata; preserve_visual_non_executable_elements_and_attributes | embedded_script_removed_case_check; invalid_UTF8_XML_empty_data_case_check; non_SVG_identity_case_check | easy; mean reward 0.4615; 13 scored trials |
| 39 | swepro1 | bug_fix | plugin_management; input_validation | NodeBB; Node.js | existing_behavior_description | local_edit | identifier_validation | expected_behavior_stated; explicit_requirements | reject_invalid_identifier_before_mutation | invalid_identifier_case_verification | very easy; mean reward 0.5714; 14 scored trials |
| 40 | swepro1 | refactoring; security_hardening | automation_tooling; input_parsing | Ansible; Python; JSON | existing_behavior_description; repository_code | whole_program_implementation | safe_data_parsing; deprecation_signaling | explicit_requirements; expected_behavior_stated | no_arbitrary_code_execution; accepted_input_forms_preserved | valid_input_form_verification; unsafe_expression_rejection_check; deprecation_warning_check | very easy; mean reward 0.9167; 12 scored trials |
| 41 | terminal21 | semantic_search | information_retrieval; text_embeddings | MTEB; BGE | supplied_documents | result_file | similarity_ranking | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | model_revision; package_version | model_loading; result_artifact | very hard; mean reward 0.5545; 110 scored trials |
| 42 | terminal21 | protein_design | protein_engineering; molecular_biology | PDB_API; FPbase_API | sequence_resources; protein_reference; external_protein_data | single_sequence_artifact | protein_selection; sequence_design | expected_behavior_stated; explicit_requirements; location_supplied | sequence_length; gc_content; sequence_order; external_data_accuracy | sequence_format; size_validation | very hard; mean reward 0.4545; 110 scored trials |
| 43 | terminal21 | security_testing | web_security; cross_site_scripting | HTML; JavaScript | supplied_program; validation_script | single_output_file | adversarial_security_reasoning | expected_behavior_stated; explicit_requirements; location_supplied | automatic_execution; interaction_free | test_script | hard; mean reward 0.7727; 110 scored trials |
| 44 | terminal21 | interface_implementation | terminal_emulation; shell_automation | Python; Bash | existing_interface | single_module_implementation | interactive_process_control; terminal_input_handling | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | startup_environment; system_install | importability | hard; mean reward 0.7545; 110 scored trials |
| 45 | terminal21 | software_build | computational_topology; scientific_computing | Python; Cython; NumPy | existing_package; documentation_snippet; existing_tests | package_build_and_compatibility | compatibility_debugging | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | version_compatibility; test_exclusions | integration_test; test_suite | medium; mean reward 0.8818; 110 scored trials |
| 46 | terminal21 | document_processing; data_extraction | document_processing; financial_data | unknown | supplied_documents | file_organization; report_generation | document_classification; financial_extraction | expected_behavior_stated; explicit_requirements; location_supplied | field_rule; precedence_rule; input_mutation | output_schema; directory_state | medium; mean reward 0.8807; 109 scored trials |
| 47 | terminal21 | numerical_optimization | probability; information_theory | Python; NumPy; SciPy | supplied_constraints | distribution_generator | numerical_optimization; constraint_solving | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | numerical_tolerance; vocabulary_size; validity | numerical_validation; artifact_format | easy; mean reward 0.9636; 110 scored trials |
| 48 | terminal21 | batch_scheduling | machine_learning_systems; batch_optimization | unknown | request_data | plan_artifacts | optimization; constraint_satisfaction | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | shape_alignment; shape_limit; performance_threshold; input_integrity | cost_model; performance_threshold; coverage | easy; mean reward 0.9364; 110 scored trials |
| 49 | terminal21 | data_inference; causal_modeling | bayesian_networks | unknown | supplied_dataset | data_artifact_generation; model_and_dataset_outputs | statistical_structure_learning; causal_inference | expected_behavior_stated; explicit_requirements; location_supplied | graph_structure; edge_count; intervention_value | artifact_generation; statistical_validation | very easy; mean reward 1.0000; 109 scored trials |
| 50 | terminal21 | service_implementation; automated_deployment | version_control; web_hosting | Git; SSH; Nginx; HTTPS | local_service | multi_branch_service | branch_deployment; service_integration | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | deployment_latency; branch_separation; self_signed_tls | end_to_end_push; http_test | very easy; mean reward 0.9817; 109 scored trials |
| 51 | terminal30 | security_bug_fix | binary_security; reverse_engineering; image_conversion | Python | stripped_service_binary; black_box_behavior | patcher_and_binary_artifacts | black_box_behavioral_inference; binary_analysis; generalization | expected_behavior_stated; explicit_requirements; location_supplied | original_binary_unchanged; patch_size_limit; preserve_valid_behavior; no_stub_or_wrapper | behavioral_testing; artifact_verification | very hard; mean reward 0.0000; 60 scored trials |
| 52 | terminal30 | operational_compliance_workflow | trade_compliance; customs_reporting; data_reconciliation | unknown | SOP_and_reference_filings; portal_error_catalog; service_credentials | multi_system_workflow | data_reconciliation; policy_interpretation; approval_workflow | expected_behavior_stated; explicit_requirements; location_supplied | four_eyes_approval; period_boundary_rules; archive_metadata_requirements | service_setup; submission_confirmation; artifact_verification | very hard; mean reward 0.0000; 60 scored trials |
| 53 | terminal30 | scientific_calculation | radiological_metrology; food_safety; analytical_chemistry | unknown | measurement_spreadsheet; sample_data; calibration_reference_pdf | calculation_artifact | scientific_reasoning; measurement_uncertainty; numerical_calculation | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | well_known_blank_assumption; significant_figures; exact_report_format | artifact_generation; calculation_validation | hard; mean reward 0.0500; 60 scored trials |
| 54 | terminal30 | parametric_modeling | computer_aided_design; mechanical_engineering; turbomachinery | FreeCAD; Python | explicit_geometry_specification | script_and_model_artifacts | geometric_reasoning; parametric_design | expected_behavior_stated; explicit_requirements; location_supplied | single_solid; feature_tree_required; parameter_edit_invariant | artifact_generation; artifact_verification | hard; mean reward 0.0333; 60 scored trials |
| 55 | terminal30 | parameter_optimization | advertising_technology; causal_measurement; online_control | unknown | running_service; OpenAPI_specification; streamed_event_data | operational_configuration | statistical_reasoning; optimization; noise_robustness | expected_behavior_stated; explicit_requirements; location_supplied | minimum_airtime; change_freeze_window; target_metric | service_setup; metric_evaluation | medium; mean reward 0.1500; 60 scored trials |
| 56 | terminal30 | financial_calculation | counterparty_credit_risk; regulatory_capital; finance | unknown | trade_and_csa_data; regulatory_factor_tables; holiday_calendars | analysis_and_workbook_artifacts | financial_reasoning; regulatory_calculation; formula_auditability | expected_behavior_stated; explicit_requirements; location_supplied | CRR3_rules; fixed_as_of_date; required_rounding; formula_preservation | artifact_generation; artifact_verification; calculation_reconciliation | medium; mean reward 0.2000; 60 scored trials |
| 57 | terminal30 | scientific_data_analysis | crystallography; hydrogen_bond_networks; topological_graph_analysis | unknown | CIF_structure_files; explicit_geometric_definitions | analysis_artifact | geometric_reasoning; graph_theory; scientific_classification | expected_behavior_stated; explicit_requirements; location_supplied | distance_and_angle_cutoffs; include_both_node_types; exact_output_schema | artifact_generation; numerical_validation | easy; mean reward 0.3167; 60 scored trials |
| 58 | terminal30 | database_migration | database_systems; web_api; distributed_systems | MySQL; PostgreSQL; Python | running_API_server; baseline_behavior | multi_service_migration | architectural_tradeoffs; concurrency_reasoning; consistency_reasoning | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | zero_downtime; no_stale_reads; behavioral_compatibility; latency_budget; future_deploy_state | integration_tests; latency_measurement; consistency_validation | easy; mean reward 0.2833; 60 scored trials |
| 59 | terminal30 | operational_planning | enterprise_resource_planning; procurement; manufacturing | Odoo | ERP_instance; operating_records; supplier_and_capacity_rules | multi_system_workflow | constraint_satisfaction; procurement_optimization; schedule_planning | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | customer_budgets; deadlines; capacity_limits; supplier_limits; traceable_lineage | service_setup; record_validation; artifact_verification | very easy; mean reward 0.6037; 60 scored trials |
| 60 | terminal30 | artifact_generation | graphic_design; computer_vision; layout_reconstruction | Python | target_layout_image; component_asset_library; renderer | configuration_artifact | visual_inference; geometric_reasoning; layer_composition | expected_behavior_stated; explicit_requirements; location_supplied | pixel_match_threshold; provided_assets_only; editable_text_requirement | rendered_artifact_comparison; pixel_accuracy_measurement | very easy; mean reward 0.6500; 60 scored trials |
| 61 | terminal40 | parametric_cad_modeling | mechanical_design | FreeCAD_Python | explicit_geometry_parameters | artifact_generation | parametric_modeling | explicit_requirements | structural_artifact_requirements | artifact_verification | very hard; mean reward 0.0074; 135 scored trials |
| 62 | terminal40 | workflow_cli_implementation | logistics_scheduling | CLI | event_feed_and_operational_packet | whole_program_implementation | stateful_planning | explicit_requirements; location_supplied | state_consistency | evaluation_harness | very hard; mean reward 0.0000; 135 scored trials |
| 63 | terminal40 | statistical_data_analysis | proteomics | Broad_GSEA_CLI | local_expression_dataset | analysis_and_artifact_generation | statistical_reasoning | explicit_requirements; location_supplied | reproducibility | artifact_generation | hard; mean reward 0.2741; 135 scored trials |
| 64 | terminal40 | visual_layout_reconstruction | graphic_design_reconstruction | CSS; Python | local_image_asset_library | structured_artifact_generation | visual_reconstruction | explicit_requirements; location_supplied | artifact_constraints | pixel_match_evaluation | hard; mean reward 0.1333; 135 scored trials |
| 65 | terminal40 | case_decision_workflow | warranty_claims | portal_API | local_policy_and_claim_data | external_workflow | policy_application | explicit_requirements; location_supplied | authoritative_local_policy | external_workflow | medium; mean reward 0.4370; 135 scored trials |
| 66 | terminal40 | regulatory_filing_workflow | trade_statistics_compliance | API | local_sop_and_reference_records | external_workflow | reconciliation_and_audit | explicit_requirements; location_supplied | filing_completion | external_workflow | medium; mean reward 0.4074; 135 scored trials |
| 67 | terminal40 | algorithm_implementation | cryptography | SageMath_Python | local_cipher_resources | whole_program_implementation | cryptanalysis | explicit_requirements; location_supplied | performance | artifact_generation | easy; mean reward 0.5704; 135 scored trials |
| 68 | terminal40 | cryptanalysis_tool | classical_cryptography | Python | ciphertext_input | whole_program_implementation | cryptanalysis | explicit_requirements; location_supplied | performance | behavioral_correctness | easy; mean reward 0.5926; 135 scored trials |
| 69 | terminal40 | formal_proof | formal_verification | Coq | formal_project_context | local_code_change | formal_proof_reasoning | explicit_requirements; location_supplied | formal_soundness | build_checking | very easy; mean reward 0.8370; 135 scored trials |
| 70 | terminal40 | model_checkpoint_conversion | machine_learning_checkpoints | Safetensors_HuggingFace | parallel_shards_and_reference_outputs | artifact_generation | tensor_parallel_reconstruction | explicit_requirements; location_supplied | compatibility | artifact_verification | very easy; mean reward 0.8444; 135 scored trials |
| 71 | toolathlon | analysis | data_analysis_and_statistics | Excel | workspace_files; email_context; existing_external_records; available_tool_excel; available_tool_emails | workspace_artifact_edit; external_communication | numerical_analysis; information_extraction | explicit_requirements; output_location_supplied; environment_or_service_supplied | threshold_or_filter | artifact_generation; external_communication | very hard; mean reward 0.0891; 101 scored trials |
| 72 | toolathlon | information_retrieval; artifact_or_record_creation; planning | education_administration | Excel | workspace_files; available_tool_pdf_tools; available_tool_excel | workspace_artifact_edit | information_extraction; planning_or_optimization | output_format_specified; explicit_requirements | scope_restriction; date_or_time_window | artifact_generation | very hard; mean reward 0.0000; 101 scored trials |
| 73 | toolathlon | artifact_or_record_creation | academic_research | GitHub; Git | email_context; available_tool_emails; available_tool_github | external_record_or_resource_change | information_extraction; source_research | environment_or_service_supplied | unknown | external_record_or_resource_change | hard; mean reward 0.1961; 102 scored trials |
| 74 | toolathlon | analysis; communication; planning | business_operations | WooCommerce | email_context; available_tool_woocommerce; available_tool_emails | external_communication | planning_or_optimization | environment_or_service_supplied | threshold_or_filter; date_or_time_window | external_communication | hard; mean reward 0.1700; 100 scored trials |
| 75 | toolathlon | analysis; artifact_or_record_creation | financial_analysis | Excel | workspace_files; available_tool_excel | workspace_artifact_edit | numerical_analysis | output_location_supplied | source_restriction | artifact_generation | medium; mean reward 0.4118; 102 scored trials |
| 76 | toolathlon | information_retrieval | business_operations | Google_Sheets; Kubernetes | workspace_files; available_tool_k8s; available_tool_google_sheet | workspace_artifact_edit | information_extraction | explicit_requirements; environment_or_service_supplied | unknown | unknown | medium; mean reward 0.3861; 101 scored trials |
| 77 | toolathlon | information_retrieval; artifact_or_record_creation | media_analysis | Notion; YouTube | existing_external_records; external_research; available_tool_playwright_with_chunk; available_tool_notion; available_tool_fetch; available_tool_web_search | external_record_or_resource_change | information_extraction; source_research | environment_or_service_supplied | unknown | external_record_or_resource_change; requested_completion_check | easy; mean reward 0.5545; 101 scored trials |
| 78 | toolathlon | analysis | personal_productivity | unknown | workspace_files; email_context; existing_external_records; available_tool_emails; available_tool_snowflake; available_tool_pdf_tools | external_communication | information_extraction | output_format_specified | source_restriction; threshold_or_filter | external_communication | easy; mean reward 0.4804; 102 scored trials |
| 79 | toolathlon | information_retrieval | academic_research | arXiv | workspace_files; external_research; available_tool_arxiv_local; available_tool_scholarly | unknown | information_extraction; source_research | explicit_requirements | scope_restriction; date_or_time_window | requested_completion_check | very easy; mean reward 0.7941; 102 scored trials |
| 80 | toolathlon | analysis; artifact_or_record_creation | software_and_data_tools | GitHub; Git | workspace_files; available_tool_fetch; available_tool_web_search | workspace_artifact_edit | unknown | output_format_specified; output_location_supplied; environment_or_service_supplied | unknown | artifact_generation | very easy; mean reward 0.9314; 102 scored trials |
| 81 | verified | bug_report_investigation | data_visualization | Matplotlib; Python; LaTeX; pandas | datetime_axis_reproduction | local_edit | rendered_spacing_comparison | expected_output_comparison | version_comparison | rendering_reproduction | very hard; mean reward 0.0000; 15 scored trials |
| 82 | verified | API_consistency_fix | scientific_data_processing | xarray; Python | DataArray_and_Dataset_API_comparison | public_API_parameter_change | coordinate_vs_dimension_semantics | expected_behavior_stated | preserve_coordinate_semantics | unknown | very hard; mean reward 0.0000; 15 scored trials |
| 83 | verified | feature_implementation | database_storage | Django; Python | supplied_reproduction; existing_behavior_description | local_edit | data_model_reasoning | expected_behavior_stated; explicit_requirements | unknown | reproduction_check; expected_result_check | hard; mean reward 0.0667; 15 scored trials |
| 84 | verified | bug_fix | symbolic_mathematics; code_generation | SymPy; Python; Unicode | supplied_snippet | local_edit | unicode_rendering_reasoning | expected_behavior_stated | subscript_formatting | unknown | hard; mean reward 0.0667; 15 scored trials |
| 85 | verified | feature_implementation | web_application_frameworks | Django; PostgreSQL | database_configuration_context | public_configuration_change | configuration_propagation | explicit_requirements; expected_behavior_stated | mutual_tls_context | unknown | medium; mean reward 0.2000; 15 scored trials |
| 86 | verified | bug_fix | networking; date_time_processing | Django | standard_requirement_provided; current_behavior_described | component_change | date_calculation_reasoning | expected_behavior_stated | RFC_7231_compatibility | expected_result_check | medium; mean reward 0.1333; 15 scored trials |
| 87 | verified | bug_fix | data_format_registry | Python; Astropy; HENDRICS | error_trace; reproduction_steps | library_source_change | root_cause_analysis; regression_compatibility_analysis | failing_behavior_stated; reproduction_provided | unknown | regression_testing | easy; mean reward 0.4000; 15 scored trials |
| 88 | verified | feature_request | scientific_data_processing | xarray; Python | multi_dimension_reduction_example | local_edit | valid_element_count_across_dimensions | explicit_requirements; expected_behavior_stated | min_count_multi_dimension_case | unknown | easy; mean reward 0.3333; 15 scored trials |
| 89 | verified | behavior_change | database_storage | Django; Python | code_example_supplied; version_behavior_described | component_change | compatibility_reasoning; database_state_reasoning | expected_behavior_stated; example_provided | backward_compatibility | reproduction_example; expected_result_check | very easy; mean reward 0.5333; 15 scored trials |
| 90 | verified | bug_fix | command_line_utilities; documentation_tooling | Sphinx; Python | existing_codebase | local_edit | interactive_cli_reasoning | expected_behavior_stated | exit_behavior | behavioral_testing | very easy; mean reward 0.5333; 15 scored trials |