10 tasks from each of 13 benchmarks. Nine scored benchmarks: two tasks per difficulty level, chosen for different intents and technical domains. Four benchmarks without trials (original SWE-bench, Pro V2, SWE Atlas, RealSWE): 10 diverse tasks each, emphasizing intent and technology stack; difficulty remains unknown. Levels are relative to each benchmark; raw tags remain unchanged.
| # | Benchmark | Task intent | Technical domain | Technology stack | Context requirements | Change scope | Reasoning demands | Specification completeness | Constraints | Execution and verification | Difficulty (within benchmark) |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | deep | feature_implementation | static_analysis | Python | repository_exploration | public_interface_schema_change | algorithmic_reasoning; state_concurrency_reasoning | expected_behavior_stated | unknown | reproduction_check; edge_case_testing | very hard; mean reward 0.0550; 200 scored trials |
| 2 | deep | feature_implementation | compilers_language_tooling | CSS | repository_exploration | public_interface_schema_change | algorithmic_reasoning | expected_behavior_stated | unknown | reproduction_check; edge_case_testing | very hard; mean reward 0.2750; 200 scored trials |
| 3 | deep | feature_implementation | backend_api | unknown | repository_exploration | unknown | algorithmic_reasoning; state_concurrency_reasoning | expected_behavior_stated | unknown | reproduction_check; edge_case_testing | hard; mean reward 0.3250; 200 scored trials |
| 4 | deep | feature_implementation | terminal_ui | JavaScript | repository_exploration | unknown | algorithmic_reasoning; state_concurrency_reasoning | expected_behavior_stated; explicit_requirements | compatibility | reproduction_check; edge_case_testing | hard; mean reward 0.3400; 200 scored trials |
| 5 | deep | feature_implementation | data_serialization | Python | repository_exploration | public_interface_schema_change | algorithmic_reasoning; state_concurrency_reasoning | expected_behavior_stated | unknown | reproduction_check; edge_case_testing | medium; mean reward 0.6000; 200 scored trials |
| 6 | deep | feature_implementation | cli_tooling | unknown | repository_exploration | unknown | algorithmic_reasoning; state_concurrency_reasoning | expected_behavior_stated; environment_supplied | compatibility | reproduction_check; edge_case_testing | medium; mean reward 0.5250; 200 scored trials |
| 7 | deep | feature_implementation | cloud_infrastructure | Go | repository_exploration | public_interface_schema_change | algorithmic_reasoning; state_concurrency_reasoning | expected_behavior_stated | performance | reproduction_check; edge_case_testing | easy; mean reward 0.6850; 200 scored trials |
| 8 | deep | feature_implementation | data_processing | Go | repository_exploration | public_interface_schema_change | algorithmic_reasoning | expected_behavior_stated | unknown | reproduction_check; edge_case_testing | easy; mean reward 0.6250; 200 scored trials |
| 9 | deep | feature_implementation | developer_tools | GitHub_Actions | repository_exploration | unknown | algorithmic_reasoning | expected_behavior_stated | unknown | reproduction_check; edge_case_testing | very easy; mean reward 0.8250; 200 scored trials |
| 10 | deep | feature_implementation | databases_storage | SQL | repository_exploration | public_interface_schema_change | algorithmic_reasoning | expected_behavior_stated; explicit_requirements | unknown | artifact_verification; reproduction_check; edge_case_testing | very easy; mean reward 0.8600; 200 scored trials |
| 11 | frontier | data_compression | audio_processing; data_compression | Python | unknown | local_edit | algorithmic_reasoning | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | compatibility; dependency_restrictions | artifact_verification | very hard; mean reward 0.0230; 50 scored trials |
| 12 | frontier | performance_optimization | graphics_image_processing; performance_optimization | Zig; C_ABI; SIMD | external_api_documentation | coordinated_edits_within_component | algorithmic_reasoning; architectural_tradeoffs | explicit_requirements; location_supplied; environment_supplied | performance; compatibility; dependency_restrictions | performance_measurement; integration_tests | very hard; mean reward 0.0681; 50 scored trials |
| 13 | frontier | reimplementation | language_tooling; performance_optimization | x86_64_assembly; C_ABI; libc | external_api_documentation | unknown | state_concurrency_reasoning; architectural_tradeoffs | expected_behavior_stated; location_supplied; environment_supplied | performance; compatibility; dependency_restrictions | integration_tests; performance_measurement | hard; mean reward 0.1251; 50 scored trials |
| 14 | frontier | model_training | machine_learning; mathematics | Qwen3-14B; PEFT | external_api_documentation | unknown | algorithmic_reasoning | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | dependency_restrictions | artifact_generation | hard; mean reward 0.1243; 50 scored trials |
| 15 | frontier | model_training | machine_learning; games | Qwen3-8B; PEFT_LoRA | external_api_documentation | local_edit | algorithmic_reasoning | explicit_requirements; expected_behavior_stated; location_supplied; environment_supplied | dependency_restrictions; compatibility | artifact_generation | medium; mean reward 0.1776; 50 scored trials |
| 16 | frontier | reimplementation | scientific_software; numerical_computing | Rust | external_api_documentation | unknown | algorithmic_reasoning | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | compatibility; dependency_restrictions | model_evaluation | medium; mean reward 0.1768; 50 scored trials |
| 17 | frontier | reimplementation | game_development; audio_processing | C; Game_Boy_Advance | external_api_documentation | unknown | state_concurrency_reasoning | expected_behavior_stated; location_supplied; environment_supplied | compatibility; dependency_restrictions | integration_tests | easy; mean reward 0.2891; 50 scored trials |
| 18 | frontier | feature_implementation | scientific_software; statistical_inference | unknown | external_api_documentation | unknown | statistical_reasoning | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | compatibility; dependency_restrictions | model_evaluation | easy; mean reward 0.3607; 50 scored trials |
| 19 | frontier | feature_implementation | quantum_computing | Python | repository_architecture | local_edit | algorithmic_reasoning; architectural_tradeoffs | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | performance; dependency_restrictions | evaluation_harness | very easy; mean reward 0.6096; 50 scored trials |
| 20 | frontier | reimplementation | compilers_language_tooling; digital_logic | Swift; Foundation | supplied_snippet | unknown | state_concurrency_reasoning | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | dependency_restrictions; compatibility | unit_tests | very easy; mean reward 0.5523; 50 scored trials |
| 21 | program | reimplementation; reverse_engineering | unknown | unknown | supplied_binary; bundled_documentation | whole_program_implementation | black_box_behavioral_inference | location_supplied; environment_supplied; behavior_specified_by_executable | compatibility; no_internet; source_retrieval_prohibited; binary_wrapping_prohibited; no_decompilation_or_tracing; dependency_setup_required; fresh_build_required; artifact_exclusion | behavioral_testing; build_checking | very hard; mean reward 0.9463; 21 scored trials |
| 22 | program | reimplementation; reverse_engineering | unknown | unknown | supplied_binary; bundled_documentation | whole_program_implementation | black_box_behavioral_inference | location_supplied; environment_supplied; behavior_specified_by_executable | compatibility; no_internet; source_retrieval_prohibited; binary_wrapping_prohibited; no_decompilation_or_tracing; dependency_setup_required; fresh_build_required; artifact_exclusion | behavioral_testing; build_checking | very hard; mean reward 0.9658; 21 scored trials |
| 23 | program | reimplementation; reverse_engineering | unknown | unknown | supplied_binary; bundled_documentation | whole_program_implementation | black_box_behavioral_inference | location_supplied; environment_supplied; behavior_specified_by_executable | compatibility; no_internet; source_retrieval_prohibited; binary_wrapping_prohibited; no_decompilation_or_tracing; dependency_setup_required; fresh_build_required; artifact_exclusion | behavioral_testing; build_checking | hard; mean reward 0.9920; 21 scored trials |
| 24 | program | reimplementation; reverse_engineering | unknown | unknown | supplied_binary; bundled_documentation | whole_program_implementation | black_box_behavioral_inference | location_supplied; environment_supplied; behavior_specified_by_executable | compatibility; no_internet; source_retrieval_prohibited; binary_wrapping_prohibited; no_decompilation_or_tracing; dependency_setup_required; fresh_build_required; artifact_exclusion | behavioral_testing; build_checking | hard; mean reward 0.9975; 21 scored trials |
| 25 | program | reimplementation; reverse_engineering | unknown | unknown | supplied_binary; bundled_documentation | whole_program_implementation | black_box_behavioral_inference | location_supplied; environment_supplied; behavior_specified_by_executable | compatibility; no_internet; source_retrieval_prohibited; binary_wrapping_prohibited; no_decompilation_or_tracing; dependency_setup_required; fresh_build_required; artifact_exclusion | behavioral_testing; build_checking | medium; mean reward 0.9978; 21 scored trials |
| 26 | program | reimplementation; reverse_engineering | unknown | unknown | supplied_binary; bundled_documentation | whole_program_implementation | black_box_behavioral_inference | location_supplied; environment_supplied; behavior_specified_by_executable | compatibility; no_internet; source_retrieval_prohibited; binary_wrapping_prohibited; no_decompilation_or_tracing; dependency_setup_required; fresh_build_required; artifact_exclusion | behavioral_testing; build_checking | medium; mean reward 0.9991; 21 scored trials |
| 27 | program | reimplementation; reverse_engineering | unknown | unknown | supplied_binary; bundled_documentation | whole_program_implementation | black_box_behavioral_inference | location_supplied; environment_supplied; behavior_specified_by_executable | compatibility; no_internet; source_retrieval_prohibited; binary_wrapping_prohibited; no_decompilation_or_tracing; dependency_setup_required; fresh_build_required; artifact_exclusion | behavioral_testing; build_checking | easy; mean reward 0.9999; 21 scored trials |
| 28 | program | reimplementation; reverse_engineering | unknown | unknown | supplied_binary; bundled_documentation | whole_program_implementation | black_box_behavioral_inference | location_supplied; environment_supplied; behavior_specified_by_executable | compatibility; no_internet; source_retrieval_prohibited; binary_wrapping_prohibited; no_decompilation_or_tracing; dependency_setup_required; fresh_build_required; artifact_exclusion | behavioral_testing; build_checking | easy; mean reward 0.9996; 21 scored trials |
| 29 | program | reimplementation; reverse_engineering | unknown | unknown | supplied_binary; bundled_documentation | whole_program_implementation | black_box_behavioral_inference | location_supplied; environment_supplied; behavior_specified_by_executable | compatibility; no_internet; source_retrieval_prohibited; binary_wrapping_prohibited; no_decompilation_or_tracing; dependency_setup_required; fresh_build_required; artifact_exclusion | behavioral_testing; build_checking | very easy; mean reward 1.0000; 21 scored trials |
| 30 | program | reimplementation; reverse_engineering | unknown | unknown | supplied_binary; bundled_documentation | whole_program_implementation | black_box_behavioral_inference | location_supplied; environment_supplied; behavior_specified_by_executable | compatibility; no_internet; source_retrieval_prohibited; binary_wrapping_prohibited; no_decompilation_or_tracing; dependency_setup_required; fresh_build_required; artifact_exclusion | behavioral_testing; build_checking | very easy; mean reward 1.0000; 21 scored trials |
| 31 | swepro1 | bug_fix; feature_implementation | web_application; file_management; data_cleanup | NodeBB; Node.js; filesystem | supplied_reproduction; existing_behavior_description | public_interface_change; whole_program_implementation | filesystem_cleanup; path_validation; account_deletion | explicit_requirements; interface_specification | allowed_upload_path_constraint; handle_missing_file_constraint; supported_image_extension_constraint | reproduction_check; file_removal_verification; account_deletion_verification | very hard; mean reward 0.0000; 14 scored trials |
| 32 | swepro1 | refactoring | text_parsing; expression_language; security | Teleport; Go; AST; regular expressions | existing_codebase | cross_component_change | expression_ast_evaluation_reasoning; namespace_and_variable_validation_reasoning; function_arity_and_type_validation_reasoning | expected_behavior_stated; explicit_requirements; location_supplied | bounded_expression_depth; reject_unknown_or_unsupported_constructs; empty_interpolation_is_not_found | behavioral_testing | very hard; mean reward 0.0000; 11 scored trials |
| 33 | swepro1 | bug_fix | configuration_management; cloud_integration | Vuls; Go; TOML; UUID | existing_codebase | local_edit | conditional_persistence_reasoning; host_container_identity_link_reasoning | expected_behavior_stated; explicit_requirements | reuse_valid_existing_uuids; write_config_only_when_values_change; container_keeps_host_uuid | behavioral_testing | hard; mean reward 0.0714; 14 scored trials |
| 34 | swepro1 | feature_implementation | music_library_media_scanning; album_artwork_path_storage; database_schema_migration | Navidrome; Go; filepath | directory_scan_and_album_refresh_context; incremental_rescan_and_directory_deletion_context | whole_program_implementation; public_interface_change | per_directory_image_inventory; path_joining_and_platform_list_separator; directory_map_propagation_through_rescan | explicit_requirements; interface_specification | preserve_other_folder_scan_counters; sorted_deduplicated_media_directories; rescan_media_after_schema_migration | multiple_directory_image_path_join_case_check; incremental_rescan_directory_map_case_check; folder_change_signature_case_check | hard; mean reward 0.0714; 14 scored trials |
| 35 | swepro1 | bug_fix; feature_implementation; conflicting_requirements | trusted_cluster_heartbeat_status; audit_recording_and_upload | Teleport; Go | RemoteCluster_tunnel_connection_context; legacy_audit_session_recording_context | whole_program_implementation; public_interface_change | preserve_last_heartbeat_after_connection_removal; legacy_recording_unpack_detection; upload_checkpoint_and_completion_management | conflicting_requirements; explicit_requirements; interface_specification | retain_latest_valid_heartbeat_when_offline; only_persist_on_status_or_new_heartbeat_change; legacy_unpacked_recording_skips_download | offline_remote_cluster_heartbeat_case_check; unpacked_legacy_recording_download_skip_case_check | medium; mean reward 0.2308; 13 scored trials |
| 36 | swepro1 | type_annotation_refactoring; code_cleanup | list_data_model_and_seed_processing; static_type_analysis | Open Library; Python; TypedDict | polymorphic_list_seed_value_context; subject_pseudo_key_normalization_context | whole_program_implementation; public_interface_change | typed_dict_and_return_annotation_design; seed_type_guarding_and_normalization; duplicate_detection_by_normalized_key | explicit_requirements; interface_specification | support_Thing_SeedDict_and_SeedSubjectString_inputs; preserve_export_list_three_named_categories | subject_key_normalization_case_check; all_seed_forms_add_remove_case_check; typed_export_list_shape_case_check | medium; mean reward 0.1429; 14 scored trials |
| 37 | swepro1 | dependency_injection_refactoring; bug_fix | Subsonic_API_router_construction; playback_service_integration | Navidrome; Go | router_test_instantiation_context; playback_server_dependency_context | public_constructor_interface_change; localized_dependency_wiring_change | dependency_injected_playback_server_construction; generated_wire_injector | explicit_requirements; function_interface_specification | preserve_existing_Subsonic_API_functionality; integrate_playback_service_when_provided | router_instantiates_with_updated_signature_case_check; playback_dependency_integration_case_check | easy; mean reward 0.5385; 13 scored trials |
| 38 | swepro1 | security_fix | email_attachment_sanitization; cross_site_scripting_prevention | Tutanota; TypeScript; SVG; XML | inline_email_SVG_attachment_processing_context; user_opened_image_must_not_execute_embedded_script_context | whole_program_implementation; public_interface_change | SVG_XML_parsing_and_script_node_removal; safe_content_canonicalization; inline_attachment_pipeline_integration | explicit_requirements; method_interface_specification | non_SVG_attachments_return_unchanged; malformed_XML_returns_empty_data_with_original_metadata; preserve_visual_non_executable_elements_and_attributes | embedded_script_removed_case_check; invalid_UTF8_XML_empty_data_case_check; non_SVG_identity_case_check | easy; mean reward 0.4615; 13 scored trials |
| 39 | swepro1 | bug_fix | plugin_management; input_validation | NodeBB; Node.js | existing_behavior_description | local_edit | identifier_validation | expected_behavior_stated; explicit_requirements | reject_invalid_identifier_before_mutation | invalid_identifier_case_verification | very easy; mean reward 0.5714; 14 scored trials |
| 40 | swepro1 | refactoring; security_hardening | automation_tooling; input_parsing | Ansible; Python; JSON | existing_behavior_description; repository_code | whole_program_implementation | safe_data_parsing; deprecation_signaling | explicit_requirements; expected_behavior_stated | no_arbitrary_code_execution; accepted_input_forms_preserved | valid_input_form_verification; unsafe_expression_rejection_check; deprecation_warning_check | very easy; mean reward 0.9167; 12 scored trials |
| 41 | terminal21 | semantic_search | information_retrieval; text_embeddings | MTEB; BGE | supplied_documents | result_file | similarity_ranking | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | model_revision; package_version | model_loading; result_artifact | very hard; mean reward 0.5545; 110 scored trials |
| 42 | terminal21 | protein_design | protein_engineering; molecular_biology | PDB_API; FPbase_API | sequence_resources; protein_reference; external_protein_data | single_sequence_artifact | protein_selection; sequence_design | expected_behavior_stated; explicit_requirements; location_supplied | sequence_length; gc_content; sequence_order; external_data_accuracy | sequence_format; size_validation | very hard; mean reward 0.4545; 110 scored trials |
| 43 | terminal21 | security_testing | web_security; cross_site_scripting | HTML; JavaScript | supplied_program; validation_script | single_output_file | adversarial_security_reasoning | expected_behavior_stated; explicit_requirements; location_supplied | automatic_execution; interaction_free | test_script | hard; mean reward 0.7727; 110 scored trials |
| 44 | terminal21 | interface_implementation | terminal_emulation; shell_automation | Python; Bash | existing_interface | single_module_implementation | interactive_process_control; terminal_input_handling | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | startup_environment; system_install | importability | hard; mean reward 0.7545; 110 scored trials |
| 45 | terminal21 | software_build | computational_topology; scientific_computing | Python; Cython; NumPy | existing_package; documentation_snippet; existing_tests | package_build_and_compatibility | compatibility_debugging | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | version_compatibility; test_exclusions | integration_test; test_suite | medium; mean reward 0.8818; 110 scored trials |
| 46 | terminal21 | document_processing; data_extraction | document_processing; financial_data | unknown | supplied_documents | file_organization; report_generation | document_classification; financial_extraction | expected_behavior_stated; explicit_requirements; location_supplied | field_rule; precedence_rule; input_mutation | output_schema; directory_state | medium; mean reward 0.8807; 109 scored trials |
| 47 | terminal21 | numerical_optimization | probability; information_theory | Python; NumPy; SciPy | supplied_constraints | distribution_generator | numerical_optimization; constraint_solving | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | numerical_tolerance; vocabulary_size; validity | numerical_validation; artifact_format | easy; mean reward 0.9636; 110 scored trials |
| 48 | terminal21 | batch_scheduling | machine_learning_systems; batch_optimization | unknown | request_data | plan_artifacts | optimization; constraint_satisfaction | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | shape_alignment; shape_limit; performance_threshold; input_integrity | cost_model; performance_threshold; coverage | easy; mean reward 0.9364; 110 scored trials |
| 49 | terminal21 | data_inference; causal_modeling | bayesian_networks | unknown | supplied_dataset | data_artifact_generation; model_and_dataset_outputs | statistical_structure_learning; causal_inference | expected_behavior_stated; explicit_requirements; location_supplied | graph_structure; edge_count; intervention_value | artifact_generation; statistical_validation | very easy; mean reward 1.0000; 109 scored trials |
| 50 | terminal21 | service_implementation; automated_deployment | version_control; web_hosting | Git; SSH; Nginx; HTTPS | local_service | multi_branch_service | branch_deployment; service_integration | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | deployment_latency; branch_separation; self_signed_tls | end_to_end_push; http_test | very easy; mean reward 0.9817; 109 scored trials |
| 51 | terminal30 | security_bug_fix | binary_security; reverse_engineering; image_conversion | Python | stripped_service_binary; black_box_behavior | patcher_and_binary_artifacts | black_box_behavioral_inference; binary_analysis; generalization | expected_behavior_stated; explicit_requirements; location_supplied | original_binary_unchanged; patch_size_limit; preserve_valid_behavior; no_stub_or_wrapper | behavioral_testing; artifact_verification | very hard; mean reward 0.0000; 60 scored trials |
| 52 | terminal30 | operational_compliance_workflow | trade_compliance; customs_reporting; data_reconciliation | unknown | SOP_and_reference_filings; portal_error_catalog; service_credentials | multi_system_workflow | data_reconciliation; policy_interpretation; approval_workflow | expected_behavior_stated; explicit_requirements; location_supplied | four_eyes_approval; period_boundary_rules; archive_metadata_requirements | service_setup; submission_confirmation; artifact_verification | very hard; mean reward 0.0000; 60 scored trials |
| 53 | terminal30 | scientific_calculation | radiological_metrology; food_safety; analytical_chemistry | unknown | measurement_spreadsheet; sample_data; calibration_reference_pdf | calculation_artifact | scientific_reasoning; measurement_uncertainty; numerical_calculation | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | well_known_blank_assumption; significant_figures; exact_report_format | artifact_generation; calculation_validation | hard; mean reward 0.0500; 60 scored trials |
| 54 | terminal30 | parametric_modeling | computer_aided_design; mechanical_engineering; turbomachinery | FreeCAD; Python | explicit_geometry_specification | script_and_model_artifacts | geometric_reasoning; parametric_design | expected_behavior_stated; explicit_requirements; location_supplied | single_solid; feature_tree_required; parameter_edit_invariant | artifact_generation; artifact_verification | hard; mean reward 0.0333; 60 scored trials |
| 55 | terminal30 | parameter_optimization | advertising_technology; causal_measurement; online_control | unknown | running_service; OpenAPI_specification; streamed_event_data | operational_configuration | statistical_reasoning; optimization; noise_robustness | expected_behavior_stated; explicit_requirements; location_supplied | minimum_airtime; change_freeze_window; target_metric | service_setup; metric_evaluation | medium; mean reward 0.1500; 60 scored trials |
| 56 | terminal30 | financial_calculation | counterparty_credit_risk; regulatory_capital; finance | unknown | trade_and_csa_data; regulatory_factor_tables; holiday_calendars | analysis_and_workbook_artifacts | financial_reasoning; regulatory_calculation; formula_auditability | expected_behavior_stated; explicit_requirements; location_supplied | CRR3_rules; fixed_as_of_date; required_rounding; formula_preservation | artifact_generation; artifact_verification; calculation_reconciliation | medium; mean reward 0.2000; 60 scored trials |
| 57 | terminal30 | scientific_data_analysis | crystallography; hydrogen_bond_networks; topological_graph_analysis | unknown | CIF_structure_files; explicit_geometric_definitions | analysis_artifact | geometric_reasoning; graph_theory; scientific_classification | expected_behavior_stated; explicit_requirements; location_supplied | distance_and_angle_cutoffs; include_both_node_types; exact_output_schema | artifact_generation; numerical_validation | easy; mean reward 0.3167; 60 scored trials |
| 58 | terminal30 | database_migration | database_systems; web_api; distributed_systems | MySQL; PostgreSQL; Python | running_API_server; baseline_behavior | multi_service_migration | architectural_tradeoffs; concurrency_reasoning; consistency_reasoning | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | zero_downtime; no_stale_reads; behavioral_compatibility; latency_budget; future_deploy_state | integration_tests; latency_measurement; consistency_validation | easy; mean reward 0.2833; 60 scored trials |
| 59 | terminal30 | operational_planning | enterprise_resource_planning; procurement; manufacturing | Odoo | ERP_instance; operating_records; supplier_and_capacity_rules | multi_system_workflow | constraint_satisfaction; procurement_optimization; schedule_planning | expected_behavior_stated; explicit_requirements; location_supplied; environment_supplied | customer_budgets; deadlines; capacity_limits; supplier_limits; traceable_lineage | service_setup; record_validation; artifact_verification | very easy; mean reward 0.6037; 60 scored trials |
| 60 | terminal30 | artifact_generation | graphic_design; computer_vision; layout_reconstruction | Python | target_layout_image; component_asset_library; renderer | configuration_artifact | visual_inference; geometric_reasoning; layer_composition | expected_behavior_stated; explicit_requirements; location_supplied | pixel_match_threshold; provided_assets_only; editable_text_requirement | rendered_artifact_comparison; pixel_accuracy_measurement | very easy; mean reward 0.6500; 60 scored trials |
| 61 | terminal40 | parametric_cad_modeling | mechanical_design | FreeCAD_Python | explicit_geometry_parameters | artifact_generation | parametric_modeling | explicit_requirements | structural_artifact_requirements | artifact_verification | very hard; mean reward 0.0074; 135 scored trials |
| 62 | terminal40 | workflow_cli_implementation | logistics_scheduling | CLI | event_feed_and_operational_packet | whole_program_implementation | stateful_planning | explicit_requirements; location_supplied | state_consistency | evaluation_harness | very hard; mean reward 0.0000; 135 scored trials |
| 63 | terminal40 | statistical_data_analysis | proteomics | Broad_GSEA_CLI | local_expression_dataset | analysis_and_artifact_generation | statistical_reasoning | explicit_requirements; location_supplied | reproducibility | artifact_generation | hard; mean reward 0.2741; 135 scored trials |
| 64 | terminal40 | visual_layout_reconstruction | graphic_design_reconstruction | CSS; Python | local_image_asset_library | structured_artifact_generation | visual_reconstruction | explicit_requirements; location_supplied | artifact_constraints | pixel_match_evaluation | hard; mean reward 0.1333; 135 scored trials |
| 65 | terminal40 | case_decision_workflow | warranty_claims | portal_API | local_policy_and_claim_data | external_workflow | policy_application | explicit_requirements; location_supplied | authoritative_local_policy | external_workflow | medium; mean reward 0.4370; 135 scored trials |
| 66 | terminal40 | regulatory_filing_workflow | trade_statistics_compliance | API | local_sop_and_reference_records | external_workflow | reconciliation_and_audit | explicit_requirements; location_supplied | filing_completion | external_workflow | medium; mean reward 0.4074; 135 scored trials |
| 67 | terminal40 | algorithm_implementation | cryptography | SageMath_Python | local_cipher_resources | whole_program_implementation | cryptanalysis | explicit_requirements; location_supplied | performance | artifact_generation | easy; mean reward 0.5704; 135 scored trials |
| 68 | terminal40 | cryptanalysis_tool | classical_cryptography | Python | ciphertext_input | whole_program_implementation | cryptanalysis | explicit_requirements; location_supplied | performance | behavioral_correctness | easy; mean reward 0.5926; 135 scored trials |
| 69 | terminal40 | formal_proof | formal_verification | Coq | formal_project_context | local_code_change | formal_proof_reasoning | explicit_requirements; location_supplied | formal_soundness | build_checking | very easy; mean reward 0.8370; 135 scored trials |
| 70 | terminal40 | model_checkpoint_conversion | machine_learning_checkpoints | Safetensors_HuggingFace | parallel_shards_and_reference_outputs | artifact_generation | tensor_parallel_reconstruction | explicit_requirements; location_supplied | compatibility | artifact_verification | very easy; mean reward 0.8444; 135 scored trials |
| 71 | toolathlon | analysis | data_analysis_and_statistics | Excel | workspace_files; email_context; existing_external_records; available_tool_excel; available_tool_emails | workspace_artifact_edit; external_communication | numerical_analysis; information_extraction | explicit_requirements; output_location_supplied; environment_or_service_supplied | threshold_or_filter | artifact_generation; external_communication | very hard; mean reward 0.0891; 101 scored trials |
| 72 | toolathlon | information_retrieval; artifact_or_record_creation; planning | education_administration | Excel | workspace_files; available_tool_pdf_tools; available_tool_excel | workspace_artifact_edit | information_extraction; planning_or_optimization | output_format_specified; explicit_requirements | scope_restriction; date_or_time_window | artifact_generation | very hard; mean reward 0.0000; 101 scored trials |
| 73 | toolathlon | artifact_or_record_creation | academic_research | GitHub; Git | email_context; available_tool_emails; available_tool_github | external_record_or_resource_change | information_extraction; source_research | environment_or_service_supplied | unknown | external_record_or_resource_change | hard; mean reward 0.1961; 102 scored trials |
| 74 | toolathlon | analysis; communication; planning | business_operations | WooCommerce | email_context; available_tool_woocommerce; available_tool_emails | external_communication | planning_or_optimization | environment_or_service_supplied | threshold_or_filter; date_or_time_window | external_communication | hard; mean reward 0.1700; 100 scored trials |
| 75 | toolathlon | analysis; artifact_or_record_creation | financial_analysis | Excel | workspace_files; available_tool_excel | workspace_artifact_edit | numerical_analysis | output_location_supplied | source_restriction | artifact_generation | medium; mean reward 0.4118; 102 scored trials |
| 76 | toolathlon | information_retrieval | business_operations | Google_Sheets; Kubernetes | workspace_files; available_tool_k8s; available_tool_google_sheet | workspace_artifact_edit | information_extraction | explicit_requirements; environment_or_service_supplied | unknown | unknown | medium; mean reward 0.3861; 101 scored trials |
| 77 | toolathlon | information_retrieval; artifact_or_record_creation | media_analysis | Notion; YouTube | existing_external_records; external_research; available_tool_playwright_with_chunk; available_tool_notion; available_tool_fetch; available_tool_web_search | external_record_or_resource_change | information_extraction; source_research | environment_or_service_supplied | unknown | external_record_or_resource_change; requested_completion_check | easy; mean reward 0.5545; 101 scored trials |
| 78 | toolathlon | analysis | personal_productivity | unknown | workspace_files; email_context; existing_external_records; available_tool_emails; available_tool_snowflake; available_tool_pdf_tools | external_communication | information_extraction | output_format_specified | source_restriction; threshold_or_filter | external_communication | easy; mean reward 0.4804; 102 scored trials |
| 79 | toolathlon | information_retrieval | academic_research | arXiv | workspace_files; external_research; available_tool_arxiv_local; available_tool_scholarly | unknown | information_extraction; source_research | explicit_requirements | scope_restriction; date_or_time_window | requested_completion_check | very easy; mean reward 0.7941; 102 scored trials |
| 80 | toolathlon | analysis; artifact_or_record_creation | software_and_data_tools | GitHub; Git | workspace_files; available_tool_fetch; available_tool_web_search | workspace_artifact_edit | unknown | output_format_specified; output_location_supplied; environment_or_service_supplied | unknown | artifact_generation | very easy; mean reward 0.9314; 102 scored trials |
| 81 | verified | bug_report_investigation | data_visualization | Matplotlib; Python; LaTeX; pandas | datetime_axis_reproduction | local_edit | rendered_spacing_comparison | expected_output_comparison | version_comparison | rendering_reproduction | very hard; mean reward 0.0000; 15 scored trials |
| 82 | verified | API_consistency_fix | scientific_data_processing | xarray; Python | DataArray_and_Dataset_API_comparison | public_API_parameter_change | coordinate_vs_dimension_semantics | expected_behavior_stated | preserve_coordinate_semantics | unknown | very hard; mean reward 0.0000; 15 scored trials |
| 83 | verified | feature_implementation | database_storage | Django; Python | supplied_reproduction; existing_behavior_description | local_edit | data_model_reasoning | expected_behavior_stated; explicit_requirements | unknown | reproduction_check; expected_result_check | hard; mean reward 0.0667; 15 scored trials |
| 84 | verified | bug_fix | symbolic_mathematics; code_generation | SymPy; Python; Unicode | supplied_snippet | local_edit | unicode_rendering_reasoning | expected_behavior_stated | subscript_formatting | unknown | hard; mean reward 0.0667; 15 scored trials |
| 85 | verified | feature_implementation | web_application_frameworks | Django; PostgreSQL | database_configuration_context | public_configuration_change | configuration_propagation | explicit_requirements; expected_behavior_stated | mutual_tls_context | unknown | medium; mean reward 0.2000; 15 scored trials |
| 86 | verified | bug_fix | networking; date_time_processing | Django | standard_requirement_provided; current_behavior_described | component_change | date_calculation_reasoning | expected_behavior_stated | RFC_7231_compatibility | expected_result_check | medium; mean reward 0.1333; 15 scored trials |
| 87 | verified | bug_fix | data_format_registry | Python; Astropy; HENDRICS | error_trace; reproduction_steps | library_source_change | root_cause_analysis; regression_compatibility_analysis | failing_behavior_stated; reproduction_provided | unknown | regression_testing | easy; mean reward 0.4000; 15 scored trials |
| 88 | verified | feature_request | scientific_data_processing | xarray; Python | multi_dimension_reduction_example | local_edit | valid_element_count_across_dimensions | explicit_requirements; expected_behavior_stated | min_count_multi_dimension_case | unknown | easy; mean reward 0.3333; 15 scored trials |
| 89 | verified | behavior_change | database_storage | Django; Python | code_example_supplied; version_behavior_described | component_change | compatibility_reasoning; database_state_reasoning | expected_behavior_stated; example_provided | backward_compatibility | reproduction_example; expected_result_check | very easy; mean reward 0.5333; 15 scored trials |
| 90 | verified | bug_fix | command_line_utilities; documentation_tooling | Sphinx; Python | existing_codebase | local_edit | interactive_cli_reasoning | expected_behavior_stated | exit_behavior | behavioral_testing | very easy; mean reward 0.5333; 15 scored trials |
| 91 | atlas | behavior_question; repository_investigation | test_infrastructure; application_runtime; API_mocking | TypeScript; JavaScript; React; Jest; wp-calypso | repository_code; test_environment_and_development_environment; runtime_observation_requested | repository_behavior_analysis_only | test_bootstrap_environment_comparison; API_mock_response_trace; feature_flag_configuration_resolution; runtime_log_interpretation | open_question; requested_runtime_evidence | repository_must_remain_unchanged; temporary_investigation_scripts_must_be_cleaned; final_answer_file_and_wrapper_required | start_development_server_and_run_tests; trace_mocked_API_response_to_assertion; compare_test_configuration_with_development_resolution | unknown; mean reward unknown; 0 scored trials |
| 92 | atlas | codebase_question_answering | email_alias_service_initialization; PostgreSQL_migrations; SMTP_service_startup | PostgreSQL | user_supplied_repository; runtime_observation | repository_inspection_and_temporary_runtime_setup | startup_order_and_initialization_dependency_analysis | table_count_ready_log_and_unactivated_user_response_specified | do_not_modify_or_delete_source_files | migration_output_and_service_startup_logs; login_API_and_database_state | unknown; mean reward unknown; 0 scored trials |
| 93 | atlas | runtime_behavior_investigation | document_ingestion; OCR_processing; PDF_and_thumbnail_storage; database_persistence | OCRmyPDF | local_development_runtime; HTTP_upload_behavior; processing_logs; database_record_inspection | upload_to_processed_document_lifecycle | runtime_pipeline_tracing; database_vs_filesystem_metadata_distinction | specific_observations_requested; multi_part_question | no_file_modifications; no_permanent_changes; test_files_must_be_cleaned | HTTP_response_inspection; processing_log_inspection; generated_storage_filename_inspection; database_field_and_value_inspection | unknown; mean reward unknown; 0 scored trials |
| 94 | atlas | debugging_and_root_cause_analysis | memory_usage_and_garbage_collection; document_import_and_metadata_processing | Python | runtime_memory_measurements; document_import_pipeline; metadata_handling | memory_lifecycle_across_processing_stages | memory_retention_and_allocation_analysis; copying_references_and_caching; document_type_and_batch_size_comparison; garbage_collection_behavior | runtime_measurements_required; causal_components_and_methods_requested; comparative_cases_requested | no_repository_source_modifications; temporary_helpers_must_be_cleaned | runtime_memory_measurement; cross-case_comparison; component_level_evidence | unknown; mean reward unknown; 0 scored trials |
| 95 | atlas | codebase_investigation_and_runtime_verification | terminal_kitten; font_selection; configuration_persistence | kitty_choose_fonts_kitten | repository_codebase; single_instance_runtime; configuration_and_restart_behavior | choose_fonts_command_to_confirmed_selection_flow | command_registration_and_option_dataflow; runtime_persistence_verification | end_to_end_behavior_requested; runtime_example_requested | no_source_file_modifications; temporary_test_artifacts_must_be_deleted | build_and_launch; command_invocation; output_evidence_inspection; restart_persistence_test | unknown; mean reward unknown; 0 scored trials |
| 96 | atlas | concurrency_bug_investigation | load_testing_execution; virtual_user_lifecycle; graceful_ramp_down_and_shutdown; execution_segments | Go; Grafana_k6 | ramping_executor_handlers; VU_scheduling_and_graceful_handlers; execution_segments | VU_state_across_ramping_shutdown_and_segmented_execution | concurrent_handler_state_mutation; graceful_stop_timing; segment_load_distribution; buffer_leak_vs_race_diagnosis | multiple_runtime_symptoms_to_explain | no_repository_source_modification; temporary_scripts_must_be_cleaned | handler_and_VU_state_trace; shutdown_behavior_observation; segment_count_comparison | unknown; mean reward unknown; 0 scored trials |
| 97 | atlas | bug_fix; feature_implementation | database_storage; data_integrity | C++; InnoDB; CLI | existing_codebase | multi_component_change | on_disk_metadata_interpretation; page_range_reasoning; command_line_validation | expected_behavior_stated; interface_specified | default_value_contract; test_files_untouched | secondary_tablespace_testing; doublewrite_filter_testing; option_validation_testing | unknown; mean reward unknown; 0 scored trials |
| 98 | atlas | code_refactoring | network_intrusion_detection; file_name_and_extension_matching; content_matching_engine | C; Suricata | existing_fileext_and_filename_detection_keywords; build_registration_and_keyword_registration | replace_standalone_fileext_engine_with_generic_content_matching | duplicate_matcher_elimination; reuse_existing_buffer_and_matching_infrastructure; remove_obsolete_build_and_registration_entries | rule_writer_behavior_must_remain_identical | do_not_modify_test_files; minimal_source_file_changes | existing_tests_prepared; rule_behavior_preservation | unknown; mean reward unknown; 0 scored trials |
| 99 | atlas | security_boundary_investigation | SSH_exec_command_handling; process_argument_construction; path_and_option_validation; privilege_boundary_analysis | SFTPGo; SSH; OS_process_argv | two_invocations_under_two_permission_contexts; runtime_process_observation | client_command_to_spawned_process_argument_flow | argv_construction_and_sanitization_analysis; normal_vs_adversarial_input_comparison; permission_context_comparison; privilege_boundary_implication_analysis | reproducible_evidence_requested; two_input_cases_and_permission_contexts | repository_must_remain_unchanged; confirm_unchanged_state | runtime_capture_of_exact_argv; function_path_identification; repository_unchanged_verification | unknown; mean reward unknown; 0 scored trials |
| 100 | atlas | security_review_question_answering | custom_detector_webhook_security; SSRF; regular_expression_safety | HTTPS; regular_expressions | user_supplied_repository; runtime_security_investigation | source_unchanged | webhook_network_behavior_TLS_validation_and_request_multiplicity; regex_engine_execution_safety | request_payload_and_request_limit_questions; actual_observed_behavior_requested | clean_temporary_scripts | runtime_webhook_and_regex_behavior | unknown; mean reward unknown; 0 scored trials |
| 101 | real | bug_fix | database_storage | NodeBB; Python; JavaScript | existing_behavior_description | cross_component_change; component_change | performance_reasoning | explicit_requirements; expected_behavior_stated; location_supplied; interface_specified | performance_constraint; exact_output_constraint | expected_result_check | unknown; mean reward unknown; 0 scored trials |
| 102 | real | feature_implementation | music_streaming | Navidrome; Go | source_codebase | source_code_change | conditional_logic | explicit_requirements; expected_behavior_stated | scope_or_exclusion | testing_requested; build_or_execution_check | unknown; mean reward unknown; 0 scored trials |
| 103 | real | refactoring | frontend_ui | Element Web; React; TypeScript | unknown | public_interface_change | algorithmic_reasoning; data_model_reasoning | explicit_requirements; expected_behavior_stated; location_supplied; interface_specified | security_or_privacy; exact_output_constraint | expected_result_check | unknown; mean reward unknown; 0 scored trials |
| 104 | real | feature_implementation | networking | Vuls; Nmap | existing_behavior_description | component_change | algorithmic_reasoning; compatibility_reasoning; data_model_reasoning | explicit_requirements; expected_behavior_stated; location_supplied; example_provided; interface_specified | exact_output_constraint; compatibility_constraint | reproduction_check; expected_result_check | unknown; mean reward unknown; 0 scored trials |
| 105 | real | bug_fix | contact_management | Tutanota; TypeScript; vCard | repository_code | public_interface_schema_change | algorithmic_reasoning | expected_behavior_stated; explicit_requirements; location_supplied | compatibility_or_scope_constraint | behavioral_testing | unknown; mean reward unknown; 0 scored trials |
| 106 | real | feature_implementation | web_browsing | qutebrowser; Python | repository_exploration | public_interface_schema_change | algorithmic_reasoning; state_concurrency_reasoning | expected_behavior_stated; explicit_requirements; environment_supplied; location_supplied | compatibility_or_scope_constraint; performance_constraint | behavioral_testing; unit_tests | unknown; mean reward unknown; 0 scored trials |
| 107 | real | behavior_change | security | Flipt; gRPC | unknown | component_change | performance_reasoning; security_reasoning | explicit_requirements; expected_behavior_stated | security_or_privacy; performance_constraint | unknown | unknown; mean reward unknown; 0 scored trials |
| 108 | real | bug_fix | digital_library_and_catalog_management | Open Library | source_codebase | source_code_change | conditional_logic; data_transformation; numerical_calculation | expected_behavior_stated; location_supplied | scope_or_exclusion | testing_requested | unknown; mean reward unknown; 0 scored trials |
| 109 | real | bug_fix | testing_frameworks | pytest; Python | supplied_reproduction | local_edit | conditional_logic | explicit_requirements; expected_behavior_stated | scope_restriction; version_or_environment_constraint | build_or_execution_check | unknown; mean reward unknown; 0 scored trials |
| 110 | real | feature_implementation | database_storage | Flipt; SQLite; MySQL | unknown | public_interface_change | security_reasoning; data_model_reasoning | explicit_requirements; expected_behavior_stated; interface_specified | security_or_privacy; exact_output_constraint; compatibility_constraint | build_or_startup_check | unknown; mean reward unknown; 0 scored trials |
| 111 | swebench | compatibility_update | web_server_monitoring_and_metrics_integration | Python; DataDog_integrations_core; NGINX_Plus | Datadog_NGINX_integration_API_migration | replace_deprecated_Extended_Status_API_with_NGINX_Plus_API | HTTP_status_endpoint_migration_and_metrics_collection | old_API_is_deprecated_and_will_be_removed_after_transition_period | use_new_unified_NGINX_Plus_API_endpoint_and_functionality | NGINX_Plus_API_metrics_integration_compatibility_test | unknown; mean reward unknown; 0 scored trials |
| 112 | swebench | feature_enhancement | containerization; build_deployment | Docker; Prefect | existing_repository; Docker_environment_base_images | component_level_change | local_image_resolution_reasoning | expected_behavior_stated; explicit_requirements | local_image_availability | Docker_environment_build_testing | unknown; mean reward unknown; 0 scored trials |
| 113 | swebench | bug_fix; input_validation | quantum_computing; software_validation | python; qiskit | existing_codebase; code_example | local_edit | boundary_condition_handling | expected_error_message | input_constraint | input_validation_testing | unknown; mean reward unknown; 0 scored trials |
| 114 | swebench | dependency_migration | documentation_tooling | Sphinx; sphinx-panels; sphinx-design | existing_documentation_build_configuration | documentation_build_configuration_change | documentation_extension_migration | migration_target_stated | replace_unmaintained_sphinx_panels_with_sphinx_design | documentation_build_verification | unknown; mean reward unknown; 0 scored trials |
| 115 | swebench | build_fix; error_handling_improvement | build_tooling; command_line_interface | Apache_Airflow; Black; pre-commit | failure_behavior_described; proposed_change_stated; build_output_visibility_described | build_pipeline_change | build_failure_reasoning; error_propagation_reasoning | cause_and_proposed_fix_stated; desired_failure_reporting_stated | start_airflow_should_exit_with_error_and_show_asset_compilation_output_when_compilation_fails | build_failure_testing | unknown; mean reward unknown; 0 scored trials |
| 116 | swebench | security_bug_fix | web_content_security | jQuery | repository_codebase; security_issue | dependency_update | DOM_injection_risk_from_untrusted_HTML | upgrade_jQuery_to_3_5_or_newer | security_compatibility | security_vulnerability_remediation | unknown; mean reward unknown; 0 scored trials |
| 117 | swebench | database_backend_compatibility_fix | database_backend_connectivity; URL_parsing | Celery; MongoDB; MongoDB_SRV | unsupported_connection_URI_scheme_and_expected_behavior_stated; actual_URL_matching_limitation_described | backend_connection_support_change | connection_URI_parsing_reasoning | mongodb_plus_srv_scheme_and_expected_success_stated; actual_scheme_recognition_limitation_stated | accept_mongodb_plus_srv_URI_schemes_for_the_MongoDB_backend | MongoDB_SRV_connection_URI_testing | unknown; mean reward unknown; 0 scored trials |
| 118 | swebench | refactoring | frontend_ui | Django; JavaScript | admin_static_assets | component_change | asset_build_process_reasoning; minification_tradeoff_reasoning | desired_behavior_stated | vendored_asset_exception | distributed_asset_set_verification | unknown; mean reward unknown; 0 scored trials |
| 119 | swebench | feature_implementation | secure_connection_configuration | docker_compose_cli; tls | feature_request | command_line_interface_change | tls_version_option_precedence | allow_tls_version_to_be_selected_on_command_line | support_servers_requiring_tls_versions_other_than_tlsv1 | behavioral_reproduction | unknown; mean reward unknown; 0 scored trials |
| 120 | swebench | test_correctness_investigation | Git_date_parsing | GitPython_parse_date; RFC_2822_date_format; ISO_date_formats | reported_uncertainty_about_test_assumptions | test_edit_or_date_parser_investigation | compare_timezone_offsets_and_expected_epoch_value | parse_date_tests_should_match_the_timestamp_and_timezone_offsets | several_date_string_formats_and_offsets | test_parse_date | unknown; mean reward unknown; 0 scored trials |
| 121 | swepro2 | bug_fix; feature_implementation | forum_post_cache_management; user_group_and_category_slug_lookup | NodeBB; JavaScript | shared_post_cache_initialization_context; single_or_multiple_slug_existence_lookup_context | whole_program_implementation; public_interface_change | lazy_shared_cache_instance_and_mutation; scalar_or_ordered_array_slug_lookup; display_name_to_normalized_userslug_conversion | explicit_requirements; module_interface_specification | empty_string_undefined_or_falsy_array_entries_raise_error; array_result_preserves_input_order; delete_only_requested_cache_keys | shared_cache_instance_across_modules_case_check; array_slug_order_and_normalization_case_check; invalid_slug_input_error_case_check | unknown; mean reward unknown; 0 scored trials |
| 122 | swepro2 | security_bug_fix | SQL_Server_protocol_parsing; memory_safety | Go; Microsoft_SQL_Server_Login7 | repository_codebase; security_fix_requirements | local_edit | packet_length_and_bounds_validation | out_of_bounds_read_prevention_specified | reject_malformed_Login7_packets | crafted_packet_bounds_cases | unknown; mean reward unknown; 0 scored trials |
| 123 | swepro2 | refactoring | command_line_utilities; data_processing | Ansible; Python | existing_codebase | coordinated_edits_within_component | shared_formatter_reuse_reasoning | expected_behavior_stated; explicit_requirements; location_supplied | canonical_host_label_formatting; preserve_base_host_when_not_delegated | behavioral_testing | unknown; mean reward unknown; 0 scored trials |
| 124 | swepro2 | test_environment_accessibility_fix | modal_accessibility_testing; JSDOM | TypeScript; React; JSDOM | repository_codebase; JSDOM_accommodation_requirements | local_edit; test_setup_configuration_change | module_boundary_swap_for_test_environment | dialog_children_role_visibility_specified | real_browser_component_behavior_unchanged | role_based_DOM_query_cases | unknown; mean reward unknown; 0 scored trials |
| 125 | swepro2 | refactor | book_list_data_model | Python; Open_Library | repository_codebase; list_model_requirements | local_edit; public_interface_change | consolidate_list_methods_and_registration | List_and_changeset_ownership_specified | remove_legacy_ListMixin | registry_and_owner_resolution | unknown; mean reward unknown; 0 scored trials |
| 126 | swepro2 | feature_implementation; behavioral_reimplementation | network_device_automation | Ansible_module; F5_BIG_IP | repository_codebase; issue_requirements | new_module_and_device_operations; public_interface_change | desired_vs_current_state_comparison; idempotent_state_management | module_parameters_and_state_behavior_specified; api_field_mappings_specified | partition_qualified_peers | behavioral_acceptance_criteria; changed_result_contract | unknown; mean reward unknown; 0 scored trials |
| 127 | swepro2 | bug_fix | dependency_installation | Ansible_role_and_collection_installation | repository_codebase; requirements_listing | dependency_install_workflow | mixed_dependency_type_resolution; path_dependent_handling | install_modes_and_output_behavior_specified; resolved_grouping_contract | custom_path_sets_collections_aside | installed_dependency_sets_and_warning_visibility; resolution_return_mapping | unknown; mean reward unknown; 0 scored trials |
| 128 | swepro2 | feature_implementation | observability; download_management | TypeScript; metrics_infrastructure; service_worker | existing_codebase | component_level_change | mechanism_selection; state_transition_tracking; idempotency | expected_behavior_stated; interface_specified | metric_schema_compatibility | state_transition_testing; mechanism_selection_testing; single_count_testing | unknown; mean reward unknown; 0 scored trials |
| 129 | swepro2 | refactor; bug_fix | keyboard_shortcut_handling | TypeScript; React_keyboard_events | repository_codebase; issue_requirements | centralized_shortcut_matching; public_interface_change | exact_modifier_matching; platform_specific_modifier_resolution | KeyCombo_and_function_signature_specified; matching_rules_specified | do_not_detect_platform_internally | exact_keyboard_event_match_contract; Windows_Linux_and_macOS_cases | unknown; mean reward unknown; 0 scored trials |
| 130 | swepro2 | feature_implementation; privacy_compliance_behavior | product_analytics_event_tracking; user_identification_and_location_redaction | Element Web; TypeScript; PostHog; SHA-256 | Do_Not_Track_override_context; anonymous_vs_pseudonymous_privacy_mode_context | whole_program_implementation; public_interface_change | analytics_initialization_state_machine; async_capture_and_tracking_gates; identifier_and_location_hashing_or_redaction | explicit_requirements; method_interface_specification | DNT_forces_Anonymous; anonymous_mode_never_identifies_user; no_tracking_when_disabled | missing_configuration_leaves_disabled_case_check; DNT_overrides_pseudonymous_init_case_check; pseudonymous_user_and_room_SHA256_case_check | unknown; mean reward unknown; 0 scored trials |