Neura Intelligence Index
Code generation benchmark — 164 Python programming problems measuring functional correctness
| # | Model | Score | Provider | Source |
|---|---|---|---|---|
| aggregated | ||||
| aggregated | ||||
| aggregated | ||||
| aggregated | ||||
| aggregated | ||||
| aggregated | ||||
| aggregated | ||||
| aggregated | ||||
| aggregated | ||||
| aggregated | ||||
| aggregated | ||||
| aggregated | ||||
| aggregated | ||||
| aggregated | ||||
| aggregated | ||||
| aggregated | ||||
| aggregated | ||||
| aggregated | ||||
| aggregated |