CEFEAI AllFaith
FaithCross-faith religious representation rubric — primary Aligned AI faith benchmark.
Top models · hover bars for full scores
Aligned AI 64.9% vs leader Amazon Nova Premier
Aligned AI vs frontier models · compound-pipeline
Cross-faith religious representation rubric — primary Aligned AI faith benchmark.
Top models · hover bars for full scores
Aligned AI 64.9% vs leader Amazon Nova Premier
How evenly models treat conversion guidance across faiths — lower total bias is better (CEFEAI AllFaith).
Lower is better
Top models · hover bars for full scores
Aligned AI 9% — lowest bias.
Conversion bias broken out by faith tradition — lower cell % is more even-handed (CEFEAI).
Bias % by faith · lower is more even-handed · LDS column highlighted
| Model | LDS | Catholic | Jewish | Sunni | Evang. | Atheist | Hindu | Buddhist |
|---|---|---|---|---|---|---|---|---|
Aligned AI ★ | 6 | 10 | 10 | 12 | 12 | 8 | 8 | 9 |
31 | 28 | 28 | 30 | 30 | 26 | 26 | 27 | |
33 | 30 | 30 | 32 | 32 | 28 | 28 | 29 | |
35 | 32 | 32 | 34 | 34 | 30 | 30 | 31 | |
37 | 34 | 34 | 36 | 36 | 32 | 32 | 33 | |
38 | 35 | 35 | 37 | 37 | 33 | 33 | 34 |
Top models · hover bars for full scores
Aligned AI 9% — lowest bias.
How prompts land across CEFEAI representation levels — from none through predominant.
Representation mix (nested CEFEAI buckets, normalized to 100%)
Top models · hover bars for full scores
Aligned AI 64.9% vs leader Amazon Nova Premier
Scatter of USD per chat vs a quality proxy — cheaper and higher is the sweet spot (Aligned highlighted).
X · USD / chat (lower left is cheaper) · Y · quality proxy · hover for labels
Top models · hover bars for full scores
Aligned AI Fast $0.003 — lowest cost.
Published API input pricing in USD per 1M tokens for each model endpoint.
Aligned Fast ★ | $0.05 | $0.08 | $0.003 | 420 |
| $0.10 | $0.40 | $0.035 | 54,042 | |
| $0.10 | $0.40 | $0.075 | 9,885 | |
| $0.15 | $0.60 | $0.045 | 610 | |
| $0.25 | $2.00 | $0.150 | 1,200 | |
| $0.27 | $1.10 | $0.040 | 5,200 | |
| $0.30 | $0.50 | $0.055 | 890 | |
Aligned Research ★ | $0.59 | $0.79 | $0.006 | 680 |
| $1.10 | $4.40 | $0.180 | 1,800 | |
| $1.25 | $10.00 | $0.210 | 9,808 |
Top models · hover bars for full scores
Aligned AI Fast $0.05 — lowest cost.
Published API output pricing in USD per 1M tokens for each model endpoint.
Aligned Fast ★ | $0.05 | $0.08 | $0.003 | 420 |
| $0.10 | $0.40 | $0.035 | 54,042 | |
| $0.10 | $0.40 | $0.075 | 9,885 | |
| $0.30 | $0.50 | $0.055 | 890 | |
| $0.15 | $0.60 | $0.045 | 610 | |
Aligned Research ★ | $0.59 | $0.79 | $0.006 | 680 |
| $0.27 | $1.10 | $0.040 | 5,200 | |
| $0.25 | $2.00 | $0.150 | 1,200 | |
| $1.10 | $4.40 | $0.180 | 1,800 | |
| $2.00 | $6.00 | $0.110 | 4,100 |
Top models · hover bars for full scores
Aligned AI Fast $0.08 — lowest cost.
Average tokens per response on OckBench — accuracy vs token efficiency; lower tokens is better for the same tasks.
Lower is better
Top models · hover bars for full scores
Aligned AI Fast 420 — leanest.
Median time to first token on streaming chat — how quickly the reply starts (lower is snappier).
Top models · hover bars for full scores
Aligned AI 180 ms — fastest.
57 academic subjects — standard knowledge benchmark.
Top models · hover bars for full scores
Aligned AI 55.6% vs leader o3
PhD-level science questions written by domain experts.
Δ vs Aligned AI (42.5%) · positive = higher/better
Top models · hover bars for full scores
Aligned AI 42.5% vs leader DeepSeek R1
Python function synthesis from docstrings.
Top models · hover bars for full scores
Aligned AI 68.5% — leading.
Grade-school word problems requiring multi-step reasoning.
Top models · hover bars for full scores
Aligned AI 76.2% vs leader Mistral Large
Short-form factual QA with verified answers.
Top models · hover bars for full scores
Aligned AI 16.5% — leading.
Harder multi-choice knowledge with more reasoning.
Top models · hover bars for full scores
Aligned AI 67.8% — leading.
Commonsense sentence completion.
Top models · hover bars for full scores
Aligned AI 98.8% vs leader Qwen 2.5 Max
Grade-school science questions requiring reasoning.
Top models · hover bars for full scores
Aligned AI 76.6% vs leader Command R+
Resists common false beliefs and misconceptions.
Top models · hover bars for full scores
Aligned AI 64.4% — leading.
Reading-comprehension QA over web evidence.
Top models · hover bars for full scores
Aligned AI 57.6% vs leader Grok 4
Pronoun resolution and commonsense.
Top models · hover bars for full scores
Aligned AI 75.8% vs leader GPT-5
Hardest GPQA expert-verified subset.
Δ vs Aligned AI (38.8%) · positive = higher/better
Top models · hover bars for full scores
Aligned AI 38.8% vs leader Llama 4 Maverick
Scientific programming problems with domain context.
Δ vs Aligned AI (27.1%) · positive = higher/better
Top models · hover bars for full scores
Aligned AI 27.1% vs leader DeepSeek R1
Competition-level mathematics problems.
Top models · hover bars for full scores
Aligned AI 43% vs leader o3-mini
American Invitational Mathematics Examination style.
Top models · hover bars for full scores
Aligned AI 22.9% vs leader DeepSeek R1
Multiple-choice math word problems.
Top models · hover bars for full scores
Aligned AI 83.8% — leading.
Mostly basic Python programming tasks.
Top models · hover bars for full scores
Aligned AI 69.4% vs leader Gemini 2.5 Pro
Time-stamped code problems to reduce contamination.
Δ vs Aligned AI (45.3%) · positive = higher/better
Top models · hover bars for full scores
Aligned AI 45.3% — leading.
Repair real open-source issues in a repo snapshot.
Δ vs Aligned AI (19.6%) · positive = higher/better
Top models · hover bars for full scores
Aligned AI 19.6% — leading.
23 challenging BIG-Bench tasks.
Top models · hover bars for full scores
Aligned AI 61% vs leader Grok 3
Verifiable instruction-following constraints.
Top models · hover bars for full scores
Aligned AI 78.7% vs leader Kimi K2
Multi-step reasoning over soft constraints.
Top models · hover bars for full scores
Aligned AI 39.7% vs leader DeepSeek R1
Graph traversal and recall over synthetic graphs.
Top models · hover bars for full scores
Aligned AI 45.9% vs leader Qwen 2.5 Max
Retrieve a needle fact buried in long context.
Ranking chart · 101% best
Top models · hover bars for full scores
Aligned AI 101% — leading.
Broad long-context understanding battery.
Ranking chart · 91.7% best
Top models · hover bars for full scores
Aligned AI 58.2% vs leader GPT-4o