Qaf search · 7 October 2026

Luna Decisions vs jev

Could OpenAI's new Decisions API (GPT-6 Luna) run Qaf's search better than production does today? We put it in our new search pipeline and measured it against production on 48 real questions, with TypeSafe's jev as the alternative.

Luna would match production at the same cost. jev does it for 40% less.

Answers vs production49%tuned Luna; 50% is a tie · jev 45%
First word8.5 s vs 13.0 stuned Luna vs production · jev 7.7 s
Cost per turn$0.043 vs $0.042tuned Luna vs production · jev $0.025
Passage ranking0.888 vs 0.781Luna vs production's reranker · jev 0.885
1 · Answer quality

Tuned Luna answers as well as production

Each setup answered the same 48 real questions as production. Claude Opus compared every pair blind, in both orders; a pair counts when both orders agree.

Share of decided pairs won against productionDot is the win rate, line its 95% interval.

Tuned Luna and jev both tie production. Out of the box, Luna loses more often than it wins: its probabilities sit on a different scale from the thresholds our pipeline uses, so it under-searched. Section 4 explains the fix.

2 · Speed

The first word arrives 5 seconds sooner

Production lets Gemini decide when and what to search, one tool call after another. The new pipeline makes those decisions with many small, parallel model calls, so the answer starts sooner and finishes in about half the time.

Median time per questionAll 48 questions, six at a time. Production times are September replays of the same questions.
3 · Cost

Luna costs what production costs; jev costs 40% less

Gemini reads less with the new pipeline, so its share drops. With jev the search decisions add about a cent; with Luna nearly three, which brings the total back to production's.

Mean cost per answered questionList prices; monthly at 22,000 questions a day.

The difference is Luna's price: $0.10 per million tokens against jev's $0.042, with no discount for repeated text. Luna would need about $0.038 per million to cost what jev does.

4 · Luna or jev

Same quality and speed; jev is cheaper

Head to head on the same questions, tuned Luna won 22 pairs and jev 14, within the normal spread between two runs. The one clear difference is cost.

Luna, tunedjev
Answers against production49%45%
Answers head to head61% of decided pairs39%
Cost per turn$0.043$0.025
First word8.5 s7.7 s
Passage ranking (nDCG@20)0.8880.885
Claims fully supported79%82%
Price per million tokens$0.10$0.042

Why Luna needed tuning. Our pipeline acts on fixed cut-offs set for jev, such as when a question counts as hard. Luna's probabilities run lower, so out of the box it rated 89 of 149 questions easy (jev: 20) and skipped retrieval more often. On one question it skipped retrieval and returned nothing. We mapped Luna's answers onto jev's scale using questions outside the test set; tuned Luna beat its untuned self on 22 questions and lost on 6.

5 · Also checked

Grounding and ranking hold up

Passage ranking
0.888 vs 0.781
How well the top 20 of 50 candidate passages match three blind AI judges, on 205 real searches. Luna 0.888, jev 0.885, production's Cohere reranker 0.781.
Grounding
79% vs 78%
Claims fully supported by the passages each answer cited, 18 audited answers per setup. Unsupported claims: Luna 0.5%, production 5.1%. Answers with a serious error: 3 vs 6.
Capacity
ample
OpenAI allows this key 30,000 requests a minute; Qaf needs about 2,500. No capacity errors or retries in any run. jev documents 1,200 a minute by default.
Integration
adapter needed
Decisions is not a drop-in for jev: input must be text, questions are a list, and any question can come back as a refusal (4 in about 9,000 calls). A 170-line adapter covers it.
Examples

Production and Luna, side by side

سؤال: ما هو حجم الصاع بالسنتميترات المكعبة وما هي الطريقة العلمية لتحديد ذلكHow many cubic centimetres is a ṣāʿ, and how is it measured? Luna won in both orders: it tied each method to a measured volume, where production described the methods in the abstract.

Production 354 words · 15 sources cited

الصاع النبوي مكيال يقاس به **الحجم والسعة** وليس وزناً في أصله 2، ويساوي أربعة أمداد 3.

 

---

 

### حجم الصاع بالسنتيمتر المكعب (أو الملّيلتر)

 

تتطابق السعة بالمليلتر مع السنتيمتر المكعب ($1\text{ ml} = 1\text{ cm}^3$)، وقد جاءت تقديرات العلماء والباحثين المعاصرين لحجم الصاع على النحو الآتي:

 

* **التقدير الشائع والمعتمد عند أغلب الباحثين**: يبلغ حجم الصاع حوالي **$2750$ إلى $2760$ سنتيمتراً مكعباً** (أي ما يعادل $2.75$ لتر تقريباً) 4.

* **تقديرات أخرى**:

* قدّره بعض العلماء بنحو **$2050$ إلى $2500$ سنتيمتر مكعب** 2.

* قدّره آخرون بناءً على بعض الأمداد المسندة ومقاييس أخرى بما يقارب **$3000$ إلى $3144$ سنتيمتراً مكعباً** (أي حوالي $3$ لترات) 3.

 

---

 

### الطرق العلمية لتحديد حجم الصاع

 

اتبع العلماء والباحثون ثلاث طرق علمية رئيسية لتحرير حجم وسعة الصاع النبوي بدقة:

 

#### 1. طريقة معايرة النماذج والأمداد المسندة بالمختبرات

* تعتمد هذه الطريقة على الوقوف على أمداد وصيعان قديمة توارثها العلماء بأسانيد متصلة إلى الصحابة رضوان الله عليهم (كمُدِّ الصحابي زيد بن ثابت) 1.

* تجري معايرة هذه الأواني في مختبرات القياس والمواصفات الرسمية بملئها بالماء المقطر وقياس سعتها الحجمية بواسطة المخابير والأوعية القياسية الحديثة المدرجة بالسنتيمتر المكعب والمليلتر 2.

 

#### 2. طريقة الحساب الفقهي والتحويل من الأرطال والدراهم إلى الماء

* حدد جمهور الفقهاء صاع النبي ﷺ بأنه **خمسة أرطال وثلث رطل** بالرطل البغدادي 3.

* يُحسب الرطل بالدراهم الشرعية، حيث يساوي الرطل $128$ درهماً و $4/7$ درهم، فيكون وزن الصاع الشرعي حوالي $685.7$ درهماً شرعياً 2.

* يُحوَّل وزن الدرهم الشرعي إلى الجرامات الحديثة، ثم يُقاس ما يوازيه من الماء النقي (نظراً لأن غرام الماء يعادل سنتيمتراً مكعباً واحداً عند درجة حرارة معينة)، وبذلك يُعرف الحجم الهندسي الصافي للإناء الذي يسع هذا القدر 3.

 

#### 3. طريقة قياس الحفنات (ملء كفي الرجل المتوسط)

* بيّن الفقهاء وأهل اللغة أن الصاع يساوي **أربع حفنات** بكفي رجل معتدل الخلقة واليدين، لا مقبوضتين ولا مبسوطتين (الحفنة الواحدة هي المُدّ) 3.

* يُفرَّغ مقدار أربع حفنات من الحَبّ المتوسط (كالبرّ أو الحنطة) لعدد من الأشخاص المعتدلي الخلقة في وعاء مدرج بالسنتمترات المكعبة لمعرفة الحجم المتوسط وتحديده بدقة 2.

Luna, tuned 349 words · 10 sources cited

يُقاس حجم الصاع النبوي بالوحدات المعاصرة بالسنتيمتر المكعب (وهو ما يعادل المليلتر تمامًا، حيث $1\text{ سم}^3 = 1\text{ مل}$)، وقد توصّل الباحثون والجهات العلمية والمختبرات من خلال الدراسات المعاصرة إلى نتائج متقاربة في تحديد حجمه بدقة، وتتراوح أبرز التقديرات العلمية لحجم الصاع بين **$2430\text{ سم}^3$** و**$2760\text{ سم}^3$**، وتصل في بعض الدراسات المسندة إلى **$3144\text{ سم}^3$** 3.

 

---

 

### الطرق العلمية المتبعة لتحديد حجم الصاع:

 

اعتمد العلماء والباحثون في الهيئات والمختبرات الرسمية (كهيئة المواصفات والمقاييس) عدة طرق علمية ومخبرية لضبط حجم الصاع:

 

* **الطريقة الأولى: قياس الحجم الفعلي لوزن الصاع من القمح في المختبر**

تعتمد هذه الطريقة على تحرير وزن الصاع بالجرام من البُرّ (القمح) الجيد المتوسط، والذي حُرّر بـ ($2035$ جرامًا) بناءً على الرطل والدرهم الشرعي 2، ثم وضع هذا المقدار في إناء مدرّج لقياس الحجم في مختبرات هيئة المواصفات والمقاييس، فكانت النتيجة أن حجمه يعادل **$2430\text{ سم}^3$** (أي $2.43$ لتر) 1.

 

* **الطريقة الثانية: القياس التجريبي لمتوسط حفنات الأيدي (الحفنة = مد)**

الأصل الشرعي أن الصاع أربعة أمداد، والمُدّ هو ملء كفي الرجل معتدل الخلقة 3. وقد أُجريت تجربة علمية بقياس حفنات أربعين رجلًا معتدل الخلقة في إدارة المختبرات؛ فبلغ متوسط الحفنة الواحدة (المد) $628\text{ سم}^3$، وبضربها في أربعة ينتج أن حجم الصاع هو **$2512\text{ سم}^3$** (أي $2.512$ لتر تقريبًا) 1.

 

* **الطريقة الثالثة: المعايرة المخبرية بالماء للأمداد والأصواع الأثرية والمسندة**

تعتمد على قياس سعة الأواني القديمة المتوارثة أو الأمداد المأخوذة بالأسانيد المتصلة (مثل المد المسند إلى الصحابي زيد بن ثابت رضي الله عنه) بملئها بالماء الخالص داخل المختبر 2؛ لكون الماء مقياسًا ثابتًا لا يختلف وزنه عن حجمه ولا يقبل التسنيم فوق الحافة 2. وبمعايرة أحد الأمداد المسندة بالماء في إدارة مختبرات المواصفات والمقاييس كانت سعة المد $786\text{ سم}^3$، فيكون حجم الصاع أربعة أضعافه، أي **$3144\text{ سم}^3$** 1.

 

* **الطريقة الرابعة: الحساب المبني على التحويل من المقاييس الفقهية القديمة**

قدّر جمعٌ من الفقهاء والمحققين سعة الصاع باللتر بناءً على مكاييل الحجاز المعايرة؛ حيث حُسب المد بنحو $0.688$ إلى $0.69$ لتر، وبناءً عليه يكون حجم الصاع النبوي ما بين **$2750\text{ سم}^3$** إلى **$2760\text{ سم}^3$** (أي $2.75$ إلى $2.76$ لتر) 4.

عاشروا الناس بما يظهر منهم“Treat people by what they outwardly show.” Production won clearly: it explained the principle with its evidence, while Luna only asked the user what they meant.

Production 453 words · 19 sources cited

معاملة الناس وعشرتهم بما يظهر منهم قاعدةٌ شرعية متينة في التعاملات والأحكام 2؛ إذ إن الأصل في الشريعة إجراء الأحكام في الدنيا على الظاهر من الأقوال والأفعال، وتفويض بواطن الناس وسرائرهم إلى الله تعالى وحده 2.

 

---

 

### أولًا: الأدلة من السنة النبوية

 

وردت نصوص متضافرة تؤكد عدم جواز التفتيش في قلوب الناس أو محاسبتهم على ما يُظن بنواياهم:

 

1. **النهي عن التنقيب عن النوايا:**

ثبت في الصحيحين عن النبي ﷺ أنه قال: إِنِّي لَمْ أُومَرْ أَنْ أُنَقِّبَ عَنْ قُلُوبِ النَّاسِ وَلَا أَشُقَّ بُطُونَهُمْ 2.

 

2. **عتاب النبي ﷺ لأسامة بن زيد:**

حين قتل أسامة بن زيد رجلًا قال: لا إله إلا الله، ظانًا أنه قالها متعوذًا من السيف خوفًا من القتل، أنكر عليه النبي ﷺ بشدة وقال: أَفَلَا شَقَقْتَ عَنْ قَلْبِهِ حَتَّى تَعْلَمَ أَقَالَهَا أَمْ لَا؟ 2.

 

3. **إيكال الحساب في السرائر إلى الله:**

قال النبي ﷺ: أُمِرْتُ أَنْ أُقَاتِلَ النَّاسَ حَتَّى يَشْهَدُوا أَنْ لَا إِلَهَ إِلَّا اللَّهُ وَأَنَّ مُحَمَّدًا رَسُولُ اللَّهِ، وَيُقِيمُوا الصَّلَاةَ، وَيُؤْتُوا الزَّكَاةَ، فَإِذَا فَعَلُوا ذَلِكَ عَصَمُوا مِنِّي دِمَاءَهُمْ وَأَمْوَالَهُمْ إِلَّا بِحَقِّ الإِسْلَامِ، وَحِسَابُهُمْ عَلَى اللَّهِ 2؛ أي إن الحكم في الدنيا يكون بما أظهروه، وحساب بواطنهم على الله في الآخرة 1.

 

4. **القضاء مبني على الظاهر والبينات:**

قال رسول الله ﷺ: إِنَّمَا أَنَا بَشَرٌ، وَإِنَّكُمْ تَخْتَصِمُونَ إِلَيَّ، فَلَعَلَّ بَعْضَكُمْ أَنْ يَكُونَ أَلْحَنَ بِحُجَّتِهِ مِنْ بَعْضٍ، فَأَقْضِي لَهُ عَلَى نَحْوِ مَا أَسْمَعُ 2.

 

---

 

### ثانيًا: أثر عمر بن الخطاب رضي الله عنه

 

بين عمر بن الخطاب رضي الله عنه هذه القاعدة الجامعة بوضوح؛ حيث خطب في الناس فقال:

إِنَّ أُنَاسًا كَانُوا يُؤْخَذُونَ بِالْوَحْيِ فِي عَهْدِ رَسُولِ اللهِ ﷺ، وَإِنَّ الْوَحْيَ قَدِ انْقَطَعَ، وَإِنَّمَا نَأْخُذُكُمُ الْآنَ بِمَا ظَهَرَ لَنَا مِنْ أَعْمَالِكُمْ، فَمَنْ أَظْهَرَ لَنَا خَيْرًا أَمِنَّاهُ وَقَرَّبْنَاهُ، وَلَيْسَ إِلَيْنَا مِنْ سَرِيرَتِهِ شَيْءٌ، اللهُ يُحَاسِبُهُ فِي سَرِيرَتِهِ، وَمَنْ أَظْهَرَ لَنَا سُوءًا لَمْ نَأْمَنْهُ وَلَمْ نُصَدِّقْهُ، وَإِنْ قَالَ: إِنَّ سَرِيرَتَهُ حَسَنَةٌ 2.

 

---

 

### ثالثًا: المقاصد والآثار السلوكية للقاعدة

 

* **ترك التجسس وسوء الظن:** نهى الله تعالى عن الظنون السيئة والتجسس على الناس؛ قال تعالى: يَا أَيُّهَا الَّذِينَ آمَنُوا اجْتَنِبُوا كَثِيرًا مِّنَ الظَّنِّ إِنَّ بَعْضَ الظَّنِّ إِثْمٌ وَلَا تَجَسَّسُوا [الحجرات: 12]، فلا ينبغي للمسلم أن يشغل نفسه بالبحث عما في ضمائر الناس وخفاياهم 2.

* **استقرار المعاملات وصيانة المجتمع:** لو كُلِّف الناس بمحاسبة بعضهم على البواطن لفسدت العلاقات واشتعلت العداوات والشكوك بين الناس، فمن رحمة الشريعة أن جعلت المعاملة مبنية على ما وضح وظهر 2.

* **الفرق بين حكم الدنيا والآخرة:**

* **في الدنيا:** يُعامل الإنسان بظاهره؛ فمن أظهر الخير والصلاح قُرِّب وأُحسِن الظن به، ومن أظهر الشر حُذِر منه 2.

* **في الآخرة:** تُبلى السرائر ويحاسب الله تعالى العباد على ما في قلوبهم وحقائق أعمالهم 2؛ كما قال تعالى: يَوْمَ تُبْلَى السَّرَائِرُ [الطارق: 9].

Luna, tuned 24 words · 0 sources cited

يُرجى توضيح سؤالك، هل ترغب في معرفة حكم وأدلة معاملة الناس على الظاهر وعدم التنقيب في قلوبهم، أم تسأل عن صحة وتخريج هذا اللفظ؟

Method and limitsHow the numbers were produced, and what 48 questions can and cannot show.

Setups. Production is today's search: Gemini calls search tools and Cohere reranks. The other setups use the new jev-search pipeline, with search decisions made by gpt-6-luna (OpenAI /v1/decisions, public beta) or jev-latest (TypeSafe). Gemini 3.7 Flash writes every answer.

Answers. 48 real user questions. New setups ran on 7 October; production answers are replays from 17 September. Claude Opus judged each pair blind in both orders; intervals are 95% Wilson.

Ranking and grounding. 205 search pools graded 0–3 by three judges. Grounding audit: up to twelve claims per answer checked against the passages it cited, on 18 questions.

Tuning. One map per field from Luna's scale to jev's, fitted on 101 questions and the 205 pools, none of them in the 48.

Limits. 48 questions resolve a win rate to about ±15 points. Production's times come from a different day. Load at our full volume was not tested. The API is in beta, so price and limits may change.