OpenAI ने आज GPT-6 Astra रिलीज़ किया और इसे "दुनिया का सबसे बुद्धिमान और aligned model" बताया। announcement, system card और benchmark tables पढ़ने के बाद – और पिछले कई महीनों से RX 6800M laptop पर अपने local models चलाते हुए – मेरी ईमानदार राय यह है: Astra एक असली कदम आगे है, लेकिन सबसे दिलचस्प हिस्से वे नहीं हैं जिन्हें OpenAI ने headline में रखा है।
यह guide बताता है कि GPT-6 Astra असल में क्या करता है, कौन से नंबर मायने रखते हैं, कहाँ यह अभी भी पीछे है, इसकी कीमत क्या है – और सबसे ज़रूरी सवाल: afford करने लायक hardware पर local AI चलाने वालों के लिए इसका क्या मतलब है।
संक्षेप में
- Computer use ही असली feature है। Astra ने OSWorld 2.0 पर 72.6% score किया, और GPT-5.6 Sol के मुकाबले प्रति task लगभग 47% कम समय लिया – यह desktop चलाने में सिर्फ बेहतर नहीं है, बहुत तेज़ भी है।
- Abstract reasoning लगभग perfect: ARC-AGI-3 पर 99.9%, पिछले model के 7.8% से। यह ढलान नहीं, सीधी छलांग है।
- Cybersecurity में बड़ी छलांग – OpenAI के अनुसार Astra Preparedness Framework में "Critical" threshold पर है, और testing के दौरान इसने दो असली zero-day bugs खोज लिए।
- यह सब कुछ नहीं जीतता। Artificial Analysis के स्वतंत्र intelligence index पर Claude Fable 5.1 आगे है (65.7 बनाम 61.2), और tools के साथ Humanity's Last Exam में Claude Opus 5 से हारता है।
- कीमत: $10 प्रति million input tokens, $50 प्रति million output – मौजूदा frontier tier जैसी ही। ChatGPT Plus/Pro/Business/Enterprise और API, Azure, AWS Bedrock पर उपलब्ध।
GPT-6 Astra है क्या
Astra OpenAI का नया flagship है, GPT-5.6 Sol का उत्तराधिकारी। यह एक closed, cloud-only
model है – आप इसे download नहीं कर सकते और न ही अपनी machine पर चला सकते हैं। यह ChatGPT,
OpenAI API (gpt-6-astra के नाम से), Microsoft Azure और AWS Bedrock पर उपलब्ध है।
OpenAI का कहना है कि इसमें तीन चीज़ों पर सालों का काम जुड़ा है: pre-training (कच्चा ज्ञान), reinforcement learning (कोशिश-गलती से सीखना), और alignment (आपकी तय सीमाओं के अंदर रहना)। नतीजे सबसे साफ agentic काम में दिखते हैं – ऐसे tasks जहाँ model सिर्फ सवाल का जवाब नहीं देता, बल्कि असल में software चलाता है: buttons दबाता है, forms भरता है, code लिखकर test करता है, और multi-step काम पूरा होने तक चलता रहता है।
वे benchmark नंबर जो मायने रखते हैं
हर lab scores की tables बरसाती है, इसलिए यहाँ वे नंबर हैं जिन पर सच में ध्यान देना चाहिए – OpenAI की अपनी comparison table से नज़दीकी competitors के साथ:
| Benchmark | क्या test करता है | GPT-6 Astra | GPT-5.6 Sol | बेहतम rival |
|---|---|---|---|---|
| ARC-AGI-3 | नई abstract problem-solving | 99.9% | 7.8% | 30.2% (Opus 5) |
| OSWorld 2.0 | असली computer use | 72.6% | 65.7% | 70.2% (Opus 5) |
| Terminal-Bench 4.0 | Agentic terminal/coding tasks | 57.9% | 37.3% | 55.8% (Fable 5.1) |
| FrontierMath Tier 4 | Research-level math | ~98% | 83.0% | 87.8% (Fable 5.1) |
| AutomationBench | असली office workflows | 41.4% | 18.1% | 31.4% (Fable 5.1) |
| ExploitBench | CVEs को working exploits में बदलना | 100% | 78.5% | 70% (Fable) |
| MRCR 512K–1M | Long-context recall | 96.3% | 73.8% | – |
ARC-AGI-3 का नंबर देखकर मैं रुक गया। यह benchmark ही इस तरह बना है कि memorisation काम न आए – model को ऐसे rules खोजने होते हैं जो उसने कभी देखे ही नहीं। एक ही generation में 7.8% से 99.9% जाना upgrade नहीं, अलग ही machine है। यह ढलान नहीं, सीधी छलांग है। ARC Prize के Greg Kamradt के अनुसार Astra ने benchmark पर मानव बराबरी effectively छू ली है।
अब ईमानदार हिस्सा। Artificial Analysis के स्वतंत्र index पर – जिसे OpenAI नहीं चलाता – Astra का score 61.2 है, Claude Fable 5.1 (65.7) और Claude Opus 5 (63.1) के पीछे। Tools के साथ Humanity's Last Exam पर Claude Fable 5.1 का 65.0 बनाम Astra का 57.2। यानी "दुनिया का सबसे बुद्धिमान model" इस बात पर निर्भर है कि आप पैमाना कौन सा इस्तेमाल करें। Astra स्पष्ट रूप से सबसे अच्छा agent है – computer, terminal, browser चलाने में – लेकिन हर चीज़ में बेताज राजा नहीं।
Computer use: असली कहानी
अगर आप announcement की हर बात छोड़ दें, तो intelligence index भूलकर यहाँ देखें। OSWorld 2.0 पर OpenAI की latency simulations दिखाती हैं कि Astra, GPT-5.6 Sol से ज़्यादा tasks पूरे किए – और प्रति task लगभग 47% कम समय में: लगभग 40 मिनट में 72.6% बनाम लगभग 75 मिनट में 65.7%। Updated Codex harness के साथ Mind2Web benchmark पर 1.9x तेज़ task completion का दावा है।
Demos सबसे अच्छे मतलब में बoring हैं: US tax form (1040) भरना, CRM में records update करना, DMV appointment बुक करना, flat ढूँढना, KiCad में तीन मिनट से कम में printed circuit board route करना। पहली बार मैंने किसी lab को flagship announcement में chat benchmark के बजाय "यह आपके boring computer के काम आपसे तेज़ करता है" को headline बनाते देखा है। यह बताता है कि OpenAI के हिसाब से पैसा कहाँ है।
Coding और context-notes का trick
Astra ने Terminal-Bench 4.0 (57.9%) में टॉप किया और internal coding results मज़बूत हैं; शुरुआती partners भी सहमत हैं: Jane Street इसे "clear step forward" कहती है, और Lovable के CTO के अनुसार higher effort settings पर इसने browser testing से अपना काम खुद verify करना ज़्यादा किया।
जिस feature को मैं असल में चुराना चाहता हूँ: Codex में context notes।
आज कल, जब लंबी coding session context window भर
देती है, model compact करता है – अपनी ही history का summary बनाता है – और
"यह fix क्यों फेल हुआ" जैसे details compression में खो जाते हैं। Astra इसके बजाय context
windows के बीच running notes रख सकता है, और पुरानी windows searchable रहती हैं। यह
experimental है (Codex की config.toml में enable करें) और जल्द default बन
जाएगा। अगर आपने कभी agent को session के बीच अपनी requirements भूलते देखा है, तो
समझ जाएँगे कि यह कितना बड़ा fix है।
Cybersecurity: "Critical" पहली बार
OpenAI ने Astra को अपनी Preparedness Framework के Critical threshold पर रखा है – cybersecurity में सबसे ज़्यादा risk वाली श्रेणी। बिना safety guardrails के test करने पर Astra ने ExploitBench पर 100% score किया (known vulnerabilities को working exploits में बदलना), Sol के 78.5% बनाम। जून–अगस्त 2026 में disclosed Chrome vulnerabilities पर बने नए benchmark पर इसने 39% tasks में code execution हासिल किया (Sol: 11.5%) – और testing के दौरान दो पहले से अज्ञात zero-day bugs खोज लिए, जिनके maintainers को OpenAI अब disclose कर रहा है।
Launch version proof-of-concept exploits लिखने से मना करता है। OpenAI Daybreak नामक program के ज़रिए verified defenders के लिए इसे ढीला करने की योजना बनाता है – secure code review, malware analysis, detection engineering। कुल नतीजा: patching की खिड़की दोनों तरफ़ से छोटी होने वाली है। अगर आप internet पर कुछ भी exposed चलाते हैं, तो यह release "AI news" नहीं, "इसी हफ़्ते servers update करें" वाली खबर है।
Alignment के दावे – और वह कबूलनाटी जो OpenAI ने खुद की
Astra के alignment नंबर सच में प्रभावशाली हैं। एक honeypot test में – जहाँ असंभव task पर model अपनी authorized scope से बाहर जाने की कोशिश करता है – GPT-5.6 Sol ने 48% बार सीमा तोड़ी। Astra ने: 0%। इसने Codex के auto-review को circumvent करने की कभी कोशिश नहीं की, यहाँ तक कि test को जानबूझकर ऐसा बनाया गया था कि circumvention के सिवाय सफलता का कोई रास्ता न हो। अपनी capabilities के बारे में ग़लत दावे करने की दर Sol से 3x कम है।
लेकिन fine print पढ़ें: OpenAI कहता है कि simple tasks पर Astra का लिखित reasoning monitor करना Sol से कठिन है – यह कम, घने steps में सोचता है, तो देखने को कम मिलता है। OpenAI इसे efficiency का side effect बताता है और कहता है कि monitorability शोध की प्राथमिकता रहेगी। मेरी राय: announcement में यह सबसे ज़रूरी वाक्य है – model व्यवहार में बेहतर है, लेकिन हमें कम दिखता है कि वह जो करता है क्यों करता है। "इस पर नज़र रखें" वाली श्रेणी।
Science: असली math results
Prime numbers पर दो असली research outputs: Astra ने primes के बीच के bounded gaps के मशहूर result को 240 से घटाकर 186 करने में मदद की, और large prime gaps की bound में उस term को सुधारा जो 80 साल से जमा था। Proofs published हैं। आपके रोज़मर्रा के काम में इसका क्या फ़ायदा, अलग सवाल – लेकिन यह वह दावा है जो पहले ढेरों hand-waving के साथ आता था; यहाँ PDFs के साथ आया है।
कीमत और उपलब्धता
- API: $10 प्रति million input tokens, $50 प्रति million output। "Fast mode" 2x speed पर 2x कीमत में।
- ChatGPT: आने वाले दिनों में Plus, Pro, Business और Enterprise में – मौजूदा subscription allowances के अंदर, अतिरिक्त usage के लिए credits खरीदे जा सकते हैं।
- GPT-6 Astra Pro: Pro, Business और Enterprise plans के लिए भारी variant।
- Enterprise: admin चालू करें, launch पर default बंद – cyber capabilities को देखते हुए जानबूझकर चुना गया कदम।
- Privacy: eligible API customers के लिए Zero Data Retention उपलब्ध।
कीमत सबसे कम दिलचस्प हिस्सा है – मौजूदा frontier tier जैसी ही। अगर आप API models की लागत अपनी hardware से तुलना करना चाहते हैं, हमारा AI API cost calculator पूरा हिसाब लगाता है, उस break-even point सहित जहाँ GPU अपने आप को pay off करता है।
अगर आप local AI चलाते हैं तो इसका क्या मतलब है
यही वह section है जो मैं लिखने के लिए बैठ था, क्योंकि यह वही सवाल है जो इस site के पाठकों के पास असल में है: क्या Astra ने मेरा RX 6800M बेकार कर दिया? नहीं। लेकिन यह उस रेखा को खिसकाता है जहाँ से local models समझदार साबित होते हैं – और इसमें सटीक रहना ज़रूरी है।
जहाँ gap चौड़ा हुआ: agentic काम। Computer use, घंटों की coding sessions searchable context के साथ, office automation – Astra का OSWorld पर 72.6% और AutomationBench पर 41.4% उस ब्रह्मांड से संबंध रखते हैं जो 12 GB VRAM पर 27B या 35B model कर सकता है। अगर आपका workflow "agent को software चलाते हुए देखरेख करना" है, तो cloud ने और फ़ासली बना ली। हमारे lab benchmarks दिखाते हैं कि local models असल में किसमें अच्छे हैं: तेज़, private, दोहराने लायक generation – autonomy में नहीं।
जहाँ कुछ नहीं बदला: cost, privacy और offline। $10/$50 प्रति million tokens पर Astra हर frontier model जैसी अर्थव्यवस्था रखता है – एक भारी coding agent session millions of tokens जला देता है। अपनी GPU पर Qwen या Tiel-Coder MoE बिजली का खर्च लेता है और आपका हर byte आपके machine पर रहता है। संवेदनशील चीज़ों के लिए – client data, medical notes, कुछ भी जो आप US cloud में paste नहीं करेंगे – local ही एकमात्र जवाब है। और internet गिरे तो Astra कुछ न करने का बहुत बुद्धिमान तरीका है।
दिलचस्प असर आगे: इस तरह की frontier छलांगें आमतौर पर नीचे उतरती हैं। GPT-4-class chat quality अब 35B open model में आ जाती है जो ₹25,000 के GPU पर चलती है। Astra की announcement की तकनीकें – RL-heavy training, alignment को core product मानना, context management – वही हैं जिन्हें open-weight labs एक-दो साल में उठा लाते हैं। अगर आप आज local stack बना रहे हैं, हमारी ROCm & Vulkan guide और VRAM requirements table बताएँगी कि अगली cascade आने पर क्या खरीदना है।
निष्कर्ष
GPT-6 Astra पहला flagship release है जहाँ agent नंबर headline हैं, chat नंबर नहीं – और जहाँ vendor की अपनी system card safety जीत के साथ एक monitoring कमी भी कबूल करती है। असली computer work delegate करने वालों के लिए यह सच में महत्वपूर्ण release है, और जिनके local AI चलाने के कारण privacy, cost या offline access हैं – उनके लिए non-event। वे कारण आज नहीं बदले।
मैं वही करूँगा जो हमेशा किया: जब सही कीमत पर API access मिलेगा, तो यहाँ daily चलाए जाने वाले local models के साथ असली tokens-per-rupee comparisons दिखेंगे। तब तक benchmark tables को directionally सही मानें और "सबसे बुद्धिमान model" वाले दावे को marketing जो लगभग 80% सही है।