OpenAI இன்று GPT-6 Astra-வை வெளியிட்டது; "உலகின் மிகவும் புத்திசாலித்தனமான, aligned-ான model" என்று அழைக்கிறது. announcement, system card, benchmark அட்டவணைகளை படித்த பிறகு – மேலும் பல மாதங்களாக RX 6800M laptop-ல் என் சொந்த local models-ஐ இயக்கிய அனுபவத்தில் – என் நேர்மையான கருத்து: Astra நிஜமான முன்னேற்றம்தான், ஆனால் மிகவும் சுவாரஸ்யமான பகுதிகள் OpenAI தலைப்பில் வைத்தவை அல்ல.
GPT-6 Astra நிஜத்தில் என்ன செய்கிறது, எந்த எண்கள் முக்கியம், எங்கே இன்னும் பின்தங்கியுள்ளது, விலை என்ன – மேலும் மிக முக்கியமான கேள்வி: மலிவான hardware-ல் local AI இயக்குவோருக்கு இந்த புதிய cloud flagship என்ன பொருள், என்பதை இந்த வழிகாட்டி விளக்குகிறது.
சுருக்கமாக
- Computer use தான் முக்கிய feature. OSWorld 2.0-ல் Astra 72.6% பெற்றது; GPT-5.6 Sol-ஐ விட task ஒன்றுக்கு சராசரியாக ~47% குறைவு நேரம் – desktop-ஐ இயக்குவதில் சிறந்தது மட்டுமல்ல, மிக வேகமானது.
- Abstract reasoning கிட்டத்தட்ட perfect: ARC-AGI-3-ல் 99.9%, முந்தைய model-ன் 7.8%-லிருந்து. இது சரிவு அல்ல, நேரான குதிப்பு.
- Cybersecurity-ல் பெரிய குதிப்பு – OpenAI-யின் Preparedness Framework-ல் "Critical" threshold-ஐ Astra அடைவதாக கூறப்படுகிறது; சோதனையின்போது இரண்டு நிஜ zero-day bugs-ஐ கண்டுபிடித்துவிட்டது.
- எல்லாவற்றையும் இது வெல்லவில்லை. Artificial Analysis-ன் சுதந்திர intelligence index-ல் Claude Fable 5.1 இன்னும் முன்னிலை (65.7 vs 61.2); tools-உடன் Humanity's Last Exam-ல் Claude Opus 5 தான் வெற்றி.
- விலை: $10 ஒரு மில்லியன் input tokens-க்கு, $50 ஒரு மில்லியன் output-க்கு – தற்போதைய frontier tier-யே. ChatGPT Plus/Pro/Business/Enterprise, API, Azure, AWS Bedrock அனைத்திலும் கிடைக்கும்.
GPT-6 Astra என்றால் என்ன
Astra என்பது OpenAI-யின் புதிய flagship; GPT-5.6 Sol-ன் வாரிசு. இது ஒரு closed,
cloud-only model – பதிவிறக்கம் செய்ய முடியாது, சொந்த machine-ல் இயக்க முடியாது. ChatGPT,
OpenAI API (gpt-6-astra), Microsoft Azure, AWS Bedrock மூலம் கிடைக்கிறது.
மூன்று துறைகளிலும் பல ஆண்டுகளாக செய்த ஆராய்ச்சியின் கூட்டுவிளைவு என்று OpenAI சொல்கிறது: pre-training (அடிப்படை அறிவு), reinforcement learning (முயற்சி-பிழை மூலம் கற்றல்), alignment (நீங்கள் விதித்த எல்லைக்குள் நிற்பது). இதன் பலன் மிகத் தெளிவாக agentic வேலைகளில் தெரிகிறது – model வெறும் கேள்விக்கு பதில் சொல்லாமல், நிஜமாகவே software-ஐ பயன்படுத்துவது: buttons அழுத்துவது, forms நிரப்புவது, code எழுதி test செய்வது, பல-படி வேலை முடியும் வரை தொடர்வது.
முக்கியமான benchmark எண்கள்
ஒவ்வொரு lab-ம் score அட்டவணைகளை கொட்டும்; எனவே நிஜத்தில் கவனிக்கத் தக்க எண்கள் இவை – OpenAI-யின் சொந்த அட்டவணையில் உள்ள நெருக்கமான போட்டியாளர்களுடன்:
| Benchmark | எதை சோதிக்கிறது | GPT-6 Astra | GPT-5.6 Sol | சிறந்த rival |
|---|---|---|---|---|
| ARC-AGI-3 | புதிய abstract problem-solving | 99.9% | 7.8% | 30.2% (Opus 5) |
| OSWorld 2.0 | நிஜ computer use | 72.6% | 65.7% | 70.2% (Opus 5) |
| Terminal-Bench 4.0 | Agentic terminal/coding tasks | 57.9% | 37.3% | 55.8% (Fable 5.1) |
| FrontierMath Tier 4 | Research-level math | ~98% | 83.0% | 87.8% (Fable 5.1) |
| AutomationBench | நிஜ office workflows | 41.4% | 18.1% | 31.4% (Fable 5.1) |
| ExploitBench | CVE-க்களை working exploits ஆக்குவது | 100% | 78.5% | 70% (Fable) |
| MRCR 512K–1M | Long-context recall | 96.3% | 73.8% | – |
ARC-AGI-3 எண் என்னை உட்கார வைத்துவிட்டது. memorisation வேலை செய்யாதபடி இந்த benchmark வடிவமைக்கப்பட்டுள்ளது – முற்றிலும் பார்த்திராத rules-ஐ model கண்டுபிடிக்க வேண்டும். ஒரே generation-ல் 7.8%-லிருந்து 99.9% என்பது upgrade அல்ல, வேறே machine. ARC Prize-ன் Greg Kamradt சொல்கிறார்: benchmark-ல் Astra மனித சமநிலையை effectively அடைந்துவிட்டது.
இப்போது நேர்மையான பகுதி. Artificial Analysis-ன் சுதந்திர index-ல் – OpenAI ஓட்டாதது – Astra-யின் score 61.2; Claude Fable 5.1 (65.7), Claude Opus 5 (63.1) ஆகியவற்றுக்கு பின்னால். Tools-உடன் Humanity's Last Exam-ல் Claude Fable 5.1-ன் 65.0 vs Astra-வின் 57.2. அதாவது "உலகின் மிக புத்திசாலி model" என்பது நீங்கள் எந்த அளவுகோலை பயன்படுத்துகிறீர்கள் என்பதைப் பொறுத்தது. Agent ஆக – computer, terminal, browser ஓட்டுவதில் – Astra நிச்சயம் சிறந்தது; ஆனால் எல்லாவற்றிலும் அரசன் அல்ல.
Computer use: நிஜ கதை
announcement-ல் மற்ற எல்லாவற்றையும் புறக்கணித்தாலும், intelligence index-ஐ மறந்து இங்கே பாருங்கள். OSWorld 2.0-ல் OpenAI-யின் latency simulations காட்டுவது: GPT-5.6 Sol-ஐ விட அதிக tasks-ஐ Astra முடிக்கிறது – மேலும் task ஒன்றுக்கு சராசரியாக 47% குறைவு நேரத்தில்: ~40 நிமிடத்தில் 72.6% vs ~75 நிமிடத்தில் 65.7%. புதுப்பிக்கப்பட்ட Codex harness-உடன் Mind2Web benchmark-ல் 1.9x வேகமான task completion என்று உரிமை கோரப்படுகிறது.
Demo-க்கள் சிறந்த அர்த்தத்தில் சலிப்பானவை: US tax form (1040) நிரப்புவது, CRM-ல் records update செய்வது, DMV appointment பதிவு செய்வது, flat தேடுவது, KiCad-ல் மூன்று நிமிடத்திற்குள் printed circuit board route செய்வது. Chat benchmark-க்கு பதிலாக "உங்கள் பொதுவான computer வேலைகளை உங்களை விட வேகமாக செய்கிறது" என்பதை flagship announcement-ன் தலைப்பாக வைக்கும் முதல் lab இது. பணம் எங்கே இருக்கிறது என்று அவர்கள் நினைக்கிறார்கள் என்பது இது சொல்கிறது.
Coding மற்றும் context-notes trick
Terminal-Bench 4.0 (57.9%)-ல் Astra முதலிடம்; internal coding results வலுவானவை. ஆரம்ப partners ஒப்புக்கொள்கிறார்கள்: Jane Street இதை "clear step forward" என்கிறது; Lovable-ன் CTO சொல்கிறார்: higher effort settings-ல் browser testing மூலம் அது சொந்த வேலையை தானே verify செய்தது கணிசமாக அதிகம்.
நான் உண்மையில் திருட விரும்பும் feature: Codex-ல் context notes.
நீண்ட coding session context window-ஐ நிரப்பும்போது,
model compact செய்கிறது – சொந்த வரலாற்றையே சுருக்கமாக எழுதுகிறது – "இந்த fix
ஏன் தோற்றது" போன்ற விவரங்கள் அழுத்தத்தில் தொலைந்துபோகின்றன. Astra-வோ context
window-க்களுக்கு இடையே ஓடும் notes-ஐ வைத்திருக்கிறது; பழைய windows search
செய்யக்கூடியவாறு இருக்கும். இது experimental (Codex-ன் config.toml-ல்
enable செய்யவும்); விரைவில் default ஆகிவிடும். Session நடுவே requirements-ஐ agent
மறந்ததை நீங்கள் கண்டிருந்தால், இது எவ்வளவு பெரிய fix என்று புரியும்.
Cybersecurity: முதல் "Critical"
Preparedness Framework-ன் Critical threshold-ல் cybersecurity-ல் Astra வருகிறது – OpenAI-யின் அதிக ஆபத்து வகை. safety guardrails இல்லாமல் சோதிக்கையில், ExploitBench-ல் Astra 100% (known vulnerabilities-ஐ working exploits ஆக்குவது), Sol 78.5%. ஜூன்–ஆகஸ்ட் 2026-ல் வெளியான Chrome vulnerabilities-ல் கட்டிய புதிய benchmark-ல் 39% tasks-ல் code execution அடைந்தது (Sol: 11.5%) – மேலும் சோதனையின்போது முன்பு தெரியாத இரண்டு zero-day bugs-ஐ கண்டுபிடித்தது; அவற்றை maintainers-ிடம் OpenAI disclose செய்கிறது.
Launch version proof-of-concept exploits எழுதுவதை மறுக்கிறது. Daybreak என்ற திட்டத்தின் மூலம் சரிபார்க்கப்பட்ட defenders-க்கு கட்டுப்பாடுகளை தளர்த்த திட்டமிட்டுள்ளது – secure code review, malware analysis, detection engineering. மொத்த விளைவு: patching சாளரம் இரண்டு பக்கமும் சுருங்கப் போகிறது. internet-ல் எதையாவது exposed ஆக ஓட்டினால், இது "AI news" அல்ல – "இந்த வாரமே servers update செய்யுங்கள்" என்ற செய்தி.
Alignment உரிமைக்கோர்புகள் – OpenAI ஒப்புக்கொண்ட குறை
Astra-யின் alignment எண்கள் நிஜத்தில் பிரமாண்டம். ஒரு honeypot test-ல் – முடியாத task-ல் model authorized scope-ஐ தாண்ட முயற்சிக்கிறதா என்று பார்ப்பது – GPT-5.6 Sol 48% முறை எல்லைக்கு வெளியே சென்றது. Astra: 0%. Codex auto-review-ஐ circumvent செய்ய ஒருபோதும் முயலவில்லை; circumvention தவிர வெற்றிக்கு வழியே இல்லாதபடி test-ஐ வேண்டுமென்றே அமைத்தும் கூட. சொந்த capabilities பற்றி தவறான உரிமைக்கோர்புகள் செய்வது Sol-ஐ விட 3x குறைவு.
ஆனால் fine print படியுங்கள்: எளிய tasks-ல் Astra-யின் எழுதப்பட்ட reasoning-ஐ monitor செய்வது Sol-ஐ விட கடினம் என்று OpenAI சொல்கிறது – குறைவான, அடர்த்தியான படிகளில் யோசிக்கிறது, எனவே பார்க்கப் பொருள் குறைவு. இது efficiency-யின் side effect என்றும், monitorability தொடர்ந்து ஆராய்ச்சி முன்னுரிமை என்றும் OpenAI சொல்கிறது. announcement-ல் மிக முக்கியமான வாக்கியம் இதுதான் என்று நான் நினைக்கிறேன்: model நடத்தையில் சிறந்தது, ஆனால் எதுக்கு அது அப்படி செய்கிறது என்று நமக்கு குறைவாகவே தெரிகிறது. "இதை கவனிக்கவும்" பிரிவு.
Science: நிஜ math முடிவுகள்
Prime numbers பற்றி இரண்டு நிஜ research outputs: primes-க்கு இடையேயான bounded gaps பிரசித்தி பெற்ற result-ஐ 240-லிருந்து 186-க்கு இறுக்க Astra உதவியுள்ளது; 80 வருடங்களாக அசைவற்றிருந்த large prime gaps bound-ன் ஒரு term-ஐ மேம்படுத்தியுள்ளது. Proofs வெளியிடப்பட்டிருக்கின்றன. உங்கள் தினசரி வேலைக்கு இது என்ன பயன் என்பது வேறு கேள்வி – ஆனால் இதுபோன்ற உரிமைக்கோர்புகள் முன்பு hand-waving-உடன் வரும்; இங்கே PDF-களுடன் வந்திருக்கிறது.
விலை மற்றும் கிடைக்கும் விதம்
- API: $10 ஒரு மில்லியன் input tokens, $50 ஒரு மில்லியன் output. "Fast mode" 2x வேகத்திற்கு 2x விலை.
- ChatGPT: வரும் நாட்களில் Plus, Pro, Business, Enterprise-ல் – தற்போதைய subscription allowances-க்குள்; கூடுதல் usage-க்கு credits வாங்கலாம்.
- GPT-6 Astra Pro: Pro, Business, Enterprise plans-க்கு கனமான variant.
- Enterprise: admin இயக்க வேண்டும்; launch-ல் default ஆஃப் – cyber திறன்களை கருத்தில் கொண்டு வேண்டுமென்றே எடுத்த முடிவு.
- Privacy: தகுதியான API customers-க்கு Zero Data Retention.
விலை தான் மிகவும் சுவாரஸ்யமில்லாத பகுதி – தற்போதைய frontier tier-யே. API models-ன் செலவை சொந்த hardware-உடன் ஒப்பிட விரும்பினால், எங்கள் AI API cost calculator முழு கணக்கையும் செய்கிறது – GPU தன்னைத்தானே pay off செய்து கொள்ளும் break-even point-உடன்.
நீங்கள் local AI இயக்குபவர் என்றால்
இந்த section-ஐ எழுதுவதற்காகவே நான் உட்கார்ந்தேன்; ஏனெனில் இந்த site வாசகர்களின் நிஜ கேள்வி இதுதான்: என் RX 6800M-ஐ Astra பயனற்றதாக்கிவிட்டதா? இல்லை. ஆனால் local models எங்கே சரியாக பொருந்துகின்றன என்ற கோட்டை இது நகர்த்துகிறது; அதில் துல்லியமாக இருப்பது அவசியம்.
இடை விரிந்த இடம்: agentic வேலை. Computer use, searchable context-உடன் மணிக்கணக்கான coding sessions, office automation – Astra-வின் OSWorld 72.6%, AutomationBench 41.4% ஆகியவை 12 GB VRAM-ல் 27B/35B model ஆல் முடியும் பிரபஞ்சம் அல்ல. "software-ஐ click செய்யும் agent-ஐ கண்காணிப்பது" உங்கள் workflow என்றால், cloud இன்னும் தொலைந்துவிட்டது. எங்கள் lab benchmarks காட்டுவது: local models நிஜத்தில் நல்லவை – வேகம், private, மீண்டும் இயக்கத்தக்க generation – autonomy அல்ல.
எதுவும் மாறாத இடம்: cost, privacy, offline. மில்லியனுக்கு $10/$50 என்ற Astra-யின் பொருளாதாரம் ஒவ்வொரு frontier model-போலவே – கனமான coding agent session மில்லியன் tokens-ஐ எரிக்கும். உங்கள் GPU-ல் Qwen அல்லது Tiel-Coder MoE என்பது மின்சார செலவு மட்டுமே; உங்கள் தரவு முழுவதும் உங்கள் machine-லேயே இருக்கும். sensitive விஷயங்களுக்கு – client data, medical notes, US cloud-ல் paste செய்ய 마ட்டாத எதற்கும் – local தான் ஒரே பதில். internet போனால், Astra என்பது எதுவும் செய்யாமல் இருப்பதற்கான மிக புத்திசாலி வழி.
சுவாரஸ்யமான பின்விளைவு: இதுபோன்ற frontier குதிப்புகள் பொதுவாக கீழே இறங்கும். GPT-4-class chat quality இப்போது 35B open model-ல் அடங்கிவிடுகிறது; அது ₹25,000 GPU-ல் ஓடும். Astra announcement-ல் உள்ள நுட்பங்கள் – RL-heavy training, alignment-ஐ core product ஆக கருதுவது, context management – open-weight labs ஒன்றிரண்டு வருடங்களில் நகலெடுப்பவை. இன்று local stack கட்டுபவராக இருந்தால், எங்கள் ROCm & Vulkan வழிகாட்டிவும் VRAM requirements அட்டவணையும் அடுத்த அலை வரும்போது என்ன வாங்க வேண்டும் என்று சொல்லும்.
முடிவு
GPT-6 Astra முதல் flagship release: agent எண்கள் தலைப்பு, chat எண்கள் அல்ல – மேலும் vendor-ன் சொந்த system card, safety வெற்றிகளுடன் ஒரு monitoring குறையையும் ஒப்புக்கொள்ளும் release. நிஜ computer வேலையை ஒப்படைப்பவர்களுக்கு இது உண்மையிலேயே முக்கியமான வெளியீடு; privacy, cost, offline access காரணங்களால் local AI இயக்குபவர்களுக்கு இது non-event. அந்த காரணங்கள் இன்று மாறவில்லை.
நான் எப்போதும் செய்வதை செய்வேன்: நியாயமான விலையில் API access கிடைத்தவுடன், தினமும் ஓட்டும் local models-உடன் நிஜ tokens-per-rupee ஒப்பீடுகள் இங்கே தெரியும். அதுவரை, benchmark அட்டவணைகளை திசை அடிப்படையில் சரியெனவும், "மிக புத்திசாலி model" என்ற கோர்ப்பை ~80% சரியான marketing எனவும் கருதுங்கள்.