Veri egemenliği, millî egemenliktir.
Magibu, Türkçe foundation ve embedding modellerini kurum içinde çalışan, güvenli ve ölçülebilir yapay zekâ sistemlerine dönüştürür. İstanbul merkezliyiz; Türkçe'den başlayarak yapay zekâda az temsil edilen diller için ölçüm-öncelikli altyapı kuruyoruz.
Şirket, akademi ve açık kaynak topluluğu aynı kanıt kültüründe buluşur: slogan değil benchmark. Bir modelin, tokenizer'ın veya retrieval sisteminin iyi olup olmadığını canlı demolar, açık veri setleri ve yeniden üretilebilir değerlendirmelerle gösteririz.
Aşağıdaki her rakam açık bir sayfada, bağımsız olarak doğrulanabilir.
| 0,7B → 26B | Kendi Türkçe foundation model ailemiz. Amiral model Magibu-Q26B, chat.magibu.ai üzerinde canlı. |
| %74,40 | magibu-11b-v0.8 modelinin TR-MMLU skoru — 11,3 milyar parametreyle. Açık ağırlıklı modeller arasında bu skoru geçen her model en az 27 milyar parametreli. (tablo) |
| 104 model | TR-MMLU üzerinde değerlendirilen model sayısı. 6.200 soru, 57 alan. |
| 26 veri seti | TR-MTEB kapsamı; 6 görev, açık lider tablosu. (scoreboard) |
| ~%23,8 | Magibu tokenizer'ının Türkçe korpusta orijinal Qwen tokenizer'ına göre sağladığı token tasarrufu. (model kartı) |
| 19 yayın · 51 atıf | arXiv, ACM TALLIP ve Applied Sciences hattı; h-index 4. (Scholar) |
Türkçe'nin morfolojisine göre eğitilmiş, boyut bazında ölçeklenen bir aile. İhtiyaca yetecek en küçük modeli seçebilmek de bir tasarım hedefidir: daha küçük model, daha az GPU, daha uygulanabilir kurum içi kurulum.
| Model | Parametre | Not |
|---|---|---|
alibayram/magibu-q700m |
0,7B | Uç cihaz senaryoları · 131.072 token sözlük |
alibayram/magibu-q2b |
2B | Hafif görevler |
alibayram/magibu-q4b |
4B | Dengeli |
alibayram/magibu-q8b |
8B | Üretim adayı |
magibu/magibu-11b-v0.8 |
11,3B | TR-MMLU'da ölçülü — %74,40 |
alibayram/magibu-q26b |
26B | Amiral model · canlı sohbet |
| Model | Parametre | Not |
|---|---|---|
magibu/embeddingmagibu-200m |
200M | Semantik arama ve benzerlik · canlı demo |
magibu/embeddingmagibu-152m |
152M | Hafif dağıtım |
OpenAI uyumlu /embeddings endpoint'i üzerinden 8192 token bağlam desteğiyle sunuluyor: dev.magibu.ai
Daha az token · Daha düşük maliyet · Daha az enerji.
Türkçe gibi morfolojik olarak zengin dillerde global tokenizer'lar aynı anlamı gereksiz çok token ile temsil eder. Bu doğrudan çıkarım maliyetine, gecikmeye ve enerji tüketimine yazılır. Geliştirdiğimiz tokenizer'ı kendi metninizle diğerleriyle karşılaştırabilirsiniz:
Turkish Tiktokenizer — canlı karşılaştırma
| Alan | Bağlantı |
|---|---|
| Web sitesi | magibu.ai |
| Çözümler | magibu.ai/solutions |
| Araştırma | magibu.ai/research |
| Magibu Akademi | magibu.ai/academy |
| Açık kaynak topluluğu | magibu.ai/community |
| İletişim | magibu.ai/contact · info@magibu.ai |
| Embedding API | dev.magibu.ai |
| Magibu Q3 Chat | chat.magibu.ai |
| Hugging Face | huggingface.co/magibu |
| TR-MMLU tablosu | magibu.web.app/benchmarks |
| TR-MTEB Scoreboard | huggingface.co/spaces/magibu/mteb-turkish |
| Turkish Tiktokenizer | huggingface.co/spaces/alibayram/turkish_tiktokenizer |
| Google Scholar | M. Ali Bayram |
| Katman | Ne yapıyoruz? |
|---|---|
| Foundation model | 0,7B'den 26B'ye uzanan Türkçe model ailesini canlı demo ve benchmark kültürüyle geliştiriyoruz. |
| Tokenizer | Morfolojik olarak zengin dillerde token verimliliğini artıran tokenizer çalışmaları yürütüyoruz. |
| Embedding | Türkçe odaklı embedding modelleri, semantik arama ve retrieval değerlendirme altyapısı geliştiriyoruz. |
| Benchmark | TR-MMLU, TR-MTEB ve alan bazlı değerlendirme setleriyle model kalitesini ölçüyoruz. |
| Veri setleri | Fine-tuning, instruction-following, tool-call, conversation ve domain adaptation veri setleri hazırlıyoruz. |
| Private AI | Kurum verisi dışarı çıkmadan çalışan retrieval, RAG, audit ve on-prem yapay zekâ sistemleri tasarlıyoruz. |
Ürün katmanları: Magibu Embed API (canlı) · Magibu Search Kit · Magibu Private AI · Magibu Q3 Foundation — ayrıntı için magibu.ai/solutions.
| Repo | Amaç |
|---|---|
| turkish-morfolojik-tokenizer | Türkçe metni ses bilgisine uyarak morfolojik parçalarına ayırıp yeniden birleştirebilen tokenizer. |
| language-native-embeddings | Her dil veya alan için önce benchmark, sonra tokenizer ve embedding modeli üretme metodolojisi. |
| finetune-datasets | Türkçe ve İngilizce fine-tune veri setleri için ortak format ve katkı süreci. |
| magibu-llm-tools | Modelin doğru aracı doğru zamanda çağırmasını sağlayan araç ve destek sistemleri. |
Kariyer ve katkı: Magibu'da planlanan işe alımlarda bu projelere yapılan somut katkılar değerlendirmede öne çıkar ve önceliklendirilir.
| Çalışma | Yer | Yıl |
|---|---|---|
| Setting Standards in Turkish NLP: TR-MMLU for Large Language Model Evaluation | arXiv:2501.00593 | 2024 |
| Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark | arXiv:2502.07057 | 2025 |
| Tokens with Meaning: A Hybrid Tokenization Approach for NLP | arXiv:2508.14292 | 2025 |
| Adapting Multilingual Embedding Models to Turkish via Cross-Lingual Tokenizer Surgery and Offline Distillation | arXiv:2605.29992 | 2026 |
| Benchmarking Prompt Injection Attacks on LLMs: Turkish Vulnerability Assessment and English Comparative Analysis | Applied Sciences 16(13), 6740 | 2026 |
| Healthcare-Focused Turkish Medical LLM: Training on Real Patient-Doctor Question-Answer Data | ACM TALLIP | 2025 |
| Turkish MMLU: Yapay Zekâ ve Akademik Uygulamalar İçin Kapsamlı Türkçe Veri Seti | Zenodo 13375017 | 2024 |
Tam liste: Google Scholar · magibu.ai/research
Magibu'nun ilk güçlü kanıt alanı Türkçe. Fakat problem yalnızca Türkçe'ye ait değil: ana akım yapay zekâ sistemleri birçok dili hâlâ yeterince iyi temsil etmiyor.
- Türkçe ve az temsil edilen diller için embedding benchmarkları.
- Dil ve alan özelinde tokenizer verimliliği analizi.
- STSb, MTEB ve retrieval benchmark veri setleri.
- Alan uyarlamalı embedding ve reranker modelleri.
- Kurum içi, KVKK hassasiyetine uygun Private AI kurulumları.
- Avrupa ve Orta Asya'daki düşük kaynaklı diller için ortak araştırma ve pilot çalışmalar.
İlk genişleme kümemizde Azerbaycan Türkçesi, Kazakça, Özbekçe, Kırgızca, Tatarca, Letonca, Litvanca, Estonca, Slovence, Slovakça, Hırvatça, Sırpça, Romence, İrlandaca, Galce ve Bretonca gibi diller yer alıyor.
- Kurumsal Yapay Zekâ — Kendi verinizde hangi modelin en iyi çalıştığını ölçün; pilottan üretime ölçeklenebilir bir yol.
- Magibu Akademi — LLM, embedding ve yapay zekâ mimarisi eğitimleri; ilk haftadan itibaren açık kaynağa katkı.
- Açık Kaynak Topluluğu — Açık benchmark, model ve tokenizer çalışmalarına katkı; haftalık bülten ve canlı yayınlar.
Üçünün ortak ilkesi aynıdır: önce ölç, sonra kur.
- Süresiz Canlı Yayın — Her Pazar; kod, soru ve makale. Talep gönderebilirsiniz.
- Magibu AI Weekly — Açık kaynak haftalık bülten: yapay zekâ haberleri, makaleler, model duyuruları, benchmark gelişmeleri ve düşük kaynaklı dil çalışmaları.
Açık kaynak katkı beklediğimiz ana alanlar:
- Türkçe veya başka bir dil için STSb/MTEB tarzı benchmark hazırlamak.
- Dil veya domain özelinde tokenizer eğitmek ve token verimliliği raporlamak.
- Embedding modellerini açık benchmarklarda karşılaştırmak.
- Fine-tuning için temiz, lisanslı ve belgelenmiş veri setleri oluşturmak.
- Hugging Face üzerinde model, dataset veya demo yayınlamak.
- README, model kartı, değerlendirme raporu ve notebook katkısı yapmak.
Katkı akışı:
- İlgili repoda issue açın veya mevcut issue'ya yazın.
- Çıktınızı açık formatta ve tekrar üretilebilir şekilde hazırlayın.
- Modeli, tokenizer'ı veya veri setini Hugging Face üzerinde yayınlayın.
- Sonuçları, benchmark skorlarını ve linkleri README'ye ekleyen bir pull request gönderin.
Türkçe veya düşük kaynaklı bir dilde kurum dokümanlarıyla çalışıyorsanız, ilk adım büyük bir sistem kurmak değil, küçük ve güvenilir bir ölçüm yapmaktır:
- temsilî doküman örnekleri seçilir,
- gerçek kullanıcı soruları hazırlanır,
- embedding, chunking, reranker ve vektör veritabanı seçenekleri karşılaştırılır,
- recall@k, precision@k, MRR, nDCG ve latency raporlanır,
- pilot veya on-prem kurulum kararı veriye dayalı alınır.
Araştırma, pilot, API erişimi, yatırım ve açık kaynak iş birlikleri için: magibu.ai/contact · info@magibu.ai
Beta Space Studio · Matematik ve Yapay Zeka Enstitüsü · Vivax
We build foundation models for AI sovereignty. Data sovereignty is national sovereignty.
Magibu turns Turkish foundation and embedding models into secure, measurable AI systems that run inside the organisation. We build evaluation-first infrastructure for Turkish and other underrepresented languages: benchmarks, tokenizers, embeddings, retrieval systems, fine-tuning datasets, and private AI deployments.
Our foundation model family spans 0.7B to 26B parameters, with Magibu-Q26B as the flagship, live at chat.magibu.ai. Our 11.3B release scores 74.40% on TR-MMLU — and every open-weight model ranked above it on that board has at least 27B parameters. The board covers 104 models across 6,200 questions and 57 domains, and it is public.
Three tracks share one principle. Enterprise turns evidence into secure products, Academy turns knowledge into practice, and Community advances open measurement and open science. We start with Turkish as our strongest proof field and expand the same benchmark-driven methodology to languages that remain underrepresented in mainstream AI systems.
Slogans don't reproduce. Benchmarks do.
Magibu Research · İstanbul, Türkiye · magibu.ai · GitHub · Hugging Face