Skip to content

Magibu

Yapay zekâ egemenliği için foundation model geliştiriyoruz.

Veri egemenliği, millî egemenliktir.

Magibu, Türkçe foundation ve embedding modellerini kurum içinde çalışan, güvenli ve ölçülebilir yapay zekâ sistemlerine dönüştürür. İstanbul merkezliyiz; Türkçe'den başlayarak yapay zekâda az temsil edilen diller için ölçüm-öncelikli altyapı kuruyoruz.

Şirket, akademi ve açık kaynak topluluğu aynı kanıt kültüründe buluşur: slogan değil benchmark. Bir modelin, tokenizer'ın veya retrieval sisteminin iyi olup olmadığını canlı demolar, açık veri setleri ve yeniden üretilebilir değerlendirmelerle gösteririz.

Hugging Face Canlı Demo Embedding API TR-MMLU


Kanıt Tahtası

Aşağıdaki her rakam açık bir sayfada, bağımsız olarak doğrulanabilir.

0,7B → 26B Kendi Türkçe foundation model ailemiz. Amiral model Magibu-Q26B, chat.magibu.ai üzerinde canlı.
%74,40 magibu-11b-v0.8 modelinin TR-MMLU skoru — 11,3 milyar parametreyle. Açık ağırlıklı modeller arasında bu skoru geçen her model en az 27 milyar parametreli. (tablo)
104 model TR-MMLU üzerinde değerlendirilen model sayısı. 6.200 soru, 57 alan.
26 veri seti TR-MTEB kapsamı; 6 görev, açık lider tablosu. (scoreboard)
~%23,8 Magibu tokenizer'ının Türkçe korpusta orijinal Qwen tokenizer'ına göre sağladığı token tasarrufu. (model kartı)
19 yayın · 51 atıf arXiv, ACM TALLIP ve Applied Sciences hattı; h-index 4. (Scholar)

Foundation Modellerimiz

Türkçe'nin morfolojisine göre eğitilmiş, boyut bazında ölçeklenen bir aile. İhtiyaca yetecek en küçük modeli seçebilmek de bir tasarım hedefidir: daha küçük model, daha az GPU, daha uygulanabilir kurum içi kurulum.

Model Parametre Not
alibayram/magibu-q700m 0,7B Uç cihaz senaryoları · 131.072 token sözlük
alibayram/magibu-q2b 2B Hafif görevler
alibayram/magibu-q4b 4B Dengeli
alibayram/magibu-q8b 8B Üretim adayı
magibu/magibu-11b-v0.8 11,3B TR-MMLU'da ölçülü — %74,40
alibayram/magibu-q26b 26B Amiral model · canlı sohbet

Embedding Modellerimiz

Model Parametre Not
magibu/embeddingmagibu-200m 200M Semantik arama ve benzerlik · canlı demo
magibu/embeddingmagibu-152m 152M Hafif dağıtım

OpenAI uyumlu /embeddings endpoint'i üzerinden 8192 token bağlam desteğiyle sunuluyor: dev.magibu.ai

Tokenizer

Daha az token · Daha düşük maliyet · Daha az enerji.

Türkçe gibi morfolojik olarak zengin dillerde global tokenizer'lar aynı anlamı gereksiz çok token ile temsil eder. Bu doğrudan çıkarım maliyetine, gecikmeye ve enerji tüketimine yazılır. Geliştirdiğimiz tokenizer'ı kendi metninizle diğerleriyle karşılaştırabilirsiniz:

Turkish Tiktokenizer — canlı karşılaştırma

Canlı Bağlantılar

Alan Bağlantı
Web sitesi magibu.ai
Çözümler magibu.ai/solutions
Araştırma magibu.ai/research
Magibu Akademi magibu.ai/academy
Açık kaynak topluluğu magibu.ai/community
İletişim magibu.ai/contact · info@magibu.ai
Embedding API dev.magibu.ai
Magibu Q3 Chat chat.magibu.ai
Hugging Face huggingface.co/magibu
TR-MMLU tablosu magibu.web.app/benchmarks
TR-MTEB Scoreboard huggingface.co/spaces/magibu/mteb-turkish
Turkish Tiktokenizer huggingface.co/spaces/alibayram/turkish_tiktokenizer
Google Scholar M. Ali Bayram

Ne Üretiyoruz?

Katman Ne yapıyoruz?
Foundation model 0,7B'den 26B'ye uzanan Türkçe model ailesini canlı demo ve benchmark kültürüyle geliştiriyoruz.
Tokenizer Morfolojik olarak zengin dillerde token verimliliğini artıran tokenizer çalışmaları yürütüyoruz.
Embedding Türkçe odaklı embedding modelleri, semantik arama ve retrieval değerlendirme altyapısı geliştiriyoruz.
Benchmark TR-MMLU, TR-MTEB ve alan bazlı değerlendirme setleriyle model kalitesini ölçüyoruz.
Veri setleri Fine-tuning, instruction-following, tool-call, conversation ve domain adaptation veri setleri hazırlıyoruz.
Private AI Kurum verisi dışarı çıkmadan çalışan retrieval, RAG, audit ve on-prem yapay zekâ sistemleri tasarlıyoruz.

Ürün katmanları: Magibu Embed API (canlı) · Magibu Search Kit · Magibu Private AI · Magibu Q3 Foundation — ayrıntı için magibu.ai/solutions.

Açık Kaynak Projeler

Repo Amaç
turkish-morfolojik-tokenizer Türkçe metni ses bilgisine uyarak morfolojik parçalarına ayırıp yeniden birleştirebilen tokenizer.
language-native-embeddings Her dil veya alan için önce benchmark, sonra tokenizer ve embedding modeli üretme metodolojisi.
finetune-datasets Türkçe ve İngilizce fine-tune veri setleri için ortak format ve katkı süreci.
magibu-llm-tools Modelin doğru aracı doğru zamanda çağırmasını sağlayan araç ve destek sistemleri.

Kariyer ve katkı: Magibu'da planlanan işe alımlarda bu projelere yapılan somut katkılar değerlendirmede öne çıkar ve önceliklendirilir.

Yayınlar

Çalışma Yer Yıl
Setting Standards in Turkish NLP: TR-MMLU for Large Language Model Evaluation arXiv:2501.00593 2024
Tokenization Standards for Linguistic Integrity: Turkish as a Benchmark arXiv:2502.07057 2025
Tokens with Meaning: A Hybrid Tokenization Approach for NLP arXiv:2508.14292 2025
Adapting Multilingual Embedding Models to Turkish via Cross-Lingual Tokenizer Surgery and Offline Distillation arXiv:2605.29992 2026
Benchmarking Prompt Injection Attacks on LLMs: Turkish Vulnerability Assessment and English Comparative Analysis Applied Sciences 16(13), 6740 2026
Healthcare-Focused Turkish Medical LLM: Training on Real Patient-Doctor Question-Answer Data ACM TALLIP 2025
Turkish MMLU: Yapay Zekâ ve Akademik Uygulamalar İçin Kapsamlı Türkçe Veri Seti Zenodo 13375017 2024

Tam liste: Google Scholar · magibu.ai/research

Araştırma Odağı

Magibu'nun ilk güçlü kanıt alanı Türkçe. Fakat problem yalnızca Türkçe'ye ait değil: ana akım yapay zekâ sistemleri birçok dili hâlâ yeterince iyi temsil etmiyor.

  • Türkçe ve az temsil edilen diller için embedding benchmarkları.
  • Dil ve alan özelinde tokenizer verimliliği analizi.
  • STSb, MTEB ve retrieval benchmark veri setleri.
  • Alan uyarlamalı embedding ve reranker modelleri.
  • Kurum içi, KVKK hassasiyetine uygun Private AI kurulumları.
  • Avrupa ve Orta Asya'daki düşük kaynaklı diller için ortak araştırma ve pilot çalışmalar.

İlk genişleme kümemizde Azerbaycan Türkçesi, Kazakça, Özbekçe, Kırgızca, Tatarca, Letonca, Litvanca, Estonca, Slovence, Slovakça, Hırvatça, Sırpça, Romence, İrlandaca, Galce ve Bretonca gibi diller yer alıyor.

Nereden Başlamak İstersiniz?

  • Kurumsal Yapay Zekâ — Kendi verinizde hangi modelin en iyi çalıştığını ölçün; pilottan üretime ölçeklenebilir bir yol.
  • Magibu Akademi — LLM, embedding ve yapay zekâ mimarisi eğitimleri; ilk haftadan itibaren açık kaynağa katkı.
  • Açık Kaynak Topluluğu — Açık benchmark, model ve tokenizer çalışmalarına katkı; haftalık bülten ve canlı yayınlar.

Üçünün ortak ilkesi aynıdır: önce ölç, sonra kur.

Topluluk Ritmi

  • Süresiz Canlı Yayın — Her Pazar; kod, soru ve makale. Talep gönderebilirsiniz.
  • Magibu AI Weekly — Açık kaynak haftalık bülten: yapay zekâ haberleri, makaleler, model duyuruları, benchmark gelişmeleri ve düşük kaynaklı dil çalışmaları.

Katkı Çağrısı

Açık kaynak katkı beklediğimiz ana alanlar:

  • Türkçe veya başka bir dil için STSb/MTEB tarzı benchmark hazırlamak.
  • Dil veya domain özelinde tokenizer eğitmek ve token verimliliği raporlamak.
  • Embedding modellerini açık benchmarklarda karşılaştırmak.
  • Fine-tuning için temiz, lisanslı ve belgelenmiş veri setleri oluşturmak.
  • Hugging Face üzerinde model, dataset veya demo yayınlamak.
  • README, model kartı, değerlendirme raporu ve notebook katkısı yapmak.

Katkı akışı:

  1. İlgili repoda issue açın veya mevcut issue'ya yazın.
  2. Çıktınızı açık formatta ve tekrar üretilebilir şekilde hazırlayın.
  3. Modeli, tokenizer'ı veya veri setini Hugging Face üzerinde yayınlayın.
  4. Sonuçları, benchmark skorlarını ve linkleri README'ye ekleyen bir pull request gönderin.

Kurumlar ve Araştırma Grupları İçin

Türkçe veya düşük kaynaklı bir dilde kurum dokümanlarıyla çalışıyorsanız, ilk adım büyük bir sistem kurmak değil, küçük ve güvenilir bir ölçüm yapmaktır:

  • temsilî doküman örnekleri seçilir,
  • gerçek kullanıcı soruları hazırlanır,
  • embedding, chunking, reranker ve vektör veritabanı seçenekleri karşılaştırılır,
  • recall@k, precision@k, MRR, nDCG ve latency raporlanır,
  • pilot veya on-prem kurulum kararı veriye dayalı alınır.

Araştırma, pilot, API erişimi, yatırım ve açık kaynak iş birlikleri için: magibu.ai/contact · info@magibu.ai

Partnerler

Beta Space Studio · Matematik ve Yapay Zeka Enstitüsü · Vivax

In English

We build foundation models for AI sovereignty. Data sovereignty is national sovereignty.

Magibu turns Turkish foundation and embedding models into secure, measurable AI systems that run inside the organisation. We build evaluation-first infrastructure for Turkish and other underrepresented languages: benchmarks, tokenizers, embeddings, retrieval systems, fine-tuning datasets, and private AI deployments.

Our foundation model family spans 0.7B to 26B parameters, with Magibu-Q26B as the flagship, live at chat.magibu.ai. Our 11.3B release scores 74.40% on TR-MMLU — and every open-weight model ranked above it on that board has at least 27B parameters. The board covers 104 models across 6,200 questions and 57 domains, and it is public.

Three tracks share one principle. Enterprise turns evidence into secure products, Academy turns knowledge into practice, and Community advances open measurement and open science. We start with Turkish as our strongest proof field and expand the same benchmark-driven methodology to languages that remain underrepresented in mainstream AI systems.

Slogans don't reproduce. Benchmarks do.


Magibu Research · İstanbul, Türkiye · magibu.ai · GitHub · Hugging Face

Popular repositories Loading

  1. MagibuMizan MagibuMizan Public

    Typed probabilistic decisions from open language models, without text generation

    Python 11 2

  2. language-native-embeddings language-native-embeddings Public

    Bu projede herkesin kendi istediği dilde ve alanda tokenizer ve embedding modelleri üretmeleri için yöntemleri ve gerekli adımları derliyoruz

    1

  3. turkish-morfolojik-tokenizer turkish-morfolojik-tokenizer Public

    Verilen metni Türkçe ses bilgisine uyarak morfolojik parçalarına ayırıp daha sonra bu parçaları birleştirebilen güncel tokenizer projesidir

    Python 1

  4. .github .github Public

    Yapay Zekâ Herkes İçin, Her Dil İçin.

    1

  5. finetune-datasets finetune-datasets Public

    Yapay zeka modellerini belirli bir görev, dil veya kişiliğe evirmek için yüksek kaliteli veri setlerini bu proje altında toparlıyoruz

  6. magibu-llm-tools magibu-llm-tools Public

    Magibu dil modellerini çalıştırırken, modelin kullanacağı tool'lar ve yardımcı sistemler.

Repositories

Showing 7 of 7 repositories

Top languages

Loading…

Most used topics

Loading…