Telefonda Yerel Yapay Zeka Modeli Çalıştırma Rehberi

Uçak moduna alınmış bir telefonda yapay zekaya soru sormak birkaç yıl önce mümkün değildi. Bugün ise telefonda yerel yapay zeka modeli çalıştırma, yani modelin uzak bir veri merkezi yerine doğrudan cebinizdeki cihazda çalışması, orta seviye bir telefonda bile yapılabilen sıradan bir işlem hâline geldi.
Bu rehberde konuyu baştan sona ele aldık: yerel modelin ne anlama geldiği, hangi telefonların bu işi kaldırdığı, hangi uygulama kategorilerinin işinizi göreceği, kurulumun mantığı ve işin pil, ısınma ve doğruluk tarafındaki bedeli. Amacımız, uygulama sürümleri değişse de geçerliliğini koruyacak, tek bir yerde toplanmış bir yol haritası sunmak.
İçerik Başlıkları
- 1 Telefonda Yerel Yapay Zeka Modeli Çalıştırma Nedir?
- 2 Telefonda Çevrimdışı Çalışan Yapay Zeka Uygulamaları Neden Tercih Ediliyor?
- 3 Yerel Dil Modeli İçin Telefon Donanım Gereksinimleri
- 4 Telefonda Yerel Model Çalıştırmanın İki Yolu
- 5 Telefona Yapay Zeka Modeli Nasıl İndirilir? Adım Adım Kurulum
- 6 Doğru Modeli Seçmek: Parametre Sayısı ve Niceleme
- 7 Sınırlar: Pil Tüketimi, Isınma ve Doğruluk
- 8 Sonuç: Cebinizdeki Modelden En İyi Verimi Almak
Telefonda Yerel Yapay Zeka Modeli Çalıştırma Nedir?
Yerel çalışma (on-device, cihaz üzerinde işleme), bir büyük dil modelinin (LLM) ağırlıklarının telefonun deposunda durması ve yanıtın telefonun kendi işlemcisiyle üretilmesi anlamına gelir. Bulut tabanlı asistanlarda ise yazdığınız metin bir sunucuya gider, yanıt orada üretilir ve size geri gönderilir.
Aradaki fark yalnızca teknik değil. Yerel çalışan bir modelde yazdığınız istem (prompt) cihazın dışına çıkmaz, internet bağlantısı olmadan da yanıt alırsınız ve kota, abonelik ya da kredi sınırı diye bir şey yoktur. Karşılığında ise bulut modellerinin devasa bilgi birikiminden ve akıl yürütme gücünden bir miktar feragat edersiniz.
| Karşılaştırma | Bulut tabanlı yapay zeka | Cihaz üzerinde (yerel) yapay zeka |
|---|---|---|
| Verinin gittiği yer | Şirketin sunucuları | Telefonun kendisi |
| İnternet ihtiyacı | Zorunlu | Yalnızca modeli indirirken |
| Maliyet | Abonelik veya kullanım kotası | Ücretsiz (bir kez indirilir) |
| Yanıt kalitesi | Çok yüksek, geniş bilgi | Basit görevlerde yeterli |
| Hızı belirleyen | Bağlantı ve sunucu yükü | Telefonun çipi ve belleği |

Pratikte iki ayrı yol vardır: telefonunuzda zaten kurulu gelen sistem modelleri ve sizin indirip çalıştırdığınız açık kaynaklı modeller. İkisini de aşağıda ayrı ayrı inceleyeceğiz.
Telefonda Çevrimdışı Çalışan Yapay Zeka Uygulamaları Neden Tercih Ediliyor?
Cihaz üzerinde yapay zeka çalıştırmanın en görünür kazancı gizliliktir. Notlarınızı özetlettiğinizde, bir e-postayı yeniden yazdırdığınızda ya da sağlıkla ilgili bir metni sadeleştirdiğinizde bu içerik hiçbir sunucuya ulaşmaz.
- Veri gizliliği: İstem ve yanıt cihazda kalır, üçüncü tarafla paylaşılmaz.
- Çevrimdışı erişim: Uçakta, metroda, çekim olmayan bir kasabada da çalışır.
- Sıfır kullanım maliyeti: Mesaj başına ücret, aylık kota ya da hız kısıtı yoktur.
- Düşük gecikme: Kısa isteklerde yanıt neredeyse anında başlar.
- Kalıcılık: İndirdiğiniz model sizde kalır; servis kapansa da çalışmaya devam eder.
Gizlilik meselesini telefon genelinde ciddiye alıyorsanız, uygulama ve veri ayrıştırmayı anlattığımız Android Private Space (Özel Alan) nasıl kullanılır rehberimiz yerel yapay zekayla birlikte iyi bir ikili oluşturur.
Yerel Dil Modeli İçin Telefon Donanım Gereksinimleri
Bu işte belirleyici bileşen bellektir. Model dosyası çalışırken bütünüyle RAM’e yüklenir; yani telefonunuzun boş belleği, çalıştırabileceğiniz modelin üst sınırını belirler. Genel kural olarak son dört beş yılın 6 GB RAM’li bir telefonu işe yarar bir başlangıç noktasıdır.
| Telefon belleği | Rahat çalışan model | Tipik dosya boyutu | Beklenebilecek deneyim |
|---|---|---|---|
| 6 GB | 1–2 milyar parametre | ~0,7–1,5 GB | Kısa özet, basit soru-cevap, çeviri |
| 8 GB | 2–3 milyar parametre | ~1,5–2 GB | Günlük sohbet, taslak yazma, not düzenleme |
| 12 GB ve üzeri | 3–4 milyar parametre | ~2–3 GB | Uzun metin, daha tutarlı akıl yürütme |
Tablodaki değerler rahat çalışan boyutları gösterir, teknik üst sınırı değil. 12 GB bellekli bir telefona 7–8 milyar parametrelik bir model de yüklenebilir; ancak bu boyutta hız saniyede 5–10 token bandına iner ve cihaz belirgin biçimde ısınır. Yani “sığması” ile “keyifli kullanılması” aynı şey değildir.
Bellek dışında üç şeye daha bakmak gerekir. Birincisi boş depolama: modeller gigabaytlarla ölçülür ve birden fazla model denemek isterseniz alan hızla tükenir. İkincisi çip kuşağı; yeni nesil işlemcilerdeki NPU (sinirsel işlem birimi) desteği, aynı modeli belirgin biçimde hızlandırır. Üçüncüsü ısı yönetimi: ince ve pasif soğutmalı bir telefon, uzun yanıtlarda performansı düşürerek kendini korur.
Hız beklentinizi de baştan ayarlamakta fayda var. Modern bir telefonda 1–2 milyar parametrelik bir model saniyede kabaca 25 ila 50 token (kelime parçası) üretir. Model büyüdükçe bu hız düşer; 7 milyar parametre bandında 10 token/sn civarına kadar iner. Yine de metin, okunabilir bir tempoda ekrana akar; masaüstü hızlarını beklemeyin.
Telefonda Yerel Model Çalıştırmanın İki Yolu
Telefonunuzda Hazır Gelen Cihaz Üstü Modeller
Yeni telefonların önemli bir kısmı kutudan cihaz üstü bir modelle çıkar. Android tarafında bu iş, sistem servisi AICore üzerinde çalışan Gemini Nano ile yürür; özetleme, metin düzeltme, yeniden yazma ve görsel açıklama gibi işlevler ağ bağlantısı olmadan üretilir. Google’ın Gemini Nano geliştirici dokümantasyonu, isteklerin izole işlendiğini ve işlem sonrası saklanmadığını belirtiyor.
iPhone tarafında karşılığı Apple Intelligence’tır. Apple, sistemin merkezindeki cihaz üstü modeli Foundation Models çatısıyla uygulama geliştiricilerine de açtı; böylece üçüncü taraf uygulamalar çevrimdışı ve ücretsiz biçimde bu modeli kullanabiliyor. Özellik seti, Apple Intelligence destekleyen modellerle (iPhone 15 Pro ve sonrası) sınırlıdır.
Buradaki cihaz üstü model tek bir boyut değil; telefonun gücüne göre değişen bir banttır. Apple’ın 8 Haziran 2026’da duyurduğu üçüncü nesil modellere göre temel cihaz üstü model 3 milyar parametrelik AFM 3 Core’dur. 12 GB bellekli en yeni üst seviye cihazlarda (iPhone 17 Pro, iPhone 17 Pro Max ve iPhone Air) ise 20 milyar parametrelik AFM 3 Core Advanced devreye girer. İkincisi seyrek (sparse) mimari kullanır: modelin tamamı flash bellekte durur, her istekte yalnızca 1–4 milyar parametre etkinleşir. Bu, telefon belleğine sığmayacak bir modeli sığdırmanın pratik bir yoludur.
Bu yolun avantajı kurulum gerektirmemesidir. Dezavantajı ise seçim özgürlüğünün olmaması: hangi modelin çalıştığına, neyi yapıp neyi reddedeceğine üretici karar verir.
Kendi Modelinizi İndirip Çalıştıran Uygulamalar
Asıl esneklik, açık kaynaklı modelleri kendiniz yüklediğinizde başlar. Bu alanda üç uygulama kategorisi öne çıkıyor:
- GGUF tabanlı sohbet uygulamaları: llama.cpp motorunu telefona taşırlar. PocketPal AI bunun tipik örneğidir: MIT lisanslı, hem iOS hem Android’de çalışır, modelleri doğrudan Hugging Face’ten indirir ve CPU, GPU ya da NPU hızlandırmasını kullanabilir.
- Üretici destekli deneme uygulamaları: Google’ın açık kaynaklı AI Edge Gallery uygulaması LiteRT çalışma zamanıyla model indirmenize, kendi modelinizi yüklemenize ve cihazınızda kıyaslama (benchmark) yapmanıza izin verir.
- Güç kullanıcı yolu: Termux gibi bir terminal ortamına Ollama kurup modelleri komut satırından yönetmek. Mantığı bilgisayardakiyle aynıdır; nasıl işlediğini Ollama nasıl kullanılır rehberimizde ayrıntılı anlattık.

Yeni başlıyorsanız ilk kategoriden gitmenizi öneririz. Kurulumu bir uygulama mağazasından indirme kadar basittir ve model değiştirmek birkaç dokunuş sürer.
Telefona Yapay Zeka Modeli Nasıl İndirilir? Adım Adım Kurulum
Uygulamalar farklı görünse de kurulum mantığı hemen hemen aynıdır. Aşağıdaki sıra, hangi uygulamayı seçerseniz seçin geçerlidir.
- Boş alan ve bellek kontrolü: En az 3–4 GB boş depolama açın, arka planda çalışan ağır uygulamaları kapatın.
- Uygulamayı kurun: Yerel model çalıştıran uygulamayı Google Play, App Store ya da geliştiricinin resmi deposundan indirin.
- Model kataloğunu açın: Uygulama içindeki model listesinde parametre sayısı ve dosya boyutu yazar. Telefonunuza uygun olanı seçin.
- Modeli indirin: Bu adım internet gerektirir ve dosya boyutuna göre birkaç dakika sürebilir. Wi-Fi kullanın.
- Modeli belleğe yükleyin: İlk yükleme birkaç saniye sürer; uygulama bağlam uzunluğu ve iş parçacığı sayısı gibi ayarları burada sunar.
- Çevrimdışı test edin: Uçak modunu açın ve bir soru sorun. Yanıt geliyorsa kurulum tamamdır.

İlk denemede yanıt çok yavaşsa ya da uygulama kapanıyorsa suçlu genellikle modeldir, telefon değil. Bir alt boyuta inmek (örneğin 7 milyar parametreden 3 milyara) çoğu sorunu çözer. Bağlam uzunluğunu düşürmek de bellek baskısını hemen azaltır.

Doğru Modeli Seçmek: Parametre Sayısı ve Niceleme
Model adlarındaki 1B, 3B, 7B gibi ifadeler parametre sayısını, yani modelin büyüklüğünü gösterir. Telefonlarda pratik aralık 1 ile 8 milyar parametre arasıdır. Gemma, Qwen, Phi ve Llama ailelerinin küçük sürümleri bu iş için tasarlanmıştır; sohbet için “instruct” ya da “it” etiketli sürümleri seçin.
İkinci belirleyici kavram nicelemedir (quantization). Niceleme, model ağırlıklarını daha az bitle saklayarak dosyayı küçültür ve belleğe sığdırır. Telefon için yaygın tercih 4 bitlik varyantlardır; boyut ile kalite arasındaki dengeyi en iyi bu seviye kurar. Bu dosyalar genellikle GGUF biçiminde dağıtılır; llama.cpp geliştiricisinin ortaya koyduğu bu format, modeli tek dosyada ve hızlı yüklenecek şekilde paketler.
- Q8: Kaliteye en yakın, ama telefon için fazla büyük.
- Q5: Bol bellekli cihazlarda iyi bir orta yol.
- Q4: Telefonların standardı; boyut ve kalite dengesi en makul seviyede.
- Q2–Q3: Yalnızca zorunlu kalınca; yanıt kalitesi belirgin biçimde düşer.
Hangi model ailesinin ne işte iyi olduğunu karşılaştırmalı görmek isterseniz, yerel (local) AI modelleri nelerdir yazımız bu seçimi kolaylaştırıyor.

Sınırlar: Pil Tüketimi, Isınma ve Doğruluk
Yerel model çalıştırmak bedelsiz değildir. Metin üretimi işlemciyi tam kapasiteye çıkarır; bu da telefonun ısınması ve pilin hızla erimesi demektir. Uzun bir yanıtın maliyeti, birkaç dakikalık yoğun oyun oynamaya benzer.
- Pil: Uzun sohbetlerde şarj gözle görülür şekilde düşer; ağır kullanımda cihazı prize takmak mantıklıdır.
- Isınma: Telefon ısındıkça hız düşer, yanıtlar yavaşlar.
- Doğruluk: Küçük modeller daha sık hata üretir. Tarih, sayı ve isim gibi bilgileri mutlaka doğrulayın.
- Bağlam sınırı: Çok uzun metinleri tek seferde işleyemez; belge özetlemede parça parça ilerleyin.
- Güncellik: Model eğitim verisiyle sınırlıdır; internetten yeni bilgi getiremez.
Bu yüzden yerel modeli bulut asistanının yerine değil, yanına koymak en verimli yaklaşımdır. Kişisel notlar, taslak metin, çeviri, özet ve beyin fırtınası gibi işler cihazda; derin araştırma ve güncel bilgi gerektiren işler ise bulutta iyi sonuç verir.
Sonuç: Cebinizdeki Modelden En İyi Verimi Almak
Telefonda yerel yapay zeka modeli çalıştırma, artık meraklı kullanıcıların denemesi olmaktan çıkıp günlük bir alışkanlığa dönüşebilecek olgunluğa ulaştı. Doğru boyutta bir model, uygun bir uygulama ve gerçekçi bir beklentiyle on dakikada kurulabilen bu sistem; size internetsiz çalışan, kimseyle veri paylaşmayan ve hiçbir ücret istemeyen bir asistan kazandırır.
Başlangıç için önerimiz nettir: telefonunuzun belleğine uygun en küçük modelle başlayın, alıştıkça büyütün. Eğer bu tarz yapay zeka içerikleri ilginizi çekiyorsa, sitemizde yer alan Yapay Zeka Tarayıcılarını Güvenli Kullanma Rehberi adlı yazımıza da göz atabilirsiniz.
