İnsanlar tarafından talimat verildiğinde robotlar fiziksel hareketlerini Python’da programlayabilir. Google’ın büyük dil modellerinden (LLM’ler) yararlanmaya yönelik yenilikçi yöntemi, insanlardan gelen talimatlar temelinde, robotların kendi kodlarını nasıl geliştirebileceklerini gösterir.
En son araştırmalar, robotların açık uçlu insan komutlarını kavramasını ve fiziksel bir ortamda mantıklı ve güvenli bir şekilde tepki vermesini sağlayan Google’ın PaLM-SayCan paradigmasını genişletiyor. Ayrıca GitHub’ın Copilot işlevi ve OpenAI’nin GPT-3 LLM’si gibi otomatik kod tamamlamadaki önceki çalışmaları da temel alıyor.
Google araştırmacıları, “Ya robotlar, insanlardan talimat verildiğinde dünyayla etkileşim kurmak için bağımsız olarak kendi kodlarını oluşturabilseydi?” Sorusunu sordu. Google’a göre, PaLM gibi en yeni dil modelleri karmaşık bir şekilde akıl yürütebilir ve milyonlarca kod satırı üzerinde eğitilmiştir. Mevcut dil modellerinin, doğal dil komutları verildiğinde genel kodun yanı sıra robot eylemlerini kontrol edebilen kod üretmede çok iyi olduğunu anlaşılmıştır.
Google Research’ün “Code as Policies” projesi, kod yazma LLM’lerinin, doğal dilde verilen siparişlere yanıt olarak robot politika kodu üretmek için yeniden kullanılabileceğini iddia ediyor.
Google araştırmacıları, “Politika Olarak Kodlama: Somut Kontrol için Dil Modeli Programları” başlıklı yakın tarihli bir makalede, girdi olarak verildiğinde birkaç örnek dil komutunun ardından ilgili politika kodunun geldiğini belirtiyor.
LLM’ler sırasıyla yeni komutlar alabilir ve yeni politika kodu oluşturmak için API çağrılarını bağımsız olarak yeniden oluşturabilir.
Kullanıcı, verilen örneklerde “blokları boş kaseye istifle” veya “blokları yukarıya yakın yatay bir çizgide yerleştirin” talimatını verir.
Python kodu daha sonra robota sözlü komutlara uymayı öğretmek için Google’ın dil modeli programları tarafından doğru bir şekilde yazılır. Bu durumda, mekansal-geometrik akıl yürütme için Shapely gibi kitaplıkları kullanır ve aynı zamanda Python programlama dilinin organizasyon ilkelerine de dayanır.
Google, dil modellerinin bu işi, robot görevlerini doğrudan öğrenmekten ve doğal dil eylemleri üretmekten daha etkili bir şekilde gerçekleştirebileceğini iddia ediyor.
Google Research’e göre “CaP, dil modellerinin genel amaçlı Python kodunun tam ifadesi ile giderek daha zor robotik görevleri yürütmesine izin vererek, daha önceki çalışmamız PaLM-SayCan’ı genişletiyor.
Birkaç adımlı yönlendirme ve dil modelleri aracılığıyla, doğrudan robot kodu yazmak için bir yöntem olarak CaP’yi öneriyoruz.”
Google, modellerin yeni talimatlara genelleme yapmanın yanı sıra “daha hızlı” veya “sola” gibi belirsiz tanımlayıcılara dayalı olarak hızlar gibi kesin değerleri çevirebileceğini iddia ediyor. CaP ayrıca İngilizce dışındaki dillerde emojilere ve talimatlara izin verir.
Model, robota çeşitli renkli blokları 2B karenin üstüne itmesini söyleyen bir kod oluşturabilir, ancak 3B referansları olmadığı için “bloklarla bir ev inşa et” gibi daha karmaşık komutları yorumlayamaz.
CaP, robot esnekliğini artırır, ancak aynı zamanda “sentezlenmiş programlar (çalışma zamanı başına açıkça doğrulanmadıkça) fiziksel donanımla istenmeyen davranışlara neden olabileceğinden olası tehlikeleri de artırır”, belge bir uyarıda ekliyor.
Kaynak: zdnet

