bugün üzerinde çalıştığım bir projede evdne çalışmak durumundaydım; ama dökümanlar office'in yeni formatı docx formatındaydı ve openoffice açamıyordu bunları. biraz kurcalayınca, aslında bu dosyaların .zip şeklinde rename edildiğinde içinde çeşitli xml'leri barındıran bir paket olduğunu gördüm. bu xml'lerden word/document.xml ise word dosyasının içeriğini içeriyordu. ama elbette m$, garip bi şekilde 500 byte'lık text içeriği döşediği yüzlerce xml tag ile 15000 byte'lara vardırmayı başarmış. editplus'ın strip html tags özelliği ile tüm bu tag'leri atarak temiz şekilde content'e ulaşmayı başardım.
özellikle .docx uzantılı dosyaların içeriğini database'e eklemek isteyenlere duyurulur...
docx uzantısı