f86112d6758298241ab2fa84ad4f0f7b1ace35c6 d1bc743c10080fed1253686ce01749b42611ded4 2026-05-29T16:40:38+08:00 wangbomeng add dump_pos,fix pos_tensor of pre_by_embeds f131bf1908b8c5dd1f49d7ae7f616506fc471666 33d96dae28e17208ef61a71dba40cda3c04f135a 2026-05-27T09:38:51+08:00 wangbomeng fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE a43741244a646d3f8fa3ff01bb9b7d059223d0a5 b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 2026-05-15T14:39:53+08:00 wangbomeng run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl 3b14ed556c15529fe1f94b649f49db7156dfaf67 dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-14T14:34:25+08:00 Yunzhe Jia - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features. b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 7800c772d44a7415640ec1669a691232939927cf 2026-05-13T15:24:24+08:00 wangbomeng try passkey and embedding 7800c772d44a7415640ec1669a691232939927cf dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-13T15:23:54+08:00 wangbomeng try passkey and embedding dde8b8228081769c8d8f1e0751d47fa7875f8423 fabcc7dac4b34d83fe430980bb364b81087c7ee9 2026-05-12T10:46:08+08:00 wangbomeng clip:add minicpm patch; 5eb46fffbd2e260c540fb112314ad67bbb8f56b6 005112c51e00d998b457337ca3dad53fc46e2d0b 2026-04-24T16:24:51+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32 005112c51e00d998b457337ca3dad53fc46e2d0b 509670642e8090a1713f5d73590b549be827aaef 2026-04-24T16:24:31+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32 e24f775ee26ea5249d5ff6cd23b8a0a17fe1438d a206460e610aef995e36e50b33e8bd41fe477541 2026-04-15T10:01:09+08:00 wangbomeng calrt: add copy_data_to_ibuf for vision model a206460e610aef995e36e50b33e8bd41fe477541 d8b2aaa00049978cebac15041f960d75b552f97b 2026-04-14T10:23:43+08:00 wangbomeng calrt: support mixture of prefill_by_ids and prefill_by_embeds 6dacdd2cf9574214ca272a86674e7bd7ba21c4f0 3e6ad64467771224f072e5bad90e270951ba4cdf 2026-03-23T14:42:28+08:00 wangbomeng calrt: add multimodal 3e6ad64467771224f072e5bad90e270951ba4cdf b37b7d9756feb3dac2db526eeab38b572a095d47 2026-03-23T14:36:41+08:00 wangbomeng calrt: add multimodal d81d7b190ff5f21325167936496dfe5ab48b922e e492f5dc8cec17529f53ef2bbdf7b502107f8148 1f5accb8d0056e6099cd5b772b1cb787dd590a13 2025-11-04T14:43:32+08:00 Yunzhe Jia Merge branch 'master' into dev 070ff4d5356083d60b807bb34d36b31c3653a29e bf7b0c9725ed0c406c5debaea022ec7258430634 2025-11-03T11:11:18+01:00 Xuan-Son Nguyen mtmd: add --image-min/max-tokens (#16921) bf7b0c9725ed0c406c5debaea022ec7258430634 fcfce040e816c542f374ad51461b3561d73c4bc9 2025-11-03T10:25:55+01:00 Xuan-Son Nguyen mtmd: pad mask for qwen2.5vl (#16954) bcfa87622ae46be6345a8e3dfdbdc5ba5414042b a2054e3a8ff0da3978a4acc18c349ff58554d336 2025-11-03T00:41:08+01:00 Sascha Rogmann feat(webui): improve LaTeX rendering with currency detection (#16508) 6b9a52422bac0f50dd8f1f8386744fa3ce9783bf 2f966b8ed87514e74bb96592217226cb6a6974dd 2025-11-02T13:08:04-08:00 Zhiyong Wang model: add Janus Pro for image understanding (#16906) 2f966b8ed87514e74bb96592217226cb6a6974dd cd5e3b57541ecc52421130742f4d89acbcf77cd4 2025-11-02T22:21:48+02:00 Georgi Gerganov clip : use FA (#16837) cf659bbb8ef9eb048e5153a27cf787fd83c05560 d8b860a219c2415faac8cc0e50b48b4aa11e3b64 2025-11-01T15:51:36+01:00 Xuan-Son Nguyen mtmd: refactor preprocessing + support max/min pixels (#16878) d261223d24e97f2df50220e4a5b7f0adb69bba81 dcca0d3ab840ebe9b2ccd4719033d408eeb758d7 2025-10-30T23:19:14+08:00 JJJYmmm model: add support for qwen3vl series (#16780) bacddc049a00786df44e682262f6e298742bfbc3 229bf686287d18f82c44e89888cc662145ecfdb4 2025-10-30T07:18:50-04:00 Tianyue-Zhao model: Add support for CogVLM model (#15002) 144a4ce824b6bd0e48d62009d10cae1daf5308db f549b0007dbdd683215820f7229ce180a12b191d 2025-10-29T14:09:50+01:00 Sigbjørn Skjæret vendor : sync minja (#16500) 1c1409e13169d0ced4b1b4d39fb5b268b7525091 7a0e900e3615fa46c074a7fdf900b47d3c0a1c7e 2025-10-28T03:51:41-07:00 Sam Malayek embedding: add raw option for --embd-output-format (#16541) 10640e31aab0819f31c1e1f2d008b019ee737232 80d28f104c0c3e61c11d6af073642b246a9fc19c 2025-10-27T21:50:22+01:00 Acly ggml : fix interpolate with align-corners and ne=1 (#16700) 06332e28672356b964d6dfc2ba4657e20581cd43 72d53e6c4decee8b339e49aed8cc0e234b9639dc 2025-10-20T16:27:09+08:00 takuya kodama llama-batch: fix build fails with `-Werror=missing-braces` (#16614) 7062dd8460685d6700ed7621e50a22c6f3400ca3 0398752dd450dfabdd1b9e289f6364c2600f6ab5 2025-10-20T15:44:21+08:00 takuya kodama llama-context: only warn on pooling_type when user specified (#16674) 0398752dd450dfabdd1b9e289f6364c2600f6ab5 4f73d0a95120687e2c527739f771330a5271259a 2025-10-19T23:54:31+02:00 Giuseppe Scrivano model : add Granite Hybrid types (#16635) e38b7c6e9e4453e3b3e96d76e38bc2ccb6bce458 5016b7286240d29f8f640039989b84ea3a854344 2025-10-13T22:42:37+03:00 Georgi Gerganov graph : support cacheless embeddings with FA and iSWA (#16528) 4b2dae383df708e2afc49c4859a81cd074f5ac10 41aac5c69b5fb281bc1f486afb053f78101bb39e 2025-10-12T09:29:13+03:00 Georgi Gerganov common : update presets (#16504) e60f01d941bc5b7fae62dd57fee4cec76ec0ea6e 81086cd6a3ca1252f0dc0f938171648399179c53 2025-10-10T22:15:05+03:00 Georgi Gerganov server : fix division by zero when reporting stats (#16501) 56b4795842d852152222ca7a2d4304008facf1b9 2c0d875ae6c6043fbbafd2831e160955e9ca6af1 2025-10-09T14:35:22+02:00 Daniel Bevenius model-conversion : add support for SentenceTransformers (#16387) e08db4259521de493b7aeb49dadf29ebd1ee966a 12bbc3fa50b6df03318a4451c9a2210200a0b28d 2025-10-09T08:39:18+02:00 Saba Fallah model: EmbeddingGemma Adding Support for SentenceTransformers Dense Modules (#16367) b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e 7fdd16b432d247121fe5fe7b21f8805f85266c85 2025-10-08T10:57:53+03:00 Georgi Gerganov metal : mark FA blocks (#16372) 74b8fc17f92ada295a648e3c5eb28f46bca7d892 aeaf8a36f06b5810f5ae4bbefe26edb33925cf5e 2025-10-07T13:48:56-07:00 Reese Levine ggml webgpu: profiling, CI updates, reworking of command submission (#16452) ef4c5b87ea2556ff8ca99cca3abdf48bdbca22f2 c61ae20d05bd4fdd8551311325a2845336449426 2025-10-07T10:32:32+03:00 Georgi Gerganov presets : fix pooling param for embedding models (#16455) 1d6092fc72f4d10f4486ac95edfd414bc08b62b8 8ae32dc9ecd7aeebf3a5b43557e0552a0a04cd4f 2025-10-07T08:22:35+03:00 Georgi Gerganov tests : add -INF blocks to the KQ mask in the FA tests (#16380) c08002a1988348403a5fd59b1fa3de3a10a6f92f 3a002afafa8e06555f11aed88b02d055d8a166f3 2025-10-06T10:59:40-06:00 Gabe Goodhart chat : Granite Docling stopping (#16438) ca71fb9b368e3db96e028f80c4c9df6b6b370edd 35266573b968e1c947b367782fb4b3eddbb4f3c0 2025-10-05T06:57:47-06:00 Gabe Goodhart model : Granite docling + Idefics3 preprocessing (SmolVLM) (#16206) e29acf74fea996014380d59d31aa504ae8964258 128d522c04286e019666bd6ee4d18e3fbf8772e2 2025-10-04T11:42:56+02:00 Acly vulkan : incremental shader builds (#16341) ad126479c25cf983a0f994a08ba0911cf49ed62b 77233277c912d495d1069543ca540c21a2f9e5b4 2025-10-03T11:45:16+02:00 Daniel Bevenius ci : change macos-13 to macos-15-intel (#16401) e74c92e84236b2bab3f3c77bee4ead94928be360 b2ba81dbe07b6dbea9c96b13346c66973dede32c 2025-09-30T16:24:36-04:00 Bartowski model : support GLM 4.6 (make a few NextN/MTP tensors not required) (#16359) 0124ac989f7e7bf08803788f66dbe4106bdcdd58 2811c65286ae954bec87049f75b86dc022006dcc 2025-09-28T19:25:58+08:00 Aaron Teo devops: switch to using ubuntu-22.04-s390x image (#16302) 72b24d96c6888c609d562779a23787304ae4609c 624207e676ab5eb3ce7af631902bb45fb73a8359 2025-09-27T02:58:29+05:30 Vinkal model : make minicpm embedding_scale, residual_scale and logit_scale optional with legacy defaults (#16273) 624207e676ab5eb3ce7af631902bb45fb73a8359 807e8c6d310952f2f5656afc63dab9d7083dcb5c 2025-09-27T02:03:33+08:00 Aaron Teo devops: add s390x & ppc64le CI (#15925) 00217cd41388328c93e9e9644921c4319bb03bcc 3b337b01a1a85c2f5b49376e8c0bbdb3f521528e 2025-09-26T13:19:23+03:00 Radoslav Gerganov ci : create git tags for released docker images (#16008) aa3ee0eb0b80efca126cedf9bcb4fb5864b46ce3 d0991da39d3c39b3980c24cdfccb9a4c95a46870 2025-09-25T12:02:36+02:00 Daniel Bevenius model-conversion : add embedding prompt file support (#15871) 4b9f4cb0f89a88de4bdf97727d0457b0c648804c 85e72271ba1ce78adf34fd8997803c991e617ca6 2025-09-23T13:59:34+08:00 Aaron Teo devops: add s390x containers (#15915) c6db9a10278f40b4b8d3f6931728f2cce2356daa d05affbab7d1364fa7ac06c03cd33f03235ae840 2025-09-22T10:49:58+02:00 GideonSerf embedding : fix typos in README (#16171) 3913f8730ec6d6245480affc30ae3049107956f4 76888d202ed2b835ae19ea9f9db6baf39e419297 2025-09-16T15:25:57+02:00 Daniel Bevenius ggml : fix padding in timestep embedding kernels (#15932) dc381aa9a6dc45f00673471d34b8bddd30e77570 10d197409bd9537ff302ad09966fe406882fef9d 2025-09-15T14:38:52-07:00 Diego Devesa docker : enable rocWMMA in ROCm images, add gfx1151 (#15997) b8e09f08b9a91c0401bc67d17a17c90756420346 6c019cb04e86e2dacfe62ce7666c64e9717dde1f 2025-09-14T23:00:59+02:00 Sigbjørn Skjæret model : add grok-2 support (#15539) 9de447d94e1ae9d1a36e5a2e5bf47483352c0d9c 0f0a3c2851134d49955f3c85afbb0b1bb47c3e07 2025-09-10T17:31:40+02:00 Daniel Bevenius ggml-cpu : fix padding in ggml_timestep_embedding (#15917) e7b6d83b524bbc24a1343d862de6dba8e8eddbd6 2cfef4d117d67ab1dec002915b48a15d11ee1973 2025-09-10T14:17:09+02:00 Daniel Bevenius tests : filter out no-ops from coverage report (#15900) 70cd37dbbebdb7a2f84f08207f18eabb0b291a55 acc1b008cfd95e63d5f99a370dbffb98e5a99d2c 2025-09-09T06:06:52+02:00 Daniel Bevenius requirements : update transformers/torch for Embedding Gemma (#15828) 233d773d02c37982badddf3994e9953a175f34da a885dcff11a7b73f9377812d6151f6b15d307de0 2025-09-08T09:44:34+02:00 Daniel Bevenius convert : force setting sliding_window from original config (#15867) 5d6688de08e73acc2532d668380801ed79d704eb 4fd1242bef6cb2325b4ff1c1a80f3b54b64508a6 2025-09-05T04:36:23+02:00 Daniel Bevenius model-conversion : add --embeddings flag to modelcard.template [no ci] (#15801) fb15d649ed14ab447eeab911e0c9d21e35fb243e 856ed0947f27b4ec3ad269fceda0402fbab263d3 2025-09-04T18:10:29+02:00 Daniel Bevenius llama : add support for EmbeddingGemma 300m (#15798) d1e2adba65208d6de3d7f6f23b00c562ff5bb777 c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 2025-09-04T15:40:44+02:00 Daniel Bevenius llama : set n_outputs to 1 to avoid 0 outputs mean-pooling (#15791) 661ae31c9c68201577e70278285b349a5a662caf 407c23786dd0d3a503e9429eead96e611d3950c9 2025-09-03T19:59:16+02:00 Oliver Simons CUDA: Optimize `rms_norm_f32` kernel and its fused variants, giving 1-6% perf E2E (#15715) 40a751ea9a94364da73537b86502a808ebe1fc3a 5eae9348835037046f33fafd852df7c952c95209 2025-09-03T12:50:47+02:00 Daniel Bevenius model-conversion : remove hardcoded /bin/bash shebangs [no ci] (#15765) 8c3fdf44ecf08335942f2ba558955f55e88c7991 f6da8cb86a28f0319b40d9d2a957a26a7d875f8c 2025-09-03T09:48:35+02:00 Daniel Bevenius model-conversion : add missing curl script [no ci] (#15761) 84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 55042b3692cb1467c9ee15c62c4a9fbf180f89e3 2025-08-28T15:49:50+02:00 Sigbjørn Skjæret model : jina-embeddings-v3 support (#13693) 46d9caa27a0281150e8cf082308c0f9e7576ebe5 5a0e3ef6f00c658fbae53797f02d5a360ebf8fec 2025-08-28T09:26:48+02:00 Daniel Bevenius model-conversion : add mmproj conversion target (#15628) 62cef26ac5b6b7acb635d3dc963813b43952dc2b 8f5afa94c4f929da71f560db7c9f38ef6a783d95 2025-08-26T16:12:29+02:00 Daniel Bevenius model-conversion : add qat-q4 quantization targets (#15588) 79a546220c719e6a70627b243a478ab8d84dc9e1 85cc1ae998e4898d9fa992cb9b8620338cee97bf 2025-08-26T12:54:19+02:00 Xuan-Son Nguyen mtmd : support Kimi VL model (#15458) c4e9239064a564de7b94ee2b401ae907235a8fca 39842a7f73012eb42816ca4f26411782bd3da7c5 2025-08-26T16:05:55+08:00 tc-mb model : support MiniCPM-V 4.5 (#15575) dfd9b5f6c7586c88588f06a644c131bec071a0a1 5a6bc6b1a6cb665a944426c2055794950e524bf5 2025-08-25T15:00:43+02:00 Daniel Bevenius model-conversion : set pooling type to none in logits.cpp (#15564) 5a6bc6b1a6cb665a944426c2055794950e524bf5 6b64f74b55628e4193f4fb00313f07dbd8556528 2025-08-25T14:25:25+02:00 Daniel Bevenius model-conversion : add model card template for embeddings [no ci] (#15557) 330c3d2d21b55bca5517db7d2eea2ea8f131df4a e92734d51bcb82cc35f0a6b5a14928f0036b2c90 2025-08-23T01:31:54-05:00 Jeff Bolz vulkan: optimize mul_mat_id loading row ids into shared memory (#15427) 4afb0a746f22abaa545b3ebdb76a400d7da3a713 e288693669cf9d0a71e2f2b8bd57305f06340257 2025-08-22T08:10:14Z 65a server : Support multimodal completion and embeddings prompts in JSON format (#15108) e288693669cf9d0a71e2f2b8bd57305f06340257 a0f98dd604d34826eb5ea2560d1e23fe726921df 2025-08-22T09:29:08+02:00 Tarek Dakhran readme : model : mtdm : lfm2 improvements (#15476) 2758fa10dab0556e6c3f130e664750fd6773dc7c b108e429043ee5c9fc8fa4957a0a52c3e490d5c9 2025-08-21T12:16:54+02:00 Daniel Bevenius examples : add model conversion tool/example (#15455) b108e429043ee5c9fc8fa4957a0a52c3e490d5c9 245be739df942861ddc52331b095b40f18e2a3f1 2025-08-21T05:06:46-05:00 Michael Giba ci : fix -Werror=return-type in clip.cpp so ci/run.sh can run without issue (#15221) f08c4c0d8d0cb6caaf8b7ad316039232b9fa059c 6d7f1117e3e3285d0c5c11b5ebb0439e27920082 2025-08-18T22:53:52+02:00 Xuan-Son Nguyen mtmd : clean up clip_n_output_tokens (#15391) f44f7931729022c57319a0124931120a169e0da9 ae532eac2c1df1d8edc3d2719145895b966de1bf 2025-08-18T03:23:56-04:00 compilade ggml-quants : fix make_qp_quants NANs and IQ1 assertion errors (#15379) 65349f26f2299e06477ec8e85e46243046801358 1fe00296f587dfca0957e006d146f5875b61e43d 2025-08-16T23:33:54+02:00 Tarek Dakhran model : support vision LiquidAI LFM2-VL family (#15347) cf9e5648a7ae02f7728fefcbcfd2979d83c96e8f fba5c0d680b555cbac563fef57b33bc5c9621e08 2025-08-11T22:12:12+08:00 rainred mtmd : Fix MinicpmV model converter and clip to avoid using hardcode. (#14750) 36d3f00e142696f708ab297b9f8f1c825594712d 5fd160bbd9d70b94b5b11b0001fd7f477005e4a0 2025-08-07T05:31:48+02:00 Daniel Bevenius requirements : fix PyTorch uint64 compatibility (#15134) ef0144c087b33e5b8da42d529ac71aaf05cb49df 2721257e3e2c4c944ac8a08221113ee7cb503f1b 2025-08-05T04:29:25+10:00 Sam model: support GLM 4.5 family of models (#14939) 711d5e6fe66eb6cd7a10d71cec4567321848be08 f738989dcb9ccbe468c945553eafbeef7b869675 2025-08-02T05:51:02-05:00 Douglas Hanley convert : fix Qwen3-Embedding pre-tokenizer hash (#15030) 339bd0268c498c89529cd0e90c44883c211e3745 f906275537d14c8fc7c6976d944233771fd6672c 2025-08-02T03:44:50-05:00 Douglas Hanley model : support Qwen3-Embedding (#15023) 952a47f455fbd92e2659b98b9b6317a2dafeb532 36e5fe7bcd6640f4ff974d4c5cb04a13b5b29bce 2025-07-31T23:22:17+08:00 tc-mb mtmd : support MiniCPM-V 4.0 (#14983) 41e78c567e9a8c652e405f4f909deb598deecd31 ad4a700117d1746799d2d6599e526e2c3a7938d2 2025-07-30T18:07:11+02:00 Daniel Bevenius server : add support for `embd_normalize` parameter (#14964) 00131d6eaf4df029e1ec84de868c2c5957503007 1e15bfd42c3938506e0da5939bf7f42780965f01 2025-07-30T15:12:02+03:00 Georgi Gerganov tests : update for LLAMA_SET_ROWS=1 (#14961) a118d80233d3bf92569c051346fd2638f87bf202 61550f8231dc0aa478e2f537c5009ede6878ce22 2025-07-30T00:25:05-05:00 Douglas Hanley embeddings: fix extraction of CLS pooling results (#14927) 749e0d27f0247337869f4698f59dd7fafba94326 64bf1c3744053cf7def10aeed21ff48883ee755b 2025-07-25T19:08:04+08:00 kiwi mtmd : fix 32-bit narrowing issue in export-lora and mtmd clip (#14503) 3f4fc97f1d745f1d5d3c853949503136d419e6de 2df255da3cea108de0ae9b302ffdd31674b6d88d 2025-07-25T03:05:37+08:00 R0CKSTAR musa: upgrade musa sdk to rc4.2.0 (#14498) 86f5623d904cfd392fdeb14a143097b4074660f6 39cffdf18855e0d2beba62572542251d87421e73 2025-07-24T17:50:51+08:00 yummy llama : fix MiniCPM inference after Granite Four changes (#14850) c8ade30036139e32108fee53d8b7164dbfda4bee e28c0b80c249b5618c3a0d5e960f63929f380ac9 2025-07-22T12:51:03+02:00 stduhpf Mtmd: add a way to select device for vision encoder (#14236) b526ad2668944a7b2b1721f60679153646313831 938b785764683c298e7805e712f8728489cc2f18 2025-07-20T23:55:32+07:00 rspOverflow Documentation: Further revisions to the Vulkan section in build.md (#14785) 21c021745d781edf9c44b4972ef6cbbf53b0ecff b0f0ecc3dce806c68609d375a2b3edc430d8db18 2025-07-16T08:18:51-07:00 Reese Levine ggml: Add initial WebGPU backend (#14521) 68e37a61a7b24863f67541db65b4f6195962a268 cbc68be51d88b1d5531643b926a4b359c3cff131 2025-07-16T01:11:42+09:00 Shunta Saito model : add PLaMo-2 support (#14560) 0c1df14b5f8d992805cb22d0b77b44092a18aeab b3ad3a0191994d6c47b2bd389d5c7431526ecd2c 2025-07-12T06:21:02-04:00 Douglas Hanley server : fix pooled embedding output (#14645) 0aedae00e6fb48680324a5ac5da9cba0e35de6b5 6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8 2025-07-10T18:20:13-06:00 Gabe Goodhart model : Granite Four (#13550) 4a5686da22057867c23bd4a6be941ddc8c51e585 98bab638fb28cf95a5a66dd2d51b40d6c8f6d69a 2025-07-09T14:59:57-04:00 compilade llama : support Jamba hybrid Transformer-Mamba models (#7531) 8f22dc0a53338c629c1ef8fa878d8e39bfe627c9 53903ae6fa5f1caf187889c839cdd1ad25da4018 2025-07-08T10:24:06+02:00 Xuan-Son Nguyen model : add hunyuan moe (#14425) e1a7059053a9b8958f2d57a21fc46dbc7fb24f8e 12f55c302b35cfe900b84c5fe67c262026af9c44 2025-07-07T23:35:35+02:00 Sigbjørn Skjæret llama : fix incorrect minicpm3 v_states shape (#14571) 1b2aaf28acd632b79bc3b07acb5dad877dc7dbb1 343b6e94b61674ac94e64ede7b7ea3365793f7ed 2025-07-01T15:44:11+02:00 Grzegorz Grasza Add Vulkan images to docker.md (#14472) c839a2da1a0d4275c3a98f70c3a7627487573a46 e9b6350e61d592634263a14b3d77ecbf6c1fb096 2025-06-30T17:48:24+08:00 xiaobing318 cmake : Remove redundant include path in CMakeLists.txt (#14452) 8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following: 5d5c066de8a3d2cb32f04c4d5ad1560945f30bf3 40bfa04c95c19fb42bafd4e21b5c2a7771846801 2025-06-22T21:44:57+09:00 yuiseki mtmd : fix Pixtral OOM with large images by capping image_size to 1024 (#14326) aa0ef5c578eef4c2adc7be1282f21bab5f3e8d26 bb16041caef45cd4348cd6f84906b5dfec7a1f6a 2025-06-21T18:12:05+02:00 Sigbjørn Skjæret gguf-py : fix Qwen3-Embedding eos token (#14314) edc4a29effe716956fdfd2bc5b9cba2a6d8492f8 ed3290ab34493fd3d2e0f925f816a401da4f2dfd 2025-06-19T00:08:14-05:00 Gabe Goodhart memory : Hybrid recurrent cache (#13979) 89fea80d298184d1cd93564f48e060d9f541f4b4 6adc3c3ebc029af058ac950a8e2a825fdf18ecc6 2025-06-16T22:33:27+03:00 Georgi Gerganov server : fix incorrect usage of llama_get_embeddings() (#14225) d3e64b9f490cee41b7b9aa275dae2f6568ae3054 3ba0d843c6bd3faea5cf5e53dc7f3c82be20bffb 2025-06-16T14:14:00+03:00 Georgi Gerganov llama : rework embeddings logic (#14208) 40643edb86eb10b471b0f57d4f3f7eb0e06a0df7 3cfbbdb44e08fd19429fed6cc85b982a91f0efd5 2025-06-13T17:32:56+01:00 Svetlozar Georgiev sycl: fix docker image (#14144) 26ff3685bfbaa4c8838d7afd988b17dd5eb99f92 60c666347becacff81cd4bc9a52038ba71038e41 2025-06-13T15:17:53+02:00 ddpasa docs : Update multimodal.md (#14122) 2c90da4c7ec694797f524042aaafbb047a7e65ff ec9e0301fef6476df83e94842c3b625501c95566 2025-05-30T16:31:48+08:00 zhangkaihuo llama : use llm_build_granite for minicpm (#13911) c962ae3382a1e759c8517a229549ee53685313a1 a3938fb53d0b5183db4f5a6db21fd9122a0e4780 2025-05-28T22:33:54+08:00 Sky server: fix remove 'image_url'/'input_audio' json-object effectlly for 'llama_params' in multimodal-model-mode (#13853) 26b79b6cb3e7840ff15729350e95907e19f9f480 1e8659e65ad0f640674d2785d02b556ab938728c 2025-05-28T10:05:54+02:00 Xuan-Son Nguyen convert : fix tensor naming conflict for llama 4 vision (#13836) bc583e3c63c04a11d287c108ea9e6a515ead0423 72b090da2c50e540143fd312a2f9aa5f151e6136 2025-05-27T14:06:10+02:00 Xuan-Son Nguyen mtmd : support Qwen 2.5 Omni (input audio+vision, no audio output) (#13784) 79c137f77677b3c8ee3c60a7da033721b938399a 22229314fc46b2f741bb21b12cde71f6c6a60b52 2025-05-26T14:03:54+03:00 Georgi Gerganov examples : allow extracting embeddings from decoder contexts (#13797) 40aaa8a403df5dcfb515eb2fd7a817fd99779526 a08c1d2845dc279d58d826ef3c3ecad97cbbcef7 2025-05-25T14:06:32+02:00 Xuan-Son Nguyen mtmd : add support for Qwen2-Audio and SeaLLM-Audio (#13760) a08c1d2845dc279d58d826ef3c3ecad97cbbcef7 d785f9c1fd1a1929c6d0e2a0b12cae5db867908b 2025-05-25T14:04:49+02:00 ddpasa docs : add Moondream2 pre-quantized link (#13745) 4032ca406632212b075e3c61c2a4476128321410 515fdbf7ed839dfe6a24aeb6225936609a7f6d6d 2025-05-25T10:29:43+02:00 Piotr Jasiukajtis llama : add support for Qwen3 MoE tied word embeddings (#13768) cc74d5be990e37f201591fd868a92e64abdbf902 5be24af73d77ea23d399726f1d2a01a70ee86331 2025-05-22T16:33:39+03:00 Georgi Gerganov server : pad small embedding batches (#13692) 92ecdcc06a4c405a415bcaa0cb772bc560aa23b1 f71f40a2847d4c9f57b86cd206e0a27b2bfb6d1c 2025-05-19T13:04:14+02:00 Xuan-Son Nguyen mtmd : add vision support for llama 4 (#13282) 3cc1f1f1d24472a6558c942b1c78989ff4b0e569 c753d7bed0dc2cc2d5c42dfa9806cba91748392e 2025-05-15T14:24:50+02:00 Xuan-Son Nguyen webui : handle PDF input (as text or image) + convert pasted long content to file (#13562) d486dd3e8ecfba0170f8632a1530540de560f4a3 21ca987fba504d273ea28ebc4d3e5b3736a11c8e 2025-05-14T10:07:31+02:00 Luca Stefani webui: Allow pasting file from clipboard (#13526) 21ca987fba504d273ea28ebc4d3e5b3736a11c8e be1d4a13db26750fac702ceb3af88ae4f39dc9f4 2025-05-14T09:59:12+02:00 ddpasa docs: Update link to ggml-org in multimodal.md (#13513) 71bdbdb58757d508557e6d8b387f666cdfb25c5e f0995d28ce3d15095b6845d94ce4465e46575873 2025-05-13T17:07:21+02:00 Xuan-Son Nguyen clip : clip.h become private API (⚠️ breaking change) (#13510) b4726345aca49e2ad62d615e6e370b3dbad6434f bf7937112058f2815fc3825a9ff7b536ecafa3bb 2025-05-13T15:33:58+02:00 Xuan-Son Nguyen mtmd : remove libllava, remove clip-quantize-cli (⚠️ breaking change) (#13460) de4c07f93783a1a96456a44dc16b9db538ee1618 10d2af0eaa0aafd7c6577b279dfa5221ff44a63f 2025-05-12T15:06:51+02:00 Xuan-Son Nguyen clip : cap max image size 1024 for qwen vl model (#13478) 3eac209319a6726fd9687c6188fc6b916b65953d a634d75d1bb4034b8c945042ceea268b5b895730 2025-05-11T11:35:52+02:00 City mtmd : support InternVL 3 38B and 78B mmproj (#13443) 15e6125a397f6086c1dfdf7584acdb7c730313dc 3b24d26c22b9d92b5aa39930988700c84e524cf4 2025-05-10T19:57:54+02:00 Xuan-Son Nguyen mtmd : add hard limit on image resolution for qwen2vl / qwen2.5vl (#13434) 33eff4024084d1f0c8441b79f7208a52fad79858 17512a94d636c4b6c1332370acb3e5af3ca70918 2025-05-09T19:29:37+02:00 Xuan-Son Nguyen server : vision support via libmtmd (#12898) d9c4accaff30926e8a5fd8a2429e549158a845e0 15e03282bb432631193464100c2237a3b6bcfe4c 2025-05-09T09:06:37+02:00 Xuan-Son Nguyen server : (webui) rename has_multimodal --> modalities (#13393) f05a6d71a0f3dbf0730b56a1abbad41c0f42e63d ee01d71e585f4a17ae83ec55d77acfdcf0bfa798 2025-05-08T14:25:39-04:00 Matt Clayton mtmd : Expose helper_decode_image_chunk (#13366) 8c83449cb780c201839653812681c3a4cf17feed 1a844be132dbe865358e1de81136920c1d35ac73 2025-05-08T15:37:29+02:00 Xuan-Son Nguyen server : (webui) revamp the input area, plus many small UI improvements (#13365) 6562e5a4d6c58326dcd79002ea396d4141f1b18e 51fb96b1ff2e1cc98b2492a012b7d93531a6a9a8 2025-05-08T14:28:33+03:00 Georgi Gerganov context : allow cache-less context for embeddings (#13108) 814f795e063c257f33b921eab4073484238a151a d879433824ac3c16b3b5f00075895d0ee9688e34 2025-05-07T16:36:33+02:00 Diego Devesa docker : disable arm64 and intel images (#13356) 6c7fd67b647a76846d1691cd181011dff4549d02 141a908a59bbc68ceae3bf090b850e33322a2ca9 2025-05-07T15:23:11+08:00 piDack llama : support tie embedding for chatglm models (#13328) 32916a49072f01c43e20df374af5f8a1f70d6963 ffc727203af1061fdeb49efef30f76171722e403 2025-05-06T22:40:24+02:00 Xuan-Son Nguyen clip : refactor graph builder (#13321) 5215b91e9377ce23e4ccc92ec3156bf5c7f892a3 ae803bfc3d0fc2d0d3e1cce22ee103a30939e104 2025-05-05T12:54:44+02:00 Xuan-Son Nguyen clip : fix confused naming ffn_up and ffn_down (#13290) 27aa2595321c4d9cc4086a8e67bdea204b8309b0 9fdfcdaeddd1ef57c6d041b89cd8fb7048a0f028 2025-05-04T23:43:42+02:00 Xuan-Son Nguyen mtmd : add C public API (#13184) 36667c8edcded08063ed51c7d57e9e086bbfc903 3bf785f3efa89ed28294fbf73054558a2b034bfb 2025-05-03T20:07:54+02:00 Xuan-Son Nguyen clip : revert the change of BOI/EOI token for GLM-edge (⚠️ breaking change) (#13259) 2f567611c0234bbca0a4009762acb47b56866095 7d2123484e6ba8fcd90fff8c01661b9dbbefdc9d 2025-05-02T11:42:30-04:00 Jared Van Bortel llama-model : support Qwen2 embedding models and pooling_mode_lasttoken (#13245) 7d2123484e6ba8fcd90fff8c01661b9dbbefdc9d 074e42ab31de4c99aa7d9d2d239660f64b2380d6 2025-05-02T11:41:54-04:00 Jared Van Bortel convert : use correct context length for nomic-embed-text-v2 (#13216) 074e42ab31de4c99aa7d9d2d239660f64b2380d6 c642bc014c105728ce45015813351dc5a37f60a2 2025-05-02T17:17:15+02:00 Xuan-Son Nguyen convert : converting mmproj for Qwen2/2.5VL from convert_hf_to_gguf (#13209) e84773ab604fe0d935d03741df003716398dc57b fab647e8842c5f80da7e8f2c625dab6a0e19e5d4 2025-05-02T14:20:27+06:00 Shakil Ahmed mtmd-cli : fix out_of_range when input image path is empty (#13244) b6e4ff69b8abd509647b531bd5b4e86950204f66 e0f572c8466e70d35cbd70ee536ad8fc83b2acac 2025-05-01T21:32:21+02:00 Loïc Carrère clip : (minicpmv) Re-enable upscaling of images smaller than the CLIP image size (#13237) b5769d92b4510c77691ad9e3f8b643c2ba202e53 8936784f7a1ec4f91637d04b77fdc90ec36ebac9 2025-04-29T15:47:55+02:00 Daniel Bevenius ggml : suppress Windows compiler warnings (whisper/3075) 8936784f7a1ec4f91637d04b77fdc90ec36ebac9 13c9a3319b65469e883c49dd1c478abedc410157 2025-05-01T17:05:42+02:00 Xuan-Son Nguyen mtmd : add **vision** support for Mistral Small 3.1 (#13231) a70183eb0079fdf6ebeaed12966338a039461b5d 8d33d740c308fe0049515668aac0e561269afe9e 2025-05-01T03:09:41-04:00 Jared Van Bortel llama-model : fix the reported size class for nomic-embed-text-v2-moe (#13223) 3e168bede4d27b35656ab8026015b87659ecbec2 ceda28ef8e310a8dee60bf275077a3eedae8e36c 2025-04-30T16:56:24+02:00 Xuan-Son Nguyen convert : improve model arch handling (#13122) 07c2e2f76cce9a61c110b6995fbb90ccea2c3aaa 44cd8d91ff2c9e4a0f2e3151f8d6f04c928e2571 2025-04-30T13:06:15+02:00 Xuan-Son Nguyen convert : correct typo image_mean --> image_std (#13208) 00e3e5a194e88e604e7c91391b9e90332888fd72 e98b3692be4cd8fbbd9a56fbacc2f2bf0bf26a68 2025-04-29T11:47:04+02:00 Xuan-Son Nguyen mtmd : add qwen2vl and qwen2.5vl (#13141) 5f5e39e1ba5dbea814e41f2a15e035d749a520bc eaea3253244dc4bbe07f6cd81325847ccc6cf93e 2025-04-28T15:52:15-04:00 AT model : Nomic Embed Text V2 with Mixture-of-Experts (MoE) architecture (#12466) eaea3253244dc4bbe07f6cd81325847ccc6cf93e 43ddab6eeeaab5a04fe5a364af0bafb0e4d35065 2025-04-28T21:23:19+02:00 Xuan-Son Nguyen clip : fix model size display (#13153) 5fa9e63be82225fb3249c76f39ddda3e5bdec0a3 a4c340f974f9b7ac0c1aae897aabaa54549a97e5 2025-04-28T12:18:59+02:00 Xuan-Son Nguyen clip : refactor set input for cgraph + fix qwen2.5vl input (#13136) 59e991c23cc44cb5fb657e7b9358cac21fb79828 ca2bb89eac2097ab4620448737e58af8452e444b 2025-04-27T18:43:37+08:00 LostRuins Concedo Fixes Qwen2.5VL segfault during inference with https://github.com/ggml-org/llama.cpp/pull/12402 as has_qwen2vl_merger migration was incomplete (#13133) ca2bb89eac2097ab4620448737e58af8452e444b 2d451c80590b9ac250322769ac13d3b4870dbcf7 2025-04-27T16:10:34+08:00 HimariO clip : Add Qwen2.5VL support (#12402) 4753791e70acd4d4e02f2098f14a03df26c992bd 77d5e9a76a7b4a8a7c5bf9cf6ebef91860123cba 2025-04-26T22:39:47+02:00 Xuan-Son Nguyen clip : improve projector naming (#13118) edb18b6e8f5ea6509ad43057f8bb98fc557dbc4e 514c45608f93f66106a712dee1abe062099ce790 2025-04-25T14:31:42+02:00 Xuan-Son Nguyen clip : fix pixtral on some GPU backends (#13097) 13be08daf992c89d5169518229b3740041c0f419 226251ed56b85190e18a1cca963c45b888f4953c 2025-04-24T22:17:04+02:00 Xuan-Son Nguyen clip : remove boi/eoi embeddings for GLM-edge model (#13081) 226251ed56b85190e18a1cca963c45b888f4953c 87616f0680947800ecba3e9f6bc6e101943bf8e6 2025-04-24T22:29:22+03:00 Georgi Gerganov embeddings : fix batch sizes (#13076) 56304069599f4dd9749d94b9bca2c2c65bb27c02 ecda2ec4b347031a9b8a89ee2efc664ce63f599c 2025-04-24T02:32:35+05:00 pl752 llama-mtmd-cli: Sigint rework in mtmd vision example (#13080) ecda2ec4b347031a9b8a89ee2efc664ce63f599c eb1776b15a32d832f1266deeeab75b9d255c5849 2025-04-23T20:21:59+02:00 Xuan-Son Nguyen mtmd : Support Pixtral 12B (#13065) 84a9bf2fc2875205f0806fbbfbb66dc67204094c 2016f07bd106c73699ecbaace80f55db5ed95dac 2025-04-21T15:32:58+02:00 Xuan-Son Nguyen mtmd : merge llava, gemma3 and minicpmv CLI into single `llama-mtmd-cli` (#13012) 2016f07bd106c73699ecbaace80f55db5ed95dac 6602304814e679cc8c162bb760a034aceb4f8965 2025-04-20T23:29:36+02:00 Xuan-Son Nguyen convert : experimental support for `--mmproj` flag (#13023) 6602304814e679cc8c162bb760a034aceb4f8965 66168204be9559dc841f06f0025f3da01d9a8546 2025-04-20T03:15:41-07:00 Jeffrey Morgan llava: fix errors in clip.h on certain compilers (#13030) 37b9f0d29d7301dd0ec5dfae8f357ccee96325d7 6408210082cc0a61b992b487be7e2ff2efbb9e36 2025-04-19T09:15:45+02:00 Xuan-Son Nguyen clip : refactor, add `image_manipulation` and `llava_uhd` classes (#13011) b9154ecff93ff54dc554411eb844a2a654be49f2 2db9ba1464f3de0aceb2b5289963e69fc369cb66 2025-04-18T10:04:51+02:00 Xuan-Son Nguyen mtmd : add methods to access `mtmd_image_tokens` (#12906) 510676475f885ec064ff147af9f20ee7a9b12a50 daa422881a0ec7944771bcc8ff8de34d11f5bd3b 2025-04-15T14:07:42+05:30 Akarshan Biswas SYCL: Add ROPE vision kernel (#12887) daa422881a0ec7944771bcc8ff8de34d11f5bd3b eccc7a1602f0752507de4aaad1008b9618a282c8 2025-04-15T07:49:57+01:00 Juk Armstrong llama : DeepSeek V2/V3 MLA implementation (#12801) e59ea539b83d2c7947c99bd350549364dbba450c c94085df2871d2cad11f6411304d7798d7dd4cdd 2025-04-12T01:29:03-04:00 Matt Clayton llava: Fix cpu-only clip image encoding sefault (#12907) 0c509239445088f21265580b86733c5b184261d9 fccf9cae83e6c6cd31a0ecb403d237638e427d0a 2025-04-11T12:09:39+02:00 Xuan-Son Nguyen clip : use smart pointer (⚠️ breaking change) (#12869) 12e9158f25cb47e97ca9b8083e1ec7415f262260 5b1f13cb64dbb0de7e95dae86725928d350c188c 2025-04-11T09:24:34+02:00 Daniel Bevenius xcf : add check for visionos build version (#12854) b0091ecc1e5c0f689be856fade3803a534f35c9f 31f7803bc4e7c0dcc279ee04c2ecfb76b2afdd3e 2025-04-09T23:17:12Z Rudi Servo docker : added all CPU to GPU images (#12749) d9a63b2f2e91cdcb0eda211b7f49fadcdea0f664 8ed71242f464dc0a3fb3cffcfe064e55bdec72f9 2025-04-09T17:22:30+08:00 R0CKSTAR musa: enable freediskspace for docker image build (#12839) 65a69e6e1b6d55cd5f78f8bcdfaba8a8c59a8d96 47277d6d1d0d515cff34292a1a78a0d1b7252350 2025-04-09T10:09:53+02:00 Xuan-Son Nguyen clip : do not print ftype (#12832) b32efad2bc42460637c3a364c9554ea8217b3d7f a19b5cef16d885c44c635da4a5c97113c1577de8 2025-04-08T16:01:58-04:00 Matt Clayton llava: improve clip_ctx destructor to not memleak load_image_size (#12834) a19b5cef16d885c44c635da4a5c97113c1577de8 78a1ba0a4f2bfed5b8b8e312592143d22e531698 2025-04-08T19:54:51+03:00 Georgi Gerganov llama : fix FA when KV cache is not used (i.e. embeddings) (#12825) 2dabf759e7c8c827d38cdd18d0792070e6a4f4e1 1d343b4069c74b2c7b19ae84260cd98aa2320a9a 2025-04-08T21:49:13+08:00 dm4 llava: add more helper functions to check projector types in clip context (#12824) 0364178ca2452bd241a4cdd4350d0d7a6ff8c4b4 c6ff5d2a8da2587cc78c9ede9171dfc3f076c757 2025-04-05T17:17:40+02:00 Xuan-Son Nguyen clip : refactor clip_init, add tests (#12757) f52d59d771dc231fc2ac39adacf157ddefc97730 52de2e594979be52f0da92601747aa44a13e50e4 2025-03-31T11:07:07+02:00 Sigbjørn Skjæret llava : fix clip loading GGUFs with missing description (#12660) 5dec47dcd411fdf815a3708fd6194e2b13d19006 f125b8dccff34439a26bf750c9edef358c48c1f8 2025-03-27T08:08:08-07:00 lhez opencl: add multi and vision rope, `gelu_quick` and `im2col` (#12600) 02082f1519565fc7b49de211b28bc5404a69209b df4d20cd53d5bb6fc21c1dc65f026d53b566d097 2025-03-26T22:06:04+08:00 Ivy233 clip: Fix llama-llava-clip-quantize-cli quantization error under CUDA backend (#12566) 2b65ae30299b9c67e25c51ee567e9a2ef22279ab 48d7021c61ceda6fcf1a7294d2115b8e1a53ae95 2025-03-24T09:20:47-07:00 lhez opencl: simplify kernel embedding logic in cmakefile (#12503) 0fd8487b142b2b92565bc95b39ddc440955a237c 108e53c2f1b57b79c8bcf9773fba5a82e2f1eeb5 2025-03-19T10:15:23Z Guus Waals Fix visionOS build and add CI (#12415) 108e53c2f1b57b79c8bcf9773fba5a82e2f1eeb5 a686171ea71ed8cb8a324850d146cb65a001e141 2025-03-19T09:08:49+01:00 Sigbjørn Skjæret llama : add support for GPT2, Bloom and CodeShell tied word embeddings (#12456) 99aa304fb900654ec338749f64e62895b9a88afd 8551c44d840a7db50adb958ccaf464dc3ded82e7 2025-03-18T17:24:33+01:00 Xuan-Son Nguyen llama : add support for EXAONE tied word embeddings (#12451) 7841fc723e059d1fd9640e5c0ef19050fcc7c698 bf69cfe62f9ccc01112c0232a55820b95a8c1fda 2025-03-12T09:30:24+01:00 Xuan-Son Nguyen llama : Add Gemma 3 support (+ experimental vision capability) (#12343) 96e1280839561aaabb73851f94972a2cd37b2d96 2c9f833d17bb5b8ea89dec663b072b5420fc5438 2025-03-11T09:20:16+01:00 Xuan-Son Nguyen clip : bring back GPU support (#12322) 8352cdc87b207a735d34c431a36c425728cb4586 1e2f78a00450593e2dfa458796fcdd9987300dfc 2025-03-10T16:33:24+08:00 tc-mb llava : fix bug in minicpm-v code (#11513) 5e2d57b2b2e43eadbe6d66ba3e873a824b95e725 f1648e91cf6c52e9593810aa70857e412d474c09 2025-03-07T15:35:57+08:00 BB-fat metal : simplify kernel arguments using a struct (#3229) (#12194) d6c95b0740510231b3797b80d6d3440d8fe188b6 d76a86d967ef491d530400b08bc8ef8a14807936 2025-03-07T06:23:16+01:00 Daniel Bevenius metal : fix default.metallib build (#12224) e9b2f84f145fbd458dcb98f227bd09370918be6e e721c05c9336a72fbb59d5c75967360bc67036c6 2025-03-06T16:33:21+08:00 Aaron Teo llava: add big-endian conversion for image encoder (#12218) 16e4b22c5e58ee200ede913fd7b7b8ba92132ce8 074c4fd39df3af974e10fbee6cc6db5d9304655b 2025-03-05T17:16:01+02:00 Plamen Minev ggml : fix GGMLMetalClass ODR (#12200) a057897ad4e48e3df0354256e0cc80dadcb57595 5bbe6a9fe9a8796a9389c85accec89dbc4d91e39 2025-03-05T06:30:31+01:00 Daniel Bevenius llama : add xcframework build script (#11996) 84d5f4bc195b9540fcb902d869015fba7ef6baa4 438a83926afcff3643ffef5543db67545ceffe39 2025-02-28T04:31:47-07:00 Alex Brooks Update granite vision docs for 3.2 model (#12105) 4d1051a40ffc2fdff80bc532eea5b9568b85c156 3e9a2860e996657fc10db8393cf65adc40703082 2025-02-25T02:46:05-07:00 Alex Brooks Add Doc for Converting Granite Vision -> GGUF (#12006) 7a2c913e66353362d7f28d612fd3c9d51a831eda 08d5986290cc42d2c52739e046642b8252f97e4b 2025-02-24T09:09:51-07:00 Alex Brooks llava : Add Granite Vision Support (#11794) 36c258ee921dbb5c96bdc57c0872e4a9a129bef6 f3e64859edb0d55d4223ead78672597cd1a218df 2025-02-22T22:28:28+08:00 Ting Lou llava: build clip image from pixels (#11999) ee02ad02c56ff36a5edd22d8617ab3f9546ce7fe c392e5094deaf2d1a7c18683214f007fad3fe42b 2025-02-20T23:11:03-07:00 Alex Brooks clip : fix visual encoders with no CLS (#11982) bf42a23d0a515a508aecf10fde1d52c5ed5104c6 c2ea16f260445d1f2bd9fee78fb8acb2b3aaaad4 2025-02-16T01:52:23-06:00 Jeff Bolz vulkan: support multi/vision rope, and noncontiguous rope (#11902) b7552cfcbc7defccd8bdefd0a7b9c47d145ed3d7 225bbbfa39930cda38a2e5d1f3e5b38226732009 2025-02-07T09:15:22+01:00 Daniel Bevenius common : add default embeddings presets (#11677) 902368a06b915b860236cfc97ff885b2aceae256 c3db0480bb820e120249014b380e1f4badf2a1c1 2025-02-05T19:52:31-06:00 Charles Duffy metal : avoid breaking build when metal API predates TARGET_OS_VISION (#11690) 1ec208083cb896dd8772a2f962151fa3d4a74e36 9f4cc8f8d310b13ab3fc93a9be81b1d1376a7fa6 2025-02-05T14:45:40+07:00 SAMI llava: add quantization for the visual projector LLAVA, Qwen2VL (#11644) 0cec062a638700495673f5494d200b74340538be 53debe6f3c9cca87e9520a83ee8c14d88977afa4 2025-02-02T15:48:46+08:00 piDack llama : add support for GLM-Edge and GLM-Edge-V series models (#10573) b636228c0ad0db95bf73008094c6145a05615cf6 325afb370a1a7b32b5fe46a749bc840c66db9765 2025-01-29T09:38:54+01:00 Daniel Bevenius embedding : enable --no-warmup option (#11475) f643120bad8ab3a753daa64aaac8288ee5800e06 6e84b0ab8e10b8f6f99a32855f976ebcd35b0353 2025-01-28T11:42:32+01:00 Nuno docker: add perplexity and bench commands to full image (#11438) 466ea66f338d63109540dae1df97ccfdbf4cd08f 5f0db9522f347b095f84c3033d6c1c1895402e25 2025-01-25T07:26:01+08:00 jiahao su CANN: Add Ascend CANN build ci (#10217) 3e3357fd77bcf5bd8cfcc53ca53d4a5532e67e1b 6171c9d25820ccf676b243c172868819d882848f 2025-01-22T15:35:48+08:00 tc-mb llava : support Minicpm-omni (#11289) 8f70fc3d1b1d3c17b61842330dd106d391cc1227 1244cdcf14900dd199907b13f25d9c91a507f578 2025-01-13T13:38:20+01:00 Daniel Bevenius llama : remove 'd' from bad special token log (#11212) 2739a71e4b88474833b64aa974ca4515574fd3c4 ba8a1f9c5b675459c55a83e3f97f10df3a66c788 2025-01-11T05:50:33+01:00 Daniel Bevenius convert : sort print supported models [no ci] (#11179) ff3fcabc727b2dd0c477d23a258217b27cc639fb c3f9d25706ac84297067aeaa662c1f1af42ed443 2025-01-10T11:30:53+01:00 Daniel Bevenius convert : add --print-supported-models option (#11172) 5e3b08d606b5b0caaea16541b504c3bba8f3ec1d db68c93b57bfdf6da1fbdae81080382d6998cbc9 2025-01-04T10:53:54+02:00 Georgi Gerganov ggml : do not install metal source when embed library (ggml/1054) 9ba399dfa7f115effc63d48e6860a94c9faa31b2 2cd43f4900ba0e34124fdcbf02a7f9df25a10a3d 2024-12-24T21:33:04+01:00 Reza Kakhki server : add support for "encoding_format": "base64" to the */embeddings endpoints (#10967) 0ca416c91aea4549d9c77e3efeca403e15aa6c75 21ae3b9be83820565d1a720999b7f63ce95b4920 2024-12-20T14:12:06+01:00 Xuan Son Nguyen server : (UI) fix copy to clipboard function (#10916) d408bb9268a988c5a60a5746d3a6430386e7604d 5cab3e4aaa892df4620b720f20a503a1bbbe7a52 2024-12-19T18:47:15+02:00 Georgi Gerganov clip : disable GPU support (#10896) 2fffc52b50992ac5bc64db19d33c39cbc06f52cf 7585edbdebd02861e0994dae67c9338731fb3fc5 2024-12-19T06:04:51-07:00 Sukriti Sharma llama : fix Roberta embeddings (#10856) 0bf2d10c5514ff61b99897a4a5054f846e384e1e 7bbb5acf125d1d2840cac7d31b9aaa72210dd5ec 2024-12-18T19:27:21+02:00 Georgi Gerganov tts : add OuteTTS support (#10784) 152610eda91217ac409342cd976d05f5114ad39f 0e70ba686e6c717a0aa41d88284e2a392c2bd0cd 2024-12-18T13:01:41+02:00 Georgi Gerganov server : output embeddings for all tokens when pooling = none (#10861) 46828872c31b25df16169cbbf5c2225fa9cb0675 6b064c92b4c0228e333193c167f2c98d2ec8d9bc 2024-12-18T09:55:09+01:00 Xuan Son Nguyen server : (embeddings) using same format for "input" and "content" (#10872) 8dd19a48129d578972ea3d98896edbbf492891a9 130d0c90bd26b25e3a713b17a61a5d4eb0a66405 2024-12-16T19:34:38+09:00 gn64 vulkan : fix soft_max.comp division by zero (whisper/2633) 05c3a444b8b017b01b366b725ba22c740aae6b38 382bc7f2e8ffd0b89f23e840d097e21f301197ba 2024-12-17T16:00:24Z krystiancha server : fill usage info in embeddings and rerank responses (#10852) ba1cb19cdd0d92e012e0f6e009e0620f854b6afd 56eea0781cbd2608ed8ff524955495569b9264be 2024-12-14T20:43:46+08:00 HimariO llama : add Qwen2VL support + multimodal RoPE (#10361) a76c56fa1a3d27467eb97468d8c3b2fe1243b61a c27ac678dd393af0da9b8acf10266e760c8a0912 2024-12-13T12:23:52-08:00 lhez Introducing experimental OpenCL backend with support for Qualcomm Adreno GPUs (#10693) 11e07fd63bac1cb642380a7a3eac03fd8703e948 4601a8bb6784d2ab8b4b605354b51979fbeea1d3 2024-12-13T18:23:50+01:00 Corentin REGAL fix: graceful shutdown for Docker images (#10815) 784a14aa496a66cc43e76014a1bf4333b4a2a55a c5ede3849fc021174862f9c0bf8273808d8f0d39 2024-12-07T00:02:14-07:00 Sukriti Sharma convert : add support for Roberta embeddings (#10695) 8d0cfd554a9ae545ff94d27e04458f537b4e8c0e 2759916d86b70e7aceaed4d0b4e7ed126f0f9e51 2024-12-04T17:42:50+08:00 JFLFY2255 llama: Support MiniCPM-1B (with & w/o longrope) (#10559) 01e6d9bb71eb71fe1f811f2fdef15753232cd0f2 cc98896db858df7aa40d0e16a505883ef196a482 2024-12-04T08:26:37+08:00 piDack clip : add sycl support (#10574) 7db3846a94ce7683b3e8120abe427457edf840c9 c6807b3f28cc3dbfda3ec390bcb87e69fb5634e2 2024-11-26T13:05:20+01:00 Diego Devesa ci : publish the docker images created during scheduled runs (#10515) 50d5cecbda3b0d03344eed326287adc1f6c7f3ef 9fd8c2687f5aa2f095ac6e12a376e1c0583888e8 2024-11-25T22:05:39+01:00 Diego Devesa ci : build docker images only once daily (#10503) 9336db462c0c34bbe2055413fe4e16442626c38b 96fa2c5e2d6cb5319f34c3a7fb0cec05694b22f1 2024-11-24T02:02:34-07:00 Gabe Goodhart convert : XLMRoberta Type Vocab Size (#10458) 57f8355b29a8c7dfcd1fb6094758ad85644f8535 9901068ac78838745e604fffb4601d315a610456 2024-11-15T12:10:45+01:00 Romain Biessy sycl: Update Intel docker images to use DPC++ 2025.0 (#10305) 5b359bb1e3585de45bec79fd6c18934897662cdf e89213492d3e01705739789733f0f2d250b4c449 2024-11-09T15:35:46+08:00 SXX ggml: fix zero division in ‘dne’ calculation in CUDA COUNT_EQUAL operator when ‘ne’ is small (#10213) d05b3127bd30515955aa4ee2bacdb68ebafe88f4 76c6e7f10551960e4ec9e14e0535b72081f1c7ad 2024-11-08T17:34:06+08:00 Jhen-Jie Hong swift : exclude ggml-metal-embed.metal (#10211) a71d81cf8c1afb26b166f897c94ee1581f9fac7d eec4d71737b32f312e0082b671629a0368e1a20d 2024-11-07T17:31:10-04:00 Xuan Son Nguyen server : revamp chat UI with vuejs and daisyui (#10175) 8f275a7c4593aa34147595a90282cf950a853690 8d8ff715367480b856ad86ac3888e9742b13a6fa 2024-10-29T17:52:56+09:00 Changyeon Kim ggml: Add POOL2D OP for GPU acceleration to the Vulkan backend in the MobileVLM model. (#9763) 674804a99617b4f90292b4080ecab450ea3d30ba e94a138d644a9b34da61805f7aeb8af595c61b53 2024-10-22T09:40:02+02:00 Daniel Bevenius arg : fix typo in embeddings argument help [no ci] (#9994) cf8e0a3bb9c0e93e371773b282054cdbbb231038 c7499c557cc1efafaf0a6bc12963c39826299703 2024-10-11T02:10:37+08:00 R0CKSTAR musa: add docker image support (#9685) 1927378bcce20ba72b6c89d5977b854a4bcaeb5d 6f1d9d71f4c568778a7637ff6582e6f6ba5fb9d3 2024-10-01T02:31:36-04:00 compilade convert : refactor rope_freqs generation (#9396) f4d2b8846a6b34419ff9e9491aee6cd95e444bfc 1b2f992cd2cff0b69e5abe78bb8888d51ed19d67 2024-09-28T17:42:03+03:00 Georgi Gerganov llama : add reranking support (#9510) 9a913110cf471a8287ac06c43cbe307d3cf6df99 43bcdd9703ec19af7d2a519640b5ed6f4aac3d53 2024-09-28T12:08:43Z nopperl llama : add support for Chameleon (#8543) 0b3bf966f47bf2ba88e5d4e3ed429602008c7e63 f0c7b5edf82aa200656fd88c11ae3a805d7130bf 2024-09-23T22:23:54+02:00 Xuan Son Nguyen server : add --no-context-shift option (#9607) acb2c32c336ce60d765bb189563cc216e57e9fc2 a6a3a5c531c73aef85750a847d21e7d4671e723d 2024-09-16T13:07:13+02:00 Daniel Bevenius llama : rename n_embed to n_embd in rwkv6_time_mix (#9504) 95ca85168b5b089b80a811b59528ce0a2f1bd1dd 441b72b91f818fe69497e5816f87969e90c73c43 2024-09-16T14:45:20+08:00 CarryFun llama : support MiniCPM3 (#9322) 1b28061400eb9832603c9f1dfbec4d339a8490a2 8db003a19d7055b5bd248ce2afff9324e5b8da95 2024-09-11T17:52:13+02:00 slaren llama : skip token bounds check when evaluating embeddings (#9437) 0996c5597f680effacc046832bb807c14900e22d 5bb2c5dbd26b246d334f0087b3cbd800f2e65c54 2024-09-11T12:59:13+02:00 Xuan Son Nguyen llava : correct args for minicpmv-cli (#9429) 6c89eb0b4749184f4d19e96ada5dcb8847129b9c 9b2c24c0993487d3b34a873980e292da571481f3 2024-09-07T09:48:54+02:00 slaren ci : disable rocm image creation (#9340) 9bc6db28d011d47a5f318dc4aebbe7927fac4629 32b2ec88bc44b086f3807c739daf28a1613abde1 2024-09-05T21:48:47-04:00 compilade ggml-quants : ternary packing for TriLMs and BitNet b1.58 (#8151) 048de848ee4baad4531fcd6239438f5d55be365c f771d064a95d212ddadea452ad0cc1e42b2c3db3 2024-09-02T18:11:13+02:00 slaren docker : fix missing binaries in full-cuda image (#9278) 6e7d133a5f9409dd257fad90d7f320721b07a1b2 b60074f1c26d8354053a952844ef3f7ebefd8803 2024-09-02T17:11:51+02:00 Xuan Son Nguyen server : refactor multitask handling (#9274) 8f1d81a0b6f50b9bad72db0b6fcd299ad9ecd48c a47667cff41f5a198eb791974e0afcc1cddd3229 2024-09-01T22:38:17+08:00 Molly Sophia llama : support RWKV v6 models (#8980) 7ea8d80d53364f2cdcd7bbc0f031106f529b1fe3 42c76d1358021ccdbe8ba89109c143dd7ae166df 2024-08-30T13:21:57+08:00 tc-mb llava : the function "clip" should be int (#9237) 9fe94ccac92693d4ae1bc283ff0574e8b3f4e765 66b039a5011522b6a61495eea2a9862601e169f7 2024-08-28T17:28:00+02:00 slaren docker : build images only once (#9225) 66b039a5011522b6a61495eea2a9862601e169f7 20f1789dfb4e535d64ba2f523c64929e7891f428 2024-08-28T13:20:36+02:00 slaren docker : update CUDA images (#9213) 3246fe84d78c8ccccd4291132809236ef477e9ea 78eb487bb0038eae95506d3d832b94c979185b09 2024-08-27T20:33:08+08:00 Xie Yanbo Fix minicpm example directory (#9111) ad76569f8e78ab6ca921bda25cef25a157361719 7d787ed96c32be18603c158ab0276992cf0dc346 2024-08-26T22:58:50-07:00 arch-btw common : Update stb_image.h to latest version (#9161) a1631e53f6763e17da522ba219b030d8932900bd fc54ef0d1c138133a01933296d50a36a1ab64735 2024-08-21T17:58:11-04:00 compilade llama : simplify Mamba with advanced batch splits (#8526) f63f603c879c2232eaeded8c0aeba4244471d720 8455340b874aa90d5f70104c99ed2778d9e31c36 2024-08-21T09:45:49+02:00 fairydreaming llava : zero-initialize clip_ctx structure fields with aggregate initialization 908) 2f3c1466ff46a2413b0e363a5005c46538186ee6 50addec9a532a6518146ab837a85504850627316 2024-08-21T04:00:00+09:00 Changyeon Kim llava: Add ACC OP for GPU acceleration to the Vulkan backend in the LLAVA CLIP model. (#8984) d565bb2fd5a2a58b9924a7a34e77a87c78c52137 ee2984bdaf10c14d440ad873a049bcc09b786d9b 2024-08-16T21:34:41+08:00 tc-mb llava : support MiniCPM-V-2.6 (#8967) 7c3f55c10051c634546247387c5c359c9d499360 911b437f228e75aa3d235acec21bfddd23ecce2f 2024-08-10T11:43:26+02:00 fairydreaming Add support for encoder-only T5 models (#8900) 3071c0a5f218f107dabd13b73f6090af683ef5ec 4305b57c80eff4f0df5f6acb60b292f03b8f0dd0 2024-08-09T18:33:53+08:00 tc-mb llava : support MiniCPM-V-2.5 (#7599) 5b2c04f4925e152c362b824f4b41eb2a081fa623 6f6496bb0999d1bce5daff0cfc55ceb0dd13c888 2024-08-09T08:33:30+02:00 Daniel Bevenius embedding : add --pooling option to README.md [no ci] (#8934) daef3ab233fc02e4c53afd9b07366379876f00d1 345a686d8271a24db20d31789c0d4b9ed51dcb0c 2024-08-09T08:32:02+02:00 Mathieu Geli server : add one level list nesting for embeddings (#8936) 15fa07a5c564d3ed7e7eb64b73272cedb27e73ec be55695eff44784a141a863f273661a6bce63dfc 2024-08-07T18:24:05+02:00 slaren make : use C compiler to build metal embed object (#8899) cdd1889de62a7140c8c016405ec917464bde8bd3 c21a896405de4cdf4207eb8130555ceaac0ab110 2024-08-06T02:20:54-05:00 Douglas Hanley convert : add support for XLMRoberta embedding models (#8658) a3738b2fa7c60ef2c4592435d1aa7fb8f1f69c3e 655858ace0cf2720e56eb01f84ad05e0c94ada3c 2024-08-04T17:28:08+02:00 0cc4m vulkan : implement Stable Diffusion operators (ggml/904) afbbcf3c04e3c6420cad3d72571478cd62ac176c ed9d2854c9de4ae1f448334294e61167b04bec2a 2024-07-31T18:59:09-05:00 Igor Okulist server : update llama-server embedding flag documentation (#8779) c887d8b01726b11ea03dbcaa9d44fa74422d0076 75af08c475e285888f66556d0f459c533b7deb95 2024-07-30T14:56:51+08:00 zhentaoyu [SYCL] Add `TIMESTEP_EMBEDDING` OP (#8707) 4c676c85e59ef8f771f3a129e6eb217552139231 e54c35e4fb5777c76316a50671640e6e144c9538 2024-07-28T00:42:05-04:00 compilade llama : refactor session file management (#8699) c3ebcfa148e867a68e78fd5c4f0c23e8f84c788b 8a4441ea1a2564578134404f31158c318e9c0bf3 2024-07-12T03:14:12-05:00 Douglas Hanley server : ensure batches are either all embed or all completion (#8420) d12f781074b92589a72a36ffabb583933f7b9dc0 bcefa03bc01a41aace2e200ee8e77827d6d39b4f 2024-07-05T02:05:56-05:00 Douglas Hanley llama : streamline embeddings from "non-embedding" models (#8087) d7fd29fff16456ce9c3a23fd2d09a66256b05aff 6f63d646c1a06a6e09f721009a2676864ae04e31 2024-07-05T05:14:21+12:00 Icecream95 llama : add OpenELM support (#7359) 807b0c49ff7071094f97ebc3a0a8e2b9e274f503 f8c4c0738d72d2162736edd72dd5db8b269adca1 2024-07-04T15:46:11+02:00 fairydreaming Inference support for T5 and FLAN-T5 model families (#5763) 26a39bbd6b0bbd66118bb68569f0276d7fe7df6c 38373cfbab5397cc2ab5c3694a3dee12a9e58f45 2024-06-28T15:11:44+02:00 Xuan Son Nguyen Add MiniCPM, Deepseek V2 chat template + clean up `llama_chat_apply_template_internal` (#8172) 9b31a40c6ddabe552875b811d7127aa039ca9703 c70d117c37cc7876e775d1e2722208a50c52edb3 2024-06-27T01:50:09+02:00 Daniel Bevenius clip : suppress unused variable warnings (#8105) ae5d0f4b899ff2842bfca561370c945ad8d4368b 31ec3993f6e050322a249c07af79dbde66ea6ddc 2024-06-26T21:59:28+02:00 slaren ci : publish new docker images only when the files change (#8142) 3791ad219323389106dc3fd80814eb5bbb7b80de f702a90e245499283d6de0b287701c723cda2a87 2024-06-25T16:57:35+05:30 HanishKVC SimpleChat v3.1: Boolean chat request options in Settings UI, cache_prompt (#7950) 8cb508d0d5c024e12692370d85237b45469a004b 646ef4a9cfb6f40236d3b9ef07ac03700b6efcc7 2024-06-24T07:36:11+02:00 slaren disable publishing the full-rocm docker image (#8083) 646ef4a9cfb6f40236d3b9ef07ac03700b6efcc7 de0d6a68ac99f307fe889c48e21124bc3b7ca29a 2024-06-24T13:30:24+08:00 Yann Follet embedding : more cli arguments (#7458) 11318d9aa1f668aa10407a5cb9614371af32f3ce b6b9a8e606da7764bd3649c2ea574979c85abd43 2024-06-23T15:39:45+02:00 Daniel Bevenius Fix typo in llama_set_embeddings comment (#8077) 80ea089d771f0c2d97afa8bead80ded412f600d7 0e64591e8290037db6412665a56354b789a0597e 2024-06-21T00:38:22-05:00 Douglas Hanley llama : allow pooled embeddings on any model (#7477) 0c7b3595b9e5ad2355818e259f06b0dc3f0065b3 7b2f4a7d193ef2475259bbe7656fcccfab4b1217 2024-06-15T18:53:40+02:00 Xuan Son Nguyen Add `cvector-generator` example (#7514) c2ce6c47e4f2d891bf29d8810832a3b310a8f205 b61eb9644d64e90123ac805436d95b94b3b4cc3f 2024-06-11T07:59:20+02:00 slaren fix CUDA CI by using a windows-2019 image (#7861) a5cabd76491f07494c5b8267f921c73f5e2bbfb4 d5c938cd7716b9a2ace49a43a469dfbffcff4d28 2024-06-07T15:09:45+08:00 woodx server : do not get prompt in infill mode (#7286) 2d08b7fbb483c14bd2b173d4cd51ea3a4f862e8f d67caea0d6e6c303d31b01d0a010973e6c908dff 2024-06-06T07:19:49+02:00 slaren docker : build only main and server in their images (#7782) 6f28a333c1e3fdfdc7b4f9d0367f2b41a9b7e9d4 549279d8049d78620a2b081e26edb654f83c3bbd 2024-06-03T15:49:30+08:00 zhangkaihuo llama : MiniCPM support tied embeddings (#7664) 74b239b3d5f067470d7ef5e26e2e059720572e32 852aafb163d32d5bad63c10bc323a02c28fec59d 2024-05-28T11:48:16+09:00 Ikko Eltociear Ashimine llava : update clip.h (#7580) 152da28ae54139e3754189b9e6e1c28e11277502 d48c88cbd563b6cf0ce972e2f56796896e240736 2024-05-23T17:40:43+10:00 Brian labeler.yml: add embedding label detector [no ci] (#7482) 65c58207ece92ad213f4bfd0f91dcb2dfb664f5b 1cc0155d04918cb3017afa472acea51b77483c4a 2024-05-20T15:19:21+08:00 junchao-loongson ggml : add loongarch lsx and lasx support (#6454) e932094d58f513d5996c3efc9f6fed8238894c57 2789baf480ba7dc9281b65f601f0918e58920f54 2024-05-20T08:56:05+03:00 Georgi Gerganov server : return error on too large embedding input (#7389) 33c8d50accd6dca73c9c4af00a05e24209c160fe d359f30921a9f62a0fd299c412ff3f270286fea6 2024-05-19T19:18:39-07:00 Srihari-mcw Add provisions for windows support for BF16 code including CMake provision for enabling AVX512_BF16 (#7258) f030ec1f7a72aa825b2104823946551b9ec5dfc1 e4e6f67be6a8a697f5f89a28c98934e53c99c359 2024-05-19T17:19:53+02:00 0cc4m Vulkan Embedding Fix (#7360) ea3b0590ee33d3573eb8ef76f88cc60f36d2a38d 29499bb59383c2a8c5d557a90abb08b696cef7f6 2024-05-15T20:01:12+08:00 dm4 embedding : free the batch after execution (#7297) 27f65d6267cf22a44c5ccefa7765d53a05bd1259 ee52225067622babc277371511b8124884e1c797 2024-05-14T14:20:47+09:00 Ryuei docs: Fix typo and update description for --embeddings flag (#7026) b83cc3f5b303ff30c52874b2d5864dc6385ebf9f 9cb317f77e53067f7a138cc89ef7657148eae8e6 2024-05-11T09:46:09+02:00 Joan Fontanals llama : add Jina Embeddings architecture (#6826) f89fe2732c5709f6e86d5f4aee2e6d2a561f2eb2 d11afd665241c1b3910ab5f040d0216403019d87 2024-05-10T15:51:58+05:30 HanishKVC Main+: optionally allow special tokens from user in interactive mode (#7097) d11afd665241c1b3910ab5f040d0216403019d87 8c570c9496212073079476651c7517c02581101f 2024-05-10T02:41:10-04:00 Andrei llava : fix moondream support (#7163) 47345248827f426038098d016ed11975021b4919 07cd41d0965829463eff73eda3348aedbfd3a444 2024-05-09T17:34:37+08:00 Albert Jin opencl : alignment size converted from bits to bytes (#7090) 9da243b36ac0b9d609adfaaa4c8f1cc8c592f737 bd1871fa2b1bf8a081b43ba9bc85f8ffd46fac46 2024-05-08T22:14:39+03:00 Georgi Gerganov Revert "llava : add support for moondream vision language model (#6899)" ffe666572f98a686b17a2cd1dbf4c0a982e5ac0a 24affa7db3c9db148854b0ab4fd63de8bca7d898 2024-04-29T07:34:24-07:00 cpumaxx llava-cli : multiple images (#6969) 3055a4180557c6cbe29eacc8284c9e070ac10eab 577277ffd203b190c3dc2ab3e737946dc432132c 2024-04-29T09:34:41-04:00 Christian Zhou-Zheng convert : fix conversion of some BERT embedding models (#6937) 46e12c4692a37bdd31a0432fc5153d7d22bc7f72 dba497e0c1eff27cf0e85d1d73c86fa08e1b5557 2024-04-25T12:38:31-07:00 vik llava : add support for moondream vision language model (#6899) 4ab99d8d4762869506bb675b36501fd7c2af00b2 54770413c484660d021dd51b5dbacab7880b8827 2024-04-25T14:38:14+02:00 Daniel Bevenius clip : rename lerp function to avoid conflict (#6894) 8cc91dc63c0df397d644a581b2cbeea74eb51ae0 dbceec87c0221ec952e69448df6a71f1372a7487 2024-04-16T14:55:30-04:00 Justine Tunney ggml : add llamafile sgemm (#6414) 67fac4b95fcccfda8ab965e9ba4992a9ddf3a25f 29122d32ac8075ad27b7a8be05dcad2b7e7a5f9e 2024-04-10T08:58:48+02:00 Pierrick Hymbert docs : how to add a model (#6565) 1b67731e184e27a465b8c5476061294a4af668ea c4a3a4ff47d62d2503ddf9bd91b58c21f04fe3c3 2024-04-09T13:44:08-04:00 Jared Van Bortel BERT tokenizer fixes (#6498) 5dc9dd7152dedc6046b646855585bd070c91e8c8 e11a8999b5690f810c2c99c14347f0834e68c524 2024-04-09T09:16:13+01:00 Carolinabanana llama : add Command R Plus support (#6491) e3c337d87ca650972105a51c6ce302dd236c07ad beea6e1b16e783a0886e78dec01002a8c00db24d 2024-04-08T06:02:30-07:00 Rick G llama : support negative ith in llama_get_ API (#6519) 22a462cc1f69873f7d4c6d0201bd93478afa2ecb f6a0f5c6422200764b7929064c39dcf4bb0e9cd6 2024-03-26T16:22:07Z Someone Serge nix: package: don't introduce the dependency on python a016026a3ac16d8c9b993a3573f19b9556d67de4 53c7ec53d5eca26b2c0c648605543a5fa6c12817 2024-03-27T20:26:49+01:00 Pierrick Hymbert server: continuous performance monitoring and PR comment (#6283) 1e13987fba5a536965ef942f2c86549d62cef50b e82f9e2b833d88cd2b30123ef57346c2cb8abd99 2024-03-27T12:15:44+01:00 howlger embedding : show full embedding for single prompt (#6342) 557410b8f06380560155ac7fcb8316d71ddc9837 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 2024-03-26T10:46:41-04:00 compilade llama : greatly reduce output buffer memory usage (#6122) deb7240100da99555b9ab9dc635021e591fceaf5 3d032ece8e6973441273601ca2981130608e287d 2024-03-26T18:11:46+09:00 Minsoo Cheong embedding : adjust `n_ubatch` value (#6296) 1d0331c12a2f2a6296b471232bd4e66fbf06e6a1 dba1af612926cbd4ebe2d876277af1e3305177e0 2024-03-22T19:47:14+01:00 Kawrakow quantize: options for output and token embedding tensors qtype (#6239) 272935b281fee5c683e3d6d1eb580b84553cf503 ccf58aa3ec4d20b10162ba40898dc038ad4c3fad 2024-03-20T23:02:32+08:00 Ziang Wu llava : add MobileVLM_V2 backup (#6175) f8c4e745e1e728204ab26dbadf52853545e6789c 47cc7a7bf9793f81a6dfe7c2096c499403f64dd6 2024-03-20T19:20:37+08:00 Ziang Wu llava : add a MobileVLM_V2-1.7B backup (#6152) 104f5e0fc156d48476258295457cafeec2a2af10 5e1b7f94a03e0b3b8e4578625bbdadc7bbd2b93c 2024-03-18T16:40:22+01:00 Felix clip : fix memory leak (#6138) 877b4d0c628cc70dddb5df72ed8fc14d126ca7e8 12247f4c69a173b9482f68aaa174ec37fc909ccf 2024-03-15T13:43:02-07:00 Theia Vogel llama : add support for control vectors (#5970) 12247f4c69a173b9482f68aaa174ec37fc909ccf 4e9a7f7f7fb6acbddd1462909c8d696e38edbfcc 2024-03-15T16:41:22-04:00 Andrew Canis llama : add Command-R support (#6033) 044ec4b2a567f649459ccd20af2f387c784faa51 77178eedc83d49f31bf757d8e12315d76460be78 2024-03-14T15:14:14+02:00 Georgi Gerganov embedding : add EOS token if not present (#899) 68265ebfc6a1bed022973ea0c3145be1450b7e70 381da2d9f0940d7009e3e918bed36338c8ff2fbb 2024-03-14T12:37:20+02:00 Georgi Gerganov embedding : print all resulting embeddings (#899) 381da2d9f0940d7009e3e918bed36338c8ff2fbb 0fd6c1f015f6cccf3b527f7dbd8386a434728126 2024-03-14T11:55:23+02:00 Georgi Gerganov metal : build metallib + fix embed path (#6015) 0fd6c1f015f6cccf3b527f7dbd8386a434728126 19885d205e768579ab090d1e99281cae58c21b54 2024-03-14T10:12:29+02:00 Georgi Gerganov embedding : print cosine similarity (#899) f30ea47a87ed4446ad55adb265755dc9102956a2 d8fd0ccf6ac8b07791ffd1575eed436930854ae3 2024-03-13T18:54:21+01:00 slaren llama : add pipeline parallelism support (#6017) 99b71c068f624521ad977e08e41589e2971fa1c7 306d34be7ad19e768975409fc80791a274ea0230 2024-03-13T11:39:11+01:00 Xuan Son Nguyen Server: Use multi-task for embeddings endpoint (#6001) 828defefb66fc8a25404f5de845897145bf34061 caa106d4e05a0ab94225c220b81f9e2cd522339b 2024-03-11T14:40:42+01:00 Jakub N Update server docker image URLs (#5997) ecab1c75de68de7c41c254e2ae170d3b07bee6d4 ee35600b9061b1ea0c4ea87fce6844297632b2a8 2024-03-11T10:00:08+02:00 Gilad S cmake : fix subdir for `LLAMA_METAL_EMBED_LIBRARY` (#5985) bcebd7dbf62fd7b293d5ed089023e4e733269c71 2960eae847f8dbde23be6d170a61bcf44ebf32de 2024-03-10T11:56:30-04:00 DAN™ llama : add support for GritLM (#5959) fb215c3832236fec7380c4fb618bd7154cb196ef 2c4f566c88322ebf2f9bd11b01b5ebdaa0130b89 2024-03-09T21:27:58+09:00 SeungWon Jeong server : normalize embeddings (#5956) 950ba1ab84db199f0bbdecdb2bb911f35261b321 e1fa9569ba8ce276bc7801a3cebdcf8b1aa116ea 2024-03-09T11:27:53+01:00 Xuan Son Nguyen Server: reorganize some http logic (#5939) c2101a2e909ac7c08976d414e64e96c90ee5fa9e 515f7d0d4fce41c752fc253acf30707c3be2531e 2024-03-08T17:31:00-05:00 compilade llama : support Mamba Selective State Space Models (#5328) e457fb3540e0aaec47cfde0abf784c213f9216ee af37fd8b30e37ccbffdd82e6f48559e2fb7ce7dd 2024-03-08T02:41:50-08:00 Don Mahurin llama : assume tied weights if lm_head/output weights is missing (#5824) 6cdabe652695167263c8b447520987b11856f7ca 89fb735fcfd21781a8194b211cf32824beb3f71f 2024-03-07T16:32:38+02:00 Georgi Gerganov llama-bench : add embeddings option (#5924) 2002bc96bf2cbf5ab981a17d7e994d817c9801f5 ceca1aef0738b57951cd12c603c3477e75312dec 2024-03-07T11:41:53+02:00 Georgi Gerganov server : refactor (#5882) 21b08674331e1ea1b599f17c5ca91f0ed173be31 6a87ac3a52668e117d97bcea07b529c93188b303 2024-03-05T16:08:35+08:00 Neo Zhang Jianyu [SYCL] fix mul_mat fault in CI/unit-test (#5862) 29ae62d2ae163e2b68aa0ad3bf2ab4636de0c957 e0843afe1b37890b631bc7d3d2da2ed36c862b91 2024-03-04T22:31:20+02:00 Georgi Gerganov llama : fix embeddings (#5796) 7d43c585dc174bb586775c22c15e5db9242b5b4b 82f3e668adafba647de703f835991e91a96b5ac4 2024-03-03T20:23:52+08:00 leejet add some new ops, fix some operators and add batch operations to certain operators. (ggml/747) 475df1d6cf817060028d3ff763cb8097d4ec40d6 87c2e8b2797860a06af3d6c06b8488a8ff1a09ab 2024-03-03T04:40:27-06:00 Douglas Hanley llama : allow for user specified embedding pooling type (#5849) c29af7e2252d288f2ea58a7d437c1cb7c0abf160 38d16b142624bdd7c41d9955752b7f7b59c5e048 2024-03-02T01:00:46+05:30 Sourab Mangrulkar llama : add StarCoder2 support (#5795) 9e359a4f47c1b2dceb99e29706c9f7403d32ab5e 4c4cb30736582cacb1a164a9d4bc8e17b1014be7 2024-02-24T19:16:04+01:00 Pierrick Hymbert server: continue to update other slots on embedding concurrent request (#5699) 525213d2f5da1eaf4b922b6b792cb52b2c613368 fd43d66f46ee3b5345fb8a74a252d86ccd34a409 2024-02-24T12:28:55+01:00 Pierrick Hymbert server: init functional tests (#5566) 201294ae177b308fb3a99dc504dd6d27e8afa907 5a9e2f60ba3d8362ba17c77ac3092906d49b813f 2024-02-22T19:44:10Z Someone nix: init singularity and docker images (#5056) 580111d42b3b6ad0a390bfb267d6e3077506eb31 88c46cbdac05cebd936511b1d3c74112e721615f 2024-02-21T05:08:22-08:00 postmasters llama : add `gemma` model (#5631) 6560bed3f066c876682464762cad90f1e28e3f1b 06bf2cf8c406e6b70dbf9b431a02fa0ad845b9df 2024-02-20T11:07:22-08:00 CJ Pais server : support llava 1.6 (#5553) 8dbbd75754d43ec7b4bbe42fb287cc2553fdf0e9 c0a8c6db371cb3e4379900867b948879f5842201 2024-02-19T22:58:36-11:00 Haoxiang Fei metal : add build system support for embedded metal library (#5604) 890559ab28e354052e16e770155ad007fd0856e8 d0e3ce51f45bd6a646da1952d7e5d143a087db3e 2024-02-11T16:41:41+02:00 Didzis Gosko metal : option to embed MSL source into compiled binary (whisper/1842) 60ed04cf82dc91ade725dd7ad53f0ee81f76eccf 594845aab1c6775877f6d9545a51dc0f8d0b3d77 2024-02-16T10:24:39+01:00 Daniel Bevenius llava : fix clip-model-is-vision flag in README.md (#5509) 4524290e87b8e107cc2b56e1251751546f4b9051 c06e45d72983d9ace7b1535f7e7ea258d212169e 2024-02-15T11:21:49-06:00 Douglas Hanley Use correct type of pooling for embedding models (#5500) c06e45d72983d9ace7b1535f7e7ea258d212169e 9060a1e9dfca6038906e819be5fa42217f49028c 2024-02-15T18:49:08+02:00 Georgi Gerganov clip : fix wrong loop condition 0d4177126b0556e202efb85bf3f768be81076400 7930a8a6e89a04c77c51e3ae5dc1cd8e845b6b8f 2024-02-15T09:01:57+01:00 Elbios llava : fix memory management bug (#5491) 7930a8a6e89a04c77c51e3ae5dc1cd8e845b6b8f 704359e29985a06a389337a2617b7f3fa8eff908 2024-02-15T08:59:18+01:00 John llaba : hotfix for llava-1.6 image number (#5495) aa2341298924ac89778252015efcb792f2df1e20 f5ca054855dea83f424003162f26de376e5643f6 2024-02-14T08:38:35+01:00 John llava : support v1.6 (#5267) ea9c8e11436ad50719987fa23a289c74b7b40d40 c4e6dd59e45ef7b14f7763fb073b517395dc176c 2024-02-13T12:03:53-05:00 Jared Van Bortel llama : add support for Nomic Embed (#5468) 03bf161eb6dea6400ee49c6dc6b69bdcfa9fd3fc ad014bba97ef6ef6c3e2f78b2fc463e91ae94579 2024-02-13T06:06:58-06:00 Douglas Hanley llama : support batched embeddings (#5466) 4a46d2b7923be83d6019251671ee63aa1fa0d6bc 3b169441dfe8e420f88d1592708cc2a871daadb9 2024-02-12T09:38:44+01:00 Daniel Bevenius llava : remove prog parameter from ArgumentParser (#5457) 3b169441dfe8e420f88d1592708cc2a871daadb9 3bdc4cd0f595a6096cca4a64aa75ffa8a3503465 2024-02-12T09:16:06+02:00 Georgi Gerganov sync : ggml (#5452) 2891c8aa9af17f4ff636ff3868bc34ff72b56e25 97a336507ed9b971d72262bec7e2b8b7016a054a 2024-02-11T10:21:38-06:00 Douglas Hanley Add support for BERT embedding models (#5423) ff4ff05c5ff4311c05a8ce1f984c7d8def4f07a5 b7b74cef36a93ae01e0b9af8986d131761742d0e 2024-02-08T15:20:03+01:00 Daniel Bevenius llava : add missing .py, and fix paths in README.md (#5414) 4aa43fab569215a13495a7f1a0f8afc541b16d03 a6e514a85f0fda38ff78ec91782877ea3d19ed98 2024-02-08T18:36:19+08:00 runfuture llama : fix MiniCPM (#5392) a6e514a85f0fda38ff78ec91782877ea3d19ed98 26d4efd11e48908e14e2ee9471a7fc4c57079a1d 2024-02-08T09:58:19+01:00 Daniel Bevenius llava: fix typo/formatting in README.md (#5405) 316c7faf7740fa98ea68f1445f4505810f706b9e f3e2b4fa3f81a410ecb7dec929c259ef8d8dbb7d 2024-02-07T14:15:56+08:00 runfuture llama : add MiniCPM support (#5346) 6b91b1e0a92ac2e4e269eec6361ca53a61ced6c6 e805f0fa9951081ce0a86378a7aa52b6f636b82d 2024-02-02T08:56:31+01:00 Xuan Son Nguyen docker : add build for SYCL, Vulkan + update readme (#5228) c82d18e863fcde91b4b1109b1d0c73ea4470c405 14fef85e2d5361e6b4dd7a9ecf22bb817362997d 2024-01-29T21:48:10+08:00 Wu Jian Ping server : embeddings compatibility for OpenAI (#5190) 39baaf55a160909bb9428bd981014218761a20cb 6db2b41a76ee78d5efdd5c3cddd5d7ad3f646855 2024-01-28T01:55:31-06:00 Kyle Mistele docker : add server-first container images (#5157) 6db2b41a76ee78d5efdd5c3cddd5d7ad3f646855 753eafed0ebd07af6903771327a1786a7c02cf98 2024-01-27T16:09:18+01:00 John llava : support for Yi-VL and fix for mobileVLM (#5093) bf63d695b804b1c995c7ae4427a8a86936ea6d25 1387ea21178f9f154944013d4dd9764b54c69deb 2024-01-22T03:17:05-07:00 Michael Hueschen nix: add cc to devShell LD_LIBRARY_PATH 57e2a7a52a819883f40dada8a2edc24ecf48186b 9b6ea4263ab45e02ff905bf7a29dc143ca1facc3 2024-01-18T23:12:15+01:00 John llama : fix falcon arch for tied output embeddings (#4978) ee8243adaa9a9f51ff449213383874e49efe368f 15ebe59210e7fd9817ff67f51fa1a5ee2d004294 2024-01-13T14:16:11Z makomk server : fix crash with multimodal models without BOS token (#4904) d34633d8db6c2e400355de4862cd699154ecc73f 4f56458d34cb13dcbf69aca650e9bf77d5497e6f 2024-01-10T14:37:09+01:00 John clip : support more quantization types (#4846) 36e5a08b203542dca53cca4eaf172c5dc4bbc991 4dccb38d9abab7f9f2d1f9a6977df4185d490132 2024-01-09T09:59:14-08:00 Justine Tunney llava-cli : don't crash if --image flag is invalid (#4835) 3418c03ecc149fd657527ebb06776239b60a3f3b 63ee677efd92060b14894b984597c62e3742b8da 2024-01-07T08:46:55+01:00 Alex Azarov llama.swiftui : add visionOS target (#4805) 9fbda719de18a9400a064c28759c39d55d687d3e 39d8bc71edcb8b6f99d46fa4216af7a15232e218 2023-12-30T23:24:42+02:00 Georgi Gerganov clip : refactor + bug fixes (#4696) 0235b9b571f3cc7d2b8836409a5404b41ce1379c ce18d727a47f2473ca863a6f78bf3ad480008f72 2023-12-29T18:53:34+02:00 Georgi Gerganov clip : use ggml_backend_buffer_is_host (#4205) ce18d727a47f2473ca863a6f78bf3ad480008f72 91bb39cec7e4dfb9e2293509ef60298a67f0b1b7 2023-12-29T11:52:15-05:00 Steward Garcia clip : enable gpu backend (#4205) b93edd22f55d3e5268263c3edcdae1818505c078 82d6eab224862a7044069fb9211dc4b29124264b 2023-12-29T06:22:10-08:00 Karthik Sethuraman server : allow to generate multimodal embeddings (#4681) 925e5584a058afb612f9c20bc472c130f5d0f891 6123979952385847d8348e295d77d6e01da8aa84 2023-12-23T11:35:55+02:00 Samuel Maynard ci(docker): fix tags in "Build and push docker image (tagged)" (#4603) f31b98489824a86c937fa62ccf5dfd4bb0327b86 2bb98279c5a087d62949972b35cf63ff974ffe6a 2023-12-21T23:56:34-07:00 rhuddleston ci : tag docker image with build number (#4584) 33c9892af58b7b161f2a532935dcccff8c8048c6 8efa0f6ebed53c9453e6721da86fb294e5015909 2023-11-30T23:11:14+01:00 John llava : ShareGPT4V compatibility (vision encoder only loading) (#4172) bd90eca237b498dd106d315dcb9ad3e6fae3906f 3d68f364f15778dc326f5024f2e5af1ad6dfddef 2023-11-13T18:20:52+03:00 M. Yusuf Sarıgöz llava : fix regression for square images in #3613 (#4056) 381efbf480959bb6d1e247a8b0c2328f22e350f8 2833a6f63c1b87c7f4ac574bcf7a15a2f3bf3ede 2023-11-06T22:36:23+01:00 Damian Stewart llava : expose as a shared library for downstream projects (#3613) ca190bca8e844d171020d6147687e71472d71734 71e3718abdb2771b50c9606d3a7569623a0b0afe 2023-11-01T09:28:28Z Adrian Hesketh server : re-enable completion and embedded at the same time (#3876) 34b2a5e1ee4fe6295fb4420eb91131d743694c65 6961c4bd0b5176e10ab03b35394f1e9eab761792 2023-10-26T22:53:37+03:00 Georgi Gerganov server : do not release slot on image input (#3798) 438c2ca83045a00ef244093d27e9ed41a8cb4ea9 9e70cc03229df19ca2d28ce23cc817198f897278 2023-10-22T22:53:08+03:00 Georgi Gerganov server : parallel decoding and multimodal (#3677) f3b25e40438b3c8383caabf4e7b89863145a9f0e 60abea9798f47b918a9f38c66edfd88c526d20f6 2023-10-19T19:40:41+03:00 M. Yusuf Sarıgöz multimodal : add BakLLaVA conversion support (#3682) cb33f43a2a9f5a5a5f8d290dd97c625d9ba97a2f e1675d133c31e1c8de2f06be7164e12c0ba6cf2c 2023-10-17T22:24:50+02:00 slaren fix embeddings when using CUDA (#3657) 940efa95fec0b8a98c226a889d2ad839dfeeae0d 11bff290458f12f020b588792707f76ec658a27a 2023-10-16T23:58:00+03:00 Georgi Gerganov llava : fix tokenization to not add bos between image embeddings and user prompt (#3645) 370359e5baf619f3a8d461023143d1494b1e8fde 9e24cc6e2e589d405bd1720c400f5b0b9d0ca3ee 2023-10-12T18:23:18+03:00 M. Yusuf Sarıgöz examples: support LLaVA v1.5 (multimodal model) (#3436) f5f9121de140eff558f13b5c5e78a3a3b6b94377 11ea5c7d96f2c28e1c99659e08ec0a44574056e2 2023-10-10T09:50:23+02:00 Jan Ploski llm : add MPT support (#3417) a8777ad84e00cda0399e827cdf971e2c3fab1da2 97af49fa395df77e4c18af0e1655b2fee67c9686 2023-10-06T14:16:38+01:00 pudepiedj parallel : add option to load external prompt file (#3416) 0e76a8992c8200237bbc6471a53fb8796b3872f7 2db94d98eda56982d80238840b0652b4137a2a84 2023-09-28T20:40:11+02:00 xaedes train : finetune LORA (#2632) f56c418ab0a635c020bcb5bf44b8f00cb3c9e514 8185710a80531e9ee0c0cb99d3a9c9af1019ab67 2023-09-21T17:57:40+09:00 yuiseki embedding : update README.md (#3224) 4fe09dfe665c58a753dc9eb638dd4dca1cd35488 80291a1d02a07f7f66666fb576c5b1e75aa48b46 2023-09-16T03:02:13+08:00 Meng Zhang llama : add support for StarCoder model architectures (#3187) 980ab41afba96106cd29cdf3aa6f948c251cb71f e394084166baac09e8ee9a08a4686f907f7e5291 2023-09-14T09:47:00-07:00 dylan docker : add gpu image CI builds (#3103) 71d6975559acfd6c8407a4ef8275a9979c737765 b532a69b2fd08067f34f32f37a2fd9b37678a34a 2023-08-30T19:14:53+03:00 Henri Vasserman [Docker] fix tools.sh argument passing. (#2884) 44c117f41ee01c5ac8fb86bba041f08d8b87b46d 43033b7bb4858da4f591715b3babdf906c9b7cbc 2023-08-28T21:51:47+02:00 xaedes train : mem usage and other improvements (#2439) c82742ac9cd96fd34aa961978805c1d8a361d589 28b2c996ca0ab90a5669946084f13443ec98e241 2023-08-25T11:18:48-04:00 Matt Pulver llama : add llama_beam_search() (#2267) 3f460a2b723c8b936ac29ecfd02f244b3adeba55 87e3733f24a85d894cc16e1cbdfa1ea1e81a76f3 2023-08-25T11:55:59+03:00 Georgi Gerganov cuda : add RoPE kernel for mode == 2 (NeoX) (#2760) 95385241a91a616788a3bb76d12c9b7b2379ca2d 335acd2ffd7b04501c6d8773ab9fcee6e7bf8639 2023-08-23T20:33:05+01:00 Olivier Chafik examples : restore the functionality to import llama2.c models (#2685) bac66994cf356cf488078c056831396eb4ce31d5 519c981f8b65ee6c87c2965539685ced0a17223b 2023-08-22T19:14:09+03:00 Kawrakow Quantization imrovements for k_quants (#2707) 519c981f8b65ee6c87c2965539685ced0a17223b 1123f7fbdfb8012e46f05e903e6f675922916378 2023-08-22T16:03:12+02:00 slaren embedding : evaluate prompt in batches (#2713) bbef28218fe827265716b66977719b9ee2b21165 5656d10599bd756dc0f17284e418e704200b43f3 2023-07-11T22:01:08+08:00 LostRuins Possible solution to allow K-quants on models with n_vocab!=32000 (#2148) 7f0e9a775ecc4c6ade271c217f63d6dc93e79eaa b472f3fca558b6335adbd87210ed58cfb5da37cb 2023-07-04T18:33:33-05:00 Nigel Bosch embd-input: Fix input embedding example unsigned int seed (#2105) 7ee76e45afae7f9a7a53e93393accfb5b36684e1 acc111caf93fc6681450924df9f99679c384c59e 2023-07-04T10:05:27-04:00 Tobias Lütke Simple webchat for server (#1998) 698efad5fbbf326f01288649b123eff5f79b417e 14a2cc71f62e45803ae70890ffbdeb0a172e6210 2023-07-04T01:50:12+02:00 Erik Scholz CI: make the brew update temporarily optional. (#2092) cfa0750bc9dbc2d957a91b8ed09ab0035d8f3d4e 9d23589d638dc74577d5ff880e6d4248b795f12e 2023-06-28T23:53:37+08:00 ningshanwutuobang llama : support input embeddings directly (#1910) 20568fe60f00155fa25e92eb3a7f6b911d557967 18b35625c3c19c64b7818a12460ba5ddb006dfdc 2023-06-20T01:12:39+03:00 Henri Vasserman [Fix] Reenable server embedding endpoint (#1937) ca7c3f4da5d144d4cd1dd44903552e6ba49b8ec8 b97ca431db35ec96a339a721acb1219c1dd78bed 2023-06-19T18:14:09+03:00 Kawrakow cuda : faster k-quants on older GPUs (#1930) 794db3e7b982fee37e3995db9c3a216a57ff65e3 5ddf7ea1fb42bac21026de2f77e0f9c069b92234 2023-06-17T07:53:04-04:00 Randall Fitzgerald Server Example Refactor and Improvements (#1570) e32089b2c20b1b87b22912f4a8b93fe01647d5b9 2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343 2023-06-13T21:04:40+02:00 xaedes train : improved training-from-scratch example (#1652) 0e730dd23b0fb5f93dba574e0a48d9a69dc5dbae 3b126f654fceb4f5f195a1c2e825bb18e101188c 2023-05-29T06:45:50+02:00 Jiří Podivín Adding git in container package dependencies (#1621) 6456a4eb9f9c1f4de8f6908ef100daa78802ad00 cdd5350892b1d4e521e930c77341f858fcfcd433 2023-05-13T15:24:20+08:00 Rinne embedding : remove unused code (#1426) b6e7f9b09e9c340ec97a2fae61c1eb8db861f2f9 50cb666b8a2e35a49b08c0f6bc81138c8f6f2ac1 2023-04-22T08:21:32+02:00 xaedes llama : add api for getting/setting the complete state: rng, logits, embedding and kv_cache (#1105) a0c05164168297c04737936ad0cad849a512547a d8d4e865cd481b18f10508ffee35db903767ef5c 2023-04-02T15:13:03-07:00 bsilvereagle Remove torch GPU dependencies from the Docker.full image (#665) e0670260fb50a882b37074112b1881fb0820cf77 28ba975aea1dcae2f31770516f5d542ff177771e 2023-03-28T18:34:35+03:00 Georgi Gerganov gitignore : add "embedding" 4b8efff0e3945090379aa2f897ff125c8f9cdbae 7e5395575a3360598f2565c73c8a2ec0c0abbdb8 2023-03-28T08:11:09+02:00 RJ Adriaansen Add embedding example to Makefile (#540) 03f7e335604b3d68f74995aa2ccb4955833ee423 55ad42af845127bd0eb0c1f36f327ecec83f4bca 2023-03-25T20:51:14+02:00 Georgi Gerganov Cleanup STL headers + fix embedding examples + minor stuff a316a425d04027453dc0fd45f003b647c12f66f9 ecbe466a364876927994e2f1ec14f4d82301d201 2023-03-25T20:26:40+02:00 Georgi Gerganov Overhaul the examples structure 8d4a855c241ecb0f3ddc03447fe56002ebf27a37 b6b268d4415fd3b3e53f22b6619b724d4928f713 2023-03-24T08:05:13-07:00 Luciano Add embedding mode with arg flag. Currently working (#282) 16ffc013c62f22bdaa3cdc022d7a13fd952d73fc 486ae645fd3eda8b9d7413d5ff34fb65a3e337fb 2023-03-21T09:42:25-07:00 comex Importer for GPTQ quantized LLaMA models (#301) 0f1b21cb90ac6b84a9af70cafb8e13b5389e3b32 074bea2eb1f1349a0118239c4152914aecaa1be4 2023-03-20T18:05:20+01:00 Bernat Vadell Docker - Fix publish docker image in GitHub Registry (#235) 5cb63e2493c49bc2c3b9b355696e8dc26cdd0380 da5303c1ea68aa19db829c634f1e10d08d409680 2023-03-20T08:24:11Z Stephan Walter Add tqdm to Python requirements (#293) 2af23d30434a677c6416812eea52ccc0af65119c 904d2a8d6acd667c9633138d45a361d40fbf76d0 2023-03-17T10:47:06+01:00 Bernat Vadell 🚀 Dockerize llamacpp (#132)