Files

419 lines
73 KiB
Plaintext
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
f86112d6758298241ab2fa84ad4f0f7b1ace35c6 d1bc743c10080fed1253686ce01749b42611ded4 2026-05-29T16:40:38+08:00 wangbomeng add dump_pos,fix pos_tensor of pre_by_embeds
f131bf1908b8c5dd1f49d7ae7f616506fc471666 33d96dae28e17208ef61a71dba40cda3c04f135a 2026-05-27T09:38:51+08:00 wangbomeng fix patch of qwen2.5vl,n_patch of minicpm = 64,fix n_ctx_slot,comment out M-ROPE
a43741244a646d3f8fa3ff01bb9b7d059223d0a5 b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 2026-05-15T14:39:53+08:00 wangbomeng run llama-passkey successfully, fix llama-bench, copy 3 times input to infer qwen2.5vl
3b14ed556c15529fe1f94b649f49db7156dfaf67 dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-14T14:34:25+08:00 Yunzhe Jia - Removed references to CALRT from clip.h, mtmd-helper.cpp, mtmd-helper.h, mtmd.cpp, and mtmd.h. - Updated server.cpp to conditionally include CAL-LLM support. - Introduced option LLAMA_SERVER_USE_CAL_LLM in CMakeLists.txt to enable CAL-LLM integration. - Refactored server context to handle CAL-LLM requests and responses. - Updated image processing logic to remove CALRT-specific implementations. - Ensured compatibility with existing llama functionality while integrating new CAL-LLM features.
b2003d6c90ef0fa26ab9e930ba3e22b355eb3d39 7800c772d44a7415640ec1669a691232939927cf 2026-05-13T15:24:24+08:00 wangbomeng try passkey and embedding
7800c772d44a7415640ec1669a691232939927cf dde8b8228081769c8d8f1e0751d47fa7875f8423 2026-05-13T15:23:54+08:00 wangbomeng try passkey and embedding
dde8b8228081769c8d8f1e0751d47fa7875f8423 fabcc7dac4b34d83fe430980bb364b81087c7ee9 2026-05-12T10:46:08+08:00 wangbomeng clip:add minicpm patch;
5eb46fffbd2e260c540fb112314ad67bbb8f56b6 005112c51e00d998b457337ca3dad53fc46e2d0b 2026-04-24T16:24:51+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
005112c51e00d998b457337ca3dad53fc46e2d0b 509670642e8090a1713f5d73590b549be827aaef 2026-04-24T16:24:31+08:00 wangbomeng clip: add image_to_patches; calrt: vision copy data from bf16 to fp32
e24f775ee26ea5249d5ff6cd23b8a0a17fe1438d a206460e610aef995e36e50b33e8bd41fe477541 2026-04-15T10:01:09+08:00 wangbomeng calrt: add copy_data_to_ibuf for vision model
a206460e610aef995e36e50b33e8bd41fe477541 d8b2aaa00049978cebac15041f960d75b552f97b 2026-04-14T10:23:43+08:00 wangbomeng calrt: support mixture of prefill_by_ids and prefill_by_embeds
6dacdd2cf9574214ca272a86674e7bd7ba21c4f0 3e6ad64467771224f072e5bad90e270951ba4cdf 2026-03-23T14:42:28+08:00 wangbomeng calrt: add multimodal
3e6ad64467771224f072e5bad90e270951ba4cdf b37b7d9756feb3dac2db526eeab38b572a095d47 2026-03-23T14:36:41+08:00 wangbomeng calrt: add multimodal
d81d7b190ff5f21325167936496dfe5ab48b922e e492f5dc8cec17529f53ef2bbdf7b502107f8148 1f5accb8d0056e6099cd5b772b1cb787dd590a13 2025-11-04T14:43:32+08:00 Yunzhe Jia Merge branch 'master' into dev
070ff4d5356083d60b807bb34d36b31c3653a29e bf7b0c9725ed0c406c5debaea022ec7258430634 2025-11-03T11:11:18+01:00 Xuan-Son Nguyen mtmd: add --image-min/max-tokens (#16921)
bf7b0c9725ed0c406c5debaea022ec7258430634 fcfce040e816c542f374ad51461b3561d73c4bc9 2025-11-03T10:25:55+01:00 Xuan-Son Nguyen mtmd: pad mask for qwen2.5vl (#16954)
bcfa87622ae46be6345a8e3dfdbdc5ba5414042b a2054e3a8ff0da3978a4acc18c349ff58554d336 2025-11-03T00:41:08+01:00 Sascha Rogmann feat(webui): improve LaTeX rendering with currency detection (#16508)
6b9a52422bac0f50dd8f1f8386744fa3ce9783bf 2f966b8ed87514e74bb96592217226cb6a6974dd 2025-11-02T13:08:04-08:00 Zhiyong Wang model: add Janus Pro for image understanding (#16906)
2f966b8ed87514e74bb96592217226cb6a6974dd cd5e3b57541ecc52421130742f4d89acbcf77cd4 2025-11-02T22:21:48+02:00 Georgi Gerganov clip : use FA (#16837)
cf659bbb8ef9eb048e5153a27cf787fd83c05560 d8b860a219c2415faac8cc0e50b48b4aa11e3b64 2025-11-01T15:51:36+01:00 Xuan-Son Nguyen mtmd: refactor preprocessing + support max/min pixels (#16878)
d261223d24e97f2df50220e4a5b7f0adb69bba81 dcca0d3ab840ebe9b2ccd4719033d408eeb758d7 2025-10-30T23:19:14+08:00 JJJYmmm model: add support for qwen3vl series (#16780)
bacddc049a00786df44e682262f6e298742bfbc3 229bf686287d18f82c44e89888cc662145ecfdb4 2025-10-30T07:18:50-04:00 Tianyue-Zhao model: Add support for CogVLM model (#15002)
144a4ce824b6bd0e48d62009d10cae1daf5308db f549b0007dbdd683215820f7229ce180a12b191d 2025-10-29T14:09:50+01:00 Sigbjørn Skjæret vendor : sync minja (#16500)
1c1409e13169d0ced4b1b4d39fb5b268b7525091 7a0e900e3615fa46c074a7fdf900b47d3c0a1c7e 2025-10-28T03:51:41-07:00 Sam Malayek embedding: add raw option for --embd-output-format (#16541)
10640e31aab0819f31c1e1f2d008b019ee737232 80d28f104c0c3e61c11d6af073642b246a9fc19c 2025-10-27T21:50:22+01:00 Acly ggml : fix interpolate with align-corners and ne=1 (#16700)
06332e28672356b964d6dfc2ba4657e20581cd43 72d53e6c4decee8b339e49aed8cc0e234b9639dc 2025-10-20T16:27:09+08:00 takuya kodama llama-batch: fix build fails with `-Werror=missing-braces` (#16614)
7062dd8460685d6700ed7621e50a22c6f3400ca3 0398752dd450dfabdd1b9e289f6364c2600f6ab5 2025-10-20T15:44:21+08:00 takuya kodama llama-context: only warn on pooling_type when user specified (#16674)
0398752dd450dfabdd1b9e289f6364c2600f6ab5 4f73d0a95120687e2c527739f771330a5271259a 2025-10-19T23:54:31+02:00 Giuseppe Scrivano model : add Granite Hybrid types (#16635)
e38b7c6e9e4453e3b3e96d76e38bc2ccb6bce458 5016b7286240d29f8f640039989b84ea3a854344 2025-10-13T22:42:37+03:00 Georgi Gerganov graph : support cacheless embeddings with FA and iSWA (#16528)
4b2dae383df708e2afc49c4859a81cd074f5ac10 41aac5c69b5fb281bc1f486afb053f78101bb39e 2025-10-12T09:29:13+03:00 Georgi Gerganov common : update presets (#16504)
e60f01d941bc5b7fae62dd57fee4cec76ec0ea6e 81086cd6a3ca1252f0dc0f938171648399179c53 2025-10-10T22:15:05+03:00 Georgi Gerganov server : fix division by zero when reporting stats (#16501)
56b4795842d852152222ca7a2d4304008facf1b9 2c0d875ae6c6043fbbafd2831e160955e9ca6af1 2025-10-09T14:35:22+02:00 Daniel Bevenius model-conversion : add support for SentenceTransformers (#16387)
e08db4259521de493b7aeb49dadf29ebd1ee966a 12bbc3fa50b6df03318a4451c9a2210200a0b28d 2025-10-09T08:39:18+02:00 Saba Fallah model: EmbeddingGemma Adding Support for SentenceTransformers Dense Modules (#16367)
b2c08c9ec4cd59ed88c1ebdd94f109af5ccc978e 7fdd16b432d247121fe5fe7b21f8805f85266c85 2025-10-08T10:57:53+03:00 Georgi Gerganov metal : mark FA blocks (#16372)
74b8fc17f92ada295a648e3c5eb28f46bca7d892 aeaf8a36f06b5810f5ae4bbefe26edb33925cf5e 2025-10-07T13:48:56-07:00 Reese Levine ggml webgpu: profiling, CI updates, reworking of command submission (#16452)
ef4c5b87ea2556ff8ca99cca3abdf48bdbca22f2 c61ae20d05bd4fdd8551311325a2845336449426 2025-10-07T10:32:32+03:00 Georgi Gerganov presets : fix pooling param for embedding models (#16455)
1d6092fc72f4d10f4486ac95edfd414bc08b62b8 8ae32dc9ecd7aeebf3a5b43557e0552a0a04cd4f 2025-10-07T08:22:35+03:00 Georgi Gerganov tests : add -INF blocks to the KQ mask in the FA tests (#16380)
c08002a1988348403a5fd59b1fa3de3a10a6f92f 3a002afafa8e06555f11aed88b02d055d8a166f3 2025-10-06T10:59:40-06:00 Gabe Goodhart chat : Granite Docling stopping (#16438)
ca71fb9b368e3db96e028f80c4c9df6b6b370edd 35266573b968e1c947b367782fb4b3eddbb4f3c0 2025-10-05T06:57:47-06:00 Gabe Goodhart model : Granite docling + Idefics3 preprocessing (SmolVLM) (#16206)
e29acf74fea996014380d59d31aa504ae8964258 128d522c04286e019666bd6ee4d18e3fbf8772e2 2025-10-04T11:42:56+02:00 Acly vulkan : incremental shader builds (#16341)
ad126479c25cf983a0f994a08ba0911cf49ed62b 77233277c912d495d1069543ca540c21a2f9e5b4 2025-10-03T11:45:16+02:00 Daniel Bevenius ci : change macos-13 to macos-15-intel (#16401)
e74c92e84236b2bab3f3c77bee4ead94928be360 b2ba81dbe07b6dbea9c96b13346c66973dede32c 2025-09-30T16:24:36-04:00 Bartowski model : support GLM 4.6 (make a few NextN/MTP tensors not required) (#16359)
0124ac989f7e7bf08803788f66dbe4106bdcdd58 2811c65286ae954bec87049f75b86dc022006dcc 2025-09-28T19:25:58+08:00 Aaron Teo devops: switch to using ubuntu-22.04-s390x image (#16302)
72b24d96c6888c609d562779a23787304ae4609c 624207e676ab5eb3ce7af631902bb45fb73a8359 2025-09-27T02:58:29+05:30 Vinkal model : make minicpm embedding_scale, residual_scale and logit_scale optional with legacy defaults (#16273)
624207e676ab5eb3ce7af631902bb45fb73a8359 807e8c6d310952f2f5656afc63dab9d7083dcb5c 2025-09-27T02:03:33+08:00 Aaron Teo devops: add s390x & ppc64le CI (#15925)
00217cd41388328c93e9e9644921c4319bb03bcc 3b337b01a1a85c2f5b49376e8c0bbdb3f521528e 2025-09-26T13:19:23+03:00 Radoslav Gerganov ci : create git tags for released docker images (#16008)
aa3ee0eb0b80efca126cedf9bcb4fb5864b46ce3 d0991da39d3c39b3980c24cdfccb9a4c95a46870 2025-09-25T12:02:36+02:00 Daniel Bevenius model-conversion : add embedding prompt file support (#15871)
4b9f4cb0f89a88de4bdf97727d0457b0c648804c 85e72271ba1ce78adf34fd8997803c991e617ca6 2025-09-23T13:59:34+08:00 Aaron Teo devops: add s390x containers (#15915)
c6db9a10278f40b4b8d3f6931728f2cce2356daa d05affbab7d1364fa7ac06c03cd33f03235ae840 2025-09-22T10:49:58+02:00 GideonSerf embedding : fix typos in README (#16171)
3913f8730ec6d6245480affc30ae3049107956f4 76888d202ed2b835ae19ea9f9db6baf39e419297 2025-09-16T15:25:57+02:00 Daniel Bevenius ggml : fix padding in timestep embedding kernels (#15932)
dc381aa9a6dc45f00673471d34b8bddd30e77570 10d197409bd9537ff302ad09966fe406882fef9d 2025-09-15T14:38:52-07:00 Diego Devesa docker : enable rocWMMA in ROCm images, add gfx1151 (#15997)
b8e09f08b9a91c0401bc67d17a17c90756420346 6c019cb04e86e2dacfe62ce7666c64e9717dde1f 2025-09-14T23:00:59+02:00 Sigbjørn Skjæret model : add grok-2 support (#15539)
9de447d94e1ae9d1a36e5a2e5bf47483352c0d9c 0f0a3c2851134d49955f3c85afbb0b1bb47c3e07 2025-09-10T17:31:40+02:00 Daniel Bevenius ggml-cpu : fix padding in ggml_timestep_embedding (#15917)
e7b6d83b524bbc24a1343d862de6dba8e8eddbd6 2cfef4d117d67ab1dec002915b48a15d11ee1973 2025-09-10T14:17:09+02:00 Daniel Bevenius tests : filter out no-ops from coverage report (#15900)
70cd37dbbebdb7a2f84f08207f18eabb0b291a55 acc1b008cfd95e63d5f99a370dbffb98e5a99d2c 2025-09-09T06:06:52+02:00 Daniel Bevenius requirements : update transformers/torch for Embedding Gemma (#15828)
233d773d02c37982badddf3994e9953a175f34da a885dcff11a7b73f9377812d6151f6b15d307de0 2025-09-08T09:44:34+02:00 Daniel Bevenius convert : force setting sliding_window from original config (#15867)
5d6688de08e73acc2532d668380801ed79d704eb 4fd1242bef6cb2325b4ff1c1a80f3b54b64508a6 2025-09-05T04:36:23+02:00 Daniel Bevenius model-conversion : add --embeddings flag to modelcard.template [no ci] (#15801)
fb15d649ed14ab447eeab911e0c9d21e35fb243e 856ed0947f27b4ec3ad269fceda0402fbab263d3 2025-09-04T18:10:29+02:00 Daniel Bevenius llama : add support for EmbeddingGemma 300m (#15798)
d1e2adba65208d6de3d7f6f23b00c562ff5bb777 c1c354e44c06d259679bb5bb7a8fa9f0b28480e4 2025-09-04T15:40:44+02:00 Daniel Bevenius llama : set n_outputs to 1 to avoid 0 outputs mean-pooling (#15791)
661ae31c9c68201577e70278285b349a5a662caf 407c23786dd0d3a503e9429eead96e611d3950c9 2025-09-03T19:59:16+02:00 Oliver Simons CUDA: Optimize `rms_norm_f32` kernel and its fused variants, giving 1-6% perf E2E (#15715)
40a751ea9a94364da73537b86502a808ebe1fc3a 5eae9348835037046f33fafd852df7c952c95209 2025-09-03T12:50:47+02:00 Daniel Bevenius model-conversion : remove hardcoded /bin/bash shebangs [no ci] (#15765)
8c3fdf44ecf08335942f2ba558955f55e88c7991 f6da8cb86a28f0319b40d9d2a957a26a7d875f8c 2025-09-03T09:48:35+02:00 Daniel Bevenius model-conversion : add missing curl script [no ci] (#15761)
84ab83cc0b4b7e769451ee48e4c7d1acef91ef25 55042b3692cb1467c9ee15c62c4a9fbf180f89e3 2025-08-28T15:49:50+02:00 Sigbjørn Skjæret model : jina-embeddings-v3 support (#13693)
46d9caa27a0281150e8cf082308c0f9e7576ebe5 5a0e3ef6f00c658fbae53797f02d5a360ebf8fec 2025-08-28T09:26:48+02:00 Daniel Bevenius model-conversion : add mmproj conversion target (#15628)
62cef26ac5b6b7acb635d3dc963813b43952dc2b 8f5afa94c4f929da71f560db7c9f38ef6a783d95 2025-08-26T16:12:29+02:00 Daniel Bevenius model-conversion : add qat-q4 quantization targets (#15588)
79a546220c719e6a70627b243a478ab8d84dc9e1 85cc1ae998e4898d9fa992cb9b8620338cee97bf 2025-08-26T12:54:19+02:00 Xuan-Son Nguyen mtmd : support Kimi VL model (#15458)
c4e9239064a564de7b94ee2b401ae907235a8fca 39842a7f73012eb42816ca4f26411782bd3da7c5 2025-08-26T16:05:55+08:00 tc-mb model : support MiniCPM-V 4.5 (#15575)
dfd9b5f6c7586c88588f06a644c131bec071a0a1 5a6bc6b1a6cb665a944426c2055794950e524bf5 2025-08-25T15:00:43+02:00 Daniel Bevenius model-conversion : set pooling type to none in logits.cpp (#15564)
5a6bc6b1a6cb665a944426c2055794950e524bf5 6b64f74b55628e4193f4fb00313f07dbd8556528 2025-08-25T14:25:25+02:00 Daniel Bevenius model-conversion : add model card template for embeddings [no ci] (#15557)
330c3d2d21b55bca5517db7d2eea2ea8f131df4a e92734d51bcb82cc35f0a6b5a14928f0036b2c90 2025-08-23T01:31:54-05:00 Jeff Bolz vulkan: optimize mul_mat_id loading row ids into shared memory (#15427)
4afb0a746f22abaa545b3ebdb76a400d7da3a713 e288693669cf9d0a71e2f2b8bd57305f06340257 2025-08-22T08:10:14Z 65a server : Support multimodal completion and embeddings prompts in JSON format (#15108)
e288693669cf9d0a71e2f2b8bd57305f06340257 a0f98dd604d34826eb5ea2560d1e23fe726921df 2025-08-22T09:29:08+02:00 Tarek Dakhran readme : model : mtdm : lfm2 improvements (#15476)
2758fa10dab0556e6c3f130e664750fd6773dc7c b108e429043ee5c9fc8fa4957a0a52c3e490d5c9 2025-08-21T12:16:54+02:00 Daniel Bevenius examples : add model conversion tool/example (#15455)
b108e429043ee5c9fc8fa4957a0a52c3e490d5c9 245be739df942861ddc52331b095b40f18e2a3f1 2025-08-21T05:06:46-05:00 Michael Giba ci : fix -Werror=return-type in clip.cpp so ci/run.sh can run without issue (#15221)
f08c4c0d8d0cb6caaf8b7ad316039232b9fa059c 6d7f1117e3e3285d0c5c11b5ebb0439e27920082 2025-08-18T22:53:52+02:00 Xuan-Son Nguyen mtmd : clean up clip_n_output_tokens (#15391)
f44f7931729022c57319a0124931120a169e0da9 ae532eac2c1df1d8edc3d2719145895b966de1bf 2025-08-18T03:23:56-04:00 compilade ggml-quants : fix make_qp_quants NANs and IQ1 assertion errors (#15379)
65349f26f2299e06477ec8e85e46243046801358 1fe00296f587dfca0957e006d146f5875b61e43d 2025-08-16T23:33:54+02:00 Tarek Dakhran model : support vision LiquidAI LFM2-VL family (#15347)
cf9e5648a7ae02f7728fefcbcfd2979d83c96e8f fba5c0d680b555cbac563fef57b33bc5c9621e08 2025-08-11T22:12:12+08:00 rainred mtmd : Fix MinicpmV model converter and clip to avoid using hardcode. (#14750)
36d3f00e142696f708ab297b9f8f1c825594712d 5fd160bbd9d70b94b5b11b0001fd7f477005e4a0 2025-08-07T05:31:48+02:00 Daniel Bevenius requirements : fix PyTorch uint64 compatibility (#15134)
ef0144c087b33e5b8da42d529ac71aaf05cb49df 2721257e3e2c4c944ac8a08221113ee7cb503f1b 2025-08-05T04:29:25+10:00 Sam model: support GLM 4.5 family of models (#14939)
711d5e6fe66eb6cd7a10d71cec4567321848be08 f738989dcb9ccbe468c945553eafbeef7b869675 2025-08-02T05:51:02-05:00 Douglas Hanley convert : fix Qwen3-Embedding pre-tokenizer hash (#15030)
339bd0268c498c89529cd0e90c44883c211e3745 f906275537d14c8fc7c6976d944233771fd6672c 2025-08-02T03:44:50-05:00 Douglas Hanley model : support Qwen3-Embedding (#15023)
952a47f455fbd92e2659b98b9b6317a2dafeb532 36e5fe7bcd6640f4ff974d4c5cb04a13b5b29bce 2025-07-31T23:22:17+08:00 tc-mb mtmd : support MiniCPM-V 4.0 (#14983)
41e78c567e9a8c652e405f4f909deb598deecd31 ad4a700117d1746799d2d6599e526e2c3a7938d2 2025-07-30T18:07:11+02:00 Daniel Bevenius server : add support for `embd_normalize` parameter (#14964)
00131d6eaf4df029e1ec84de868c2c5957503007 1e15bfd42c3938506e0da5939bf7f42780965f01 2025-07-30T15:12:02+03:00 Georgi Gerganov tests : update for LLAMA_SET_ROWS=1 (#14961)
a118d80233d3bf92569c051346fd2638f87bf202 61550f8231dc0aa478e2f537c5009ede6878ce22 2025-07-30T00:25:05-05:00 Douglas Hanley embeddings: fix extraction of CLS pooling results (#14927)
749e0d27f0247337869f4698f59dd7fafba94326 64bf1c3744053cf7def10aeed21ff48883ee755b 2025-07-25T19:08:04+08:00 kiwi mtmd : fix 32-bit narrowing issue in export-lora and mtmd clip (#14503)
3f4fc97f1d745f1d5d3c853949503136d419e6de 2df255da3cea108de0ae9b302ffdd31674b6d88d 2025-07-25T03:05:37+08:00 R0CKSTAR musa: upgrade musa sdk to rc4.2.0 (#14498)
86f5623d904cfd392fdeb14a143097b4074660f6 39cffdf18855e0d2beba62572542251d87421e73 2025-07-24T17:50:51+08:00 yummy llama : fix MiniCPM inference after Granite Four changes (#14850)
c8ade30036139e32108fee53d8b7164dbfda4bee e28c0b80c249b5618c3a0d5e960f63929f380ac9 2025-07-22T12:51:03+02:00 stduhpf Mtmd: add a way to select device for vision encoder (#14236)
b526ad2668944a7b2b1721f60679153646313831 938b785764683c298e7805e712f8728489cc2f18 2025-07-20T23:55:32+07:00 rspOverflow Documentation: Further revisions to the Vulkan section in build.md (#14785)
21c021745d781edf9c44b4972ef6cbbf53b0ecff b0f0ecc3dce806c68609d375a2b3edc430d8db18 2025-07-16T08:18:51-07:00 Reese Levine ggml: Add initial WebGPU backend (#14521)
68e37a61a7b24863f67541db65b4f6195962a268 cbc68be51d88b1d5531643b926a4b359c3cff131 2025-07-16T01:11:42+09:00 Shunta Saito model : add PLaMo-2 support (#14560)
0c1df14b5f8d992805cb22d0b77b44092a18aeab b3ad3a0191994d6c47b2bd389d5c7431526ecd2c 2025-07-12T06:21:02-04:00 Douglas Hanley server : fix pooled embedding output (#14645)
0aedae00e6fb48680324a5ac5da9cba0e35de6b5 6bdda13981d6c8189b7dc4f9fb8ecb91c21529f8 2025-07-10T18:20:13-06:00 Gabe Goodhart model : Granite Four (#13550)
4a5686da22057867c23bd4a6be941ddc8c51e585 98bab638fb28cf95a5a66dd2d51b40d6c8f6d69a 2025-07-09T14:59:57-04:00 compilade llama : support Jamba hybrid Transformer-Mamba models (#7531)
8f22dc0a53338c629c1ef8fa878d8e39bfe627c9 53903ae6fa5f1caf187889c839cdd1ad25da4018 2025-07-08T10:24:06+02:00 Xuan-Son Nguyen model : add hunyuan moe (#14425)
e1a7059053a9b8958f2d57a21fc46dbc7fb24f8e 12f55c302b35cfe900b84c5fe67c262026af9c44 2025-07-07T23:35:35+02:00 Sigbjørn Skjæret llama : fix incorrect minicpm3 v_states shape (#14571)
1b2aaf28acd632b79bc3b07acb5dad877dc7dbb1 343b6e94b61674ac94e64ede7b7ea3365793f7ed 2025-07-01T15:44:11+02:00 Grzegorz Grasza Add Vulkan images to docker.md (#14472)
c839a2da1a0d4275c3a98f70c3a7627487573a46 e9b6350e61d592634263a14b3d77ecbf6c1fb096 2025-06-30T17:48:24+08:00 xiaobing318 cmake : Remove redundant include path in CMakeLists.txt (#14452)
8f52c6f8abb2ed9ad967cc0bfb90acb073011193 d2f325130c4ed77a3dcff2c23a926587fb08e2cc 2025-06-26T15:10:45+08:00 Yunzhe Jia Squashed commit of the following:
5d5c066de8a3d2cb32f04c4d5ad1560945f30bf3 40bfa04c95c19fb42bafd4e21b5c2a7771846801 2025-06-22T21:44:57+09:00 yuiseki mtmd : fix Pixtral OOM with large images by capping image_size to 1024 (#14326)
aa0ef5c578eef4c2adc7be1282f21bab5f3e8d26 bb16041caef45cd4348cd6f84906b5dfec7a1f6a 2025-06-21T18:12:05+02:00 Sigbjørn Skjæret gguf-py : fix Qwen3-Embedding eos token (#14314)
edc4a29effe716956fdfd2bc5b9cba2a6d8492f8 ed3290ab34493fd3d2e0f925f816a401da4f2dfd 2025-06-19T00:08:14-05:00 Gabe Goodhart memory : Hybrid recurrent cache (#13979)
89fea80d298184d1cd93564f48e060d9f541f4b4 6adc3c3ebc029af058ac950a8e2a825fdf18ecc6 2025-06-16T22:33:27+03:00 Georgi Gerganov server : fix incorrect usage of llama_get_embeddings() (#14225)
d3e64b9f490cee41b7b9aa275dae2f6568ae3054 3ba0d843c6bd3faea5cf5e53dc7f3c82be20bffb 2025-06-16T14:14:00+03:00 Georgi Gerganov llama : rework embeddings logic (#14208)
40643edb86eb10b471b0f57d4f3f7eb0e06a0df7 3cfbbdb44e08fd19429fed6cc85b982a91f0efd5 2025-06-13T17:32:56+01:00 Svetlozar Georgiev sycl: fix docker image (#14144)
26ff3685bfbaa4c8838d7afd988b17dd5eb99f92 60c666347becacff81cd4bc9a52038ba71038e41 2025-06-13T15:17:53+02:00 ddpasa docs : Update multimodal.md (#14122)
2c90da4c7ec694797f524042aaafbb047a7e65ff ec9e0301fef6476df83e94842c3b625501c95566 2025-05-30T16:31:48+08:00 zhangkaihuo llama : use llm_build_granite for minicpm (#13911)
c962ae3382a1e759c8517a229549ee53685313a1 a3938fb53d0b5183db4f5a6db21fd9122a0e4780 2025-05-28T22:33:54+08:00 Sky server: fix remove 'image_url'/'input_audio' json-object effectlly for 'llama_params' in multimodal-model-mode (#13853)
26b79b6cb3e7840ff15729350e95907e19f9f480 1e8659e65ad0f640674d2785d02b556ab938728c 2025-05-28T10:05:54+02:00 Xuan-Son Nguyen convert : fix tensor naming conflict for llama 4 vision (#13836)
bc583e3c63c04a11d287c108ea9e6a515ead0423 72b090da2c50e540143fd312a2f9aa5f151e6136 2025-05-27T14:06:10+02:00 Xuan-Son Nguyen mtmd : support Qwen 2.5 Omni (input audio+vision, no audio output) (#13784)
79c137f77677b3c8ee3c60a7da033721b938399a 22229314fc46b2f741bb21b12cde71f6c6a60b52 2025-05-26T14:03:54+03:00 Georgi Gerganov examples : allow extracting embeddings from decoder contexts (#13797)
40aaa8a403df5dcfb515eb2fd7a817fd99779526 a08c1d2845dc279d58d826ef3c3ecad97cbbcef7 2025-05-25T14:06:32+02:00 Xuan-Son Nguyen mtmd : add support for Qwen2-Audio and SeaLLM-Audio (#13760)
a08c1d2845dc279d58d826ef3c3ecad97cbbcef7 d785f9c1fd1a1929c6d0e2a0b12cae5db867908b 2025-05-25T14:04:49+02:00 ddpasa docs : add Moondream2 pre-quantized link (#13745)
4032ca406632212b075e3c61c2a4476128321410 515fdbf7ed839dfe6a24aeb6225936609a7f6d6d 2025-05-25T10:29:43+02:00 Piotr Jasiukajtis llama : add support for Qwen3 MoE tied word embeddings (#13768)
cc74d5be990e37f201591fd868a92e64abdbf902 5be24af73d77ea23d399726f1d2a01a70ee86331 2025-05-22T16:33:39+03:00 Georgi Gerganov server : pad small embedding batches (#13692)
92ecdcc06a4c405a415bcaa0cb772bc560aa23b1 f71f40a2847d4c9f57b86cd206e0a27b2bfb6d1c 2025-05-19T13:04:14+02:00 Xuan-Son Nguyen mtmd : add vision support for llama 4 (#13282)
3cc1f1f1d24472a6558c942b1c78989ff4b0e569 c753d7bed0dc2cc2d5c42dfa9806cba91748392e 2025-05-15T14:24:50+02:00 Xuan-Son Nguyen webui : handle PDF input (as text or image) + convert pasted long content to file (#13562)
d486dd3e8ecfba0170f8632a1530540de560f4a3 21ca987fba504d273ea28ebc4d3e5b3736a11c8e 2025-05-14T10:07:31+02:00 Luca Stefani webui: Allow pasting file from clipboard (#13526)
21ca987fba504d273ea28ebc4d3e5b3736a11c8e be1d4a13db26750fac702ceb3af88ae4f39dc9f4 2025-05-14T09:59:12+02:00 ddpasa docs: Update link to ggml-org in multimodal.md (#13513)
71bdbdb58757d508557e6d8b387f666cdfb25c5e f0995d28ce3d15095b6845d94ce4465e46575873 2025-05-13T17:07:21+02:00 Xuan-Son Nguyen clip : clip.h become private API (⚠️ breaking change) (#13510)
b4726345aca49e2ad62d615e6e370b3dbad6434f bf7937112058f2815fc3825a9ff7b536ecafa3bb 2025-05-13T15:33:58+02:00 Xuan-Son Nguyen mtmd : remove libllava, remove clip-quantize-cli (⚠️ breaking change) (#13460)
de4c07f93783a1a96456a44dc16b9db538ee1618 10d2af0eaa0aafd7c6577b279dfa5221ff44a63f 2025-05-12T15:06:51+02:00 Xuan-Son Nguyen clip : cap max image size 1024 for qwen vl model (#13478)
3eac209319a6726fd9687c6188fc6b916b65953d a634d75d1bb4034b8c945042ceea268b5b895730 2025-05-11T11:35:52+02:00 City mtmd : support InternVL 3 38B and 78B mmproj (#13443)
15e6125a397f6086c1dfdf7584acdb7c730313dc 3b24d26c22b9d92b5aa39930988700c84e524cf4 2025-05-10T19:57:54+02:00 Xuan-Son Nguyen mtmd : add hard limit on image resolution for qwen2vl / qwen2.5vl (#13434)
33eff4024084d1f0c8441b79f7208a52fad79858 17512a94d636c4b6c1332370acb3e5af3ca70918 2025-05-09T19:29:37+02:00 Xuan-Son Nguyen server : vision support via libmtmd (#12898)
d9c4accaff30926e8a5fd8a2429e549158a845e0 15e03282bb432631193464100c2237a3b6bcfe4c 2025-05-09T09:06:37+02:00 Xuan-Son Nguyen server : (webui) rename has_multimodal --> modalities (#13393)
f05a6d71a0f3dbf0730b56a1abbad41c0f42e63d ee01d71e585f4a17ae83ec55d77acfdcf0bfa798 2025-05-08T14:25:39-04:00 Matt Clayton mtmd : Expose helper_decode_image_chunk (#13366)
8c83449cb780c201839653812681c3a4cf17feed 1a844be132dbe865358e1de81136920c1d35ac73 2025-05-08T15:37:29+02:00 Xuan-Son Nguyen server : (webui) revamp the input area, plus many small UI improvements (#13365)
6562e5a4d6c58326dcd79002ea396d4141f1b18e 51fb96b1ff2e1cc98b2492a012b7d93531a6a9a8 2025-05-08T14:28:33+03:00 Georgi Gerganov context : allow cache-less context for embeddings (#13108)
814f795e063c257f33b921eab4073484238a151a d879433824ac3c16b3b5f00075895d0ee9688e34 2025-05-07T16:36:33+02:00 Diego Devesa docker : disable arm64 and intel images (#13356)
6c7fd67b647a76846d1691cd181011dff4549d02 141a908a59bbc68ceae3bf090b850e33322a2ca9 2025-05-07T15:23:11+08:00 piDack llama : support tie embedding for chatglm models (#13328)
32916a49072f01c43e20df374af5f8a1f70d6963 ffc727203af1061fdeb49efef30f76171722e403 2025-05-06T22:40:24+02:00 Xuan-Son Nguyen clip : refactor graph builder (#13321)
5215b91e9377ce23e4ccc92ec3156bf5c7f892a3 ae803bfc3d0fc2d0d3e1cce22ee103a30939e104 2025-05-05T12:54:44+02:00 Xuan-Son Nguyen clip : fix confused naming ffn_up and ffn_down (#13290)
27aa2595321c4d9cc4086a8e67bdea204b8309b0 9fdfcdaeddd1ef57c6d041b89cd8fb7048a0f028 2025-05-04T23:43:42+02:00 Xuan-Son Nguyen mtmd : add C public API (#13184)
36667c8edcded08063ed51c7d57e9e086bbfc903 3bf785f3efa89ed28294fbf73054558a2b034bfb 2025-05-03T20:07:54+02:00 Xuan-Son Nguyen clip : revert the change of BOI/EOI token for GLM-edge (⚠️ breaking change) (#13259)
2f567611c0234bbca0a4009762acb47b56866095 7d2123484e6ba8fcd90fff8c01661b9dbbefdc9d 2025-05-02T11:42:30-04:00 Jared Van Bortel llama-model : support Qwen2 embedding models and pooling_mode_lasttoken (#13245)
7d2123484e6ba8fcd90fff8c01661b9dbbefdc9d 074e42ab31de4c99aa7d9d2d239660f64b2380d6 2025-05-02T11:41:54-04:00 Jared Van Bortel convert : use correct context length for nomic-embed-text-v2 (#13216)
074e42ab31de4c99aa7d9d2d239660f64b2380d6 c642bc014c105728ce45015813351dc5a37f60a2 2025-05-02T17:17:15+02:00 Xuan-Son Nguyen convert : converting mmproj for Qwen2/2.5VL from convert_hf_to_gguf (#13209)
e84773ab604fe0d935d03741df003716398dc57b fab647e8842c5f80da7e8f2c625dab6a0e19e5d4 2025-05-02T14:20:27+06:00 Shakil Ahmed mtmd-cli : fix out_of_range when input image path is empty (#13244)
b6e4ff69b8abd509647b531bd5b4e86950204f66 e0f572c8466e70d35cbd70ee536ad8fc83b2acac 2025-05-01T21:32:21+02:00 Loïc Carrère clip : (minicpmv) Re-enable upscaling of images smaller than the CLIP image size (#13237)
b5769d92b4510c77691ad9e3f8b643c2ba202e53 8936784f7a1ec4f91637d04b77fdc90ec36ebac9 2025-04-29T15:47:55+02:00 Daniel Bevenius ggml : suppress Windows compiler warnings (whisper/3075)
8936784f7a1ec4f91637d04b77fdc90ec36ebac9 13c9a3319b65469e883c49dd1c478abedc410157 2025-05-01T17:05:42+02:00 Xuan-Son Nguyen mtmd : add **vision** support for Mistral Small 3.1 (#13231)
a70183eb0079fdf6ebeaed12966338a039461b5d 8d33d740c308fe0049515668aac0e561269afe9e 2025-05-01T03:09:41-04:00 Jared Van Bortel llama-model : fix the reported size class for nomic-embed-text-v2-moe (#13223)
3e168bede4d27b35656ab8026015b87659ecbec2 ceda28ef8e310a8dee60bf275077a3eedae8e36c 2025-04-30T16:56:24+02:00 Xuan-Son Nguyen convert : improve model arch handling (#13122)
07c2e2f76cce9a61c110b6995fbb90ccea2c3aaa 44cd8d91ff2c9e4a0f2e3151f8d6f04c928e2571 2025-04-30T13:06:15+02:00 Xuan-Son Nguyen convert : correct typo image_mean --> image_std (#13208)
00e3e5a194e88e604e7c91391b9e90332888fd72 e98b3692be4cd8fbbd9a56fbacc2f2bf0bf26a68 2025-04-29T11:47:04+02:00 Xuan-Son Nguyen mtmd : add qwen2vl and qwen2.5vl (#13141)
5f5e39e1ba5dbea814e41f2a15e035d749a520bc eaea3253244dc4bbe07f6cd81325847ccc6cf93e 2025-04-28T15:52:15-04:00 AT model : Nomic Embed Text V2 with Mixture-of-Experts (MoE) architecture (#12466)
eaea3253244dc4bbe07f6cd81325847ccc6cf93e 43ddab6eeeaab5a04fe5a364af0bafb0e4d35065 2025-04-28T21:23:19+02:00 Xuan-Son Nguyen clip : fix model size display (#13153)
5fa9e63be82225fb3249c76f39ddda3e5bdec0a3 a4c340f974f9b7ac0c1aae897aabaa54549a97e5 2025-04-28T12:18:59+02:00 Xuan-Son Nguyen clip : refactor set input for cgraph + fix qwen2.5vl input (#13136)
59e991c23cc44cb5fb657e7b9358cac21fb79828 ca2bb89eac2097ab4620448737e58af8452e444b 2025-04-27T18:43:37+08:00 LostRuins Concedo Fixes Qwen2.5VL segfault during inference with https://github.com/ggml-org/llama.cpp/pull/12402 as has_qwen2vl_merger migration was incomplete (#13133)
ca2bb89eac2097ab4620448737e58af8452e444b 2d451c80590b9ac250322769ac13d3b4870dbcf7 2025-04-27T16:10:34+08:00 HimariO clip : Add Qwen2.5VL support (#12402)
4753791e70acd4d4e02f2098f14a03df26c992bd 77d5e9a76a7b4a8a7c5bf9cf6ebef91860123cba 2025-04-26T22:39:47+02:00 Xuan-Son Nguyen clip : improve projector naming (#13118)
edb18b6e8f5ea6509ad43057f8bb98fc557dbc4e 514c45608f93f66106a712dee1abe062099ce790 2025-04-25T14:31:42+02:00 Xuan-Son Nguyen clip : fix pixtral on some GPU backends (#13097)
13be08daf992c89d5169518229b3740041c0f419 226251ed56b85190e18a1cca963c45b888f4953c 2025-04-24T22:17:04+02:00 Xuan-Son Nguyen clip : remove boi/eoi embeddings for GLM-edge model (#13081)
226251ed56b85190e18a1cca963c45b888f4953c 87616f0680947800ecba3e9f6bc6e101943bf8e6 2025-04-24T22:29:22+03:00 Georgi Gerganov embeddings : fix batch sizes (#13076)
56304069599f4dd9749d94b9bca2c2c65bb27c02 ecda2ec4b347031a9b8a89ee2efc664ce63f599c 2025-04-24T02:32:35+05:00 pl752 llama-mtmd-cli: Sigint rework in mtmd vision example (#13080)
ecda2ec4b347031a9b8a89ee2efc664ce63f599c eb1776b15a32d832f1266deeeab75b9d255c5849 2025-04-23T20:21:59+02:00 Xuan-Son Nguyen mtmd : Support Pixtral 12B (#13065)
84a9bf2fc2875205f0806fbbfbb66dc67204094c 2016f07bd106c73699ecbaace80f55db5ed95dac 2025-04-21T15:32:58+02:00 Xuan-Son Nguyen mtmd : merge llava, gemma3 and minicpmv CLI into single `llama-mtmd-cli` (#13012)
2016f07bd106c73699ecbaace80f55db5ed95dac 6602304814e679cc8c162bb760a034aceb4f8965 2025-04-20T23:29:36+02:00 Xuan-Son Nguyen convert : experimental support for `--mmproj` flag (#13023)
6602304814e679cc8c162bb760a034aceb4f8965 66168204be9559dc841f06f0025f3da01d9a8546 2025-04-20T03:15:41-07:00 Jeffrey Morgan llava: fix errors in clip.h on certain compilers (#13030)
37b9f0d29d7301dd0ec5dfae8f357ccee96325d7 6408210082cc0a61b992b487be7e2ff2efbb9e36 2025-04-19T09:15:45+02:00 Xuan-Son Nguyen clip : refactor, add `image_manipulation` and `llava_uhd` classes (#13011)
b9154ecff93ff54dc554411eb844a2a654be49f2 2db9ba1464f3de0aceb2b5289963e69fc369cb66 2025-04-18T10:04:51+02:00 Xuan-Son Nguyen mtmd : add methods to access `mtmd_image_tokens` (#12906)
510676475f885ec064ff147af9f20ee7a9b12a50 daa422881a0ec7944771bcc8ff8de34d11f5bd3b 2025-04-15T14:07:42+05:30 Akarshan Biswas SYCL: Add ROPE vision kernel (#12887)
daa422881a0ec7944771bcc8ff8de34d11f5bd3b eccc7a1602f0752507de4aaad1008b9618a282c8 2025-04-15T07:49:57+01:00 Juk Armstrong llama : DeepSeek V2/V3 MLA implementation (#12801)
e59ea539b83d2c7947c99bd350549364dbba450c c94085df2871d2cad11f6411304d7798d7dd4cdd 2025-04-12T01:29:03-04:00 Matt Clayton llava: Fix cpu-only clip image encoding sefault (#12907)
0c509239445088f21265580b86733c5b184261d9 fccf9cae83e6c6cd31a0ecb403d237638e427d0a 2025-04-11T12:09:39+02:00 Xuan-Son Nguyen clip : use smart pointer (⚠️ breaking change) (#12869)
12e9158f25cb47e97ca9b8083e1ec7415f262260 5b1f13cb64dbb0de7e95dae86725928d350c188c 2025-04-11T09:24:34+02:00 Daniel Bevenius xcf : add check for visionos build version (#12854)
b0091ecc1e5c0f689be856fade3803a534f35c9f 31f7803bc4e7c0dcc279ee04c2ecfb76b2afdd3e 2025-04-09T23:17:12Z Rudi Servo docker : added all CPU to GPU images (#12749)
d9a63b2f2e91cdcb0eda211b7f49fadcdea0f664 8ed71242f464dc0a3fb3cffcfe064e55bdec72f9 2025-04-09T17:22:30+08:00 R0CKSTAR musa: enable freediskspace for docker image build (#12839)
65a69e6e1b6d55cd5f78f8bcdfaba8a8c59a8d96 47277d6d1d0d515cff34292a1a78a0d1b7252350 2025-04-09T10:09:53+02:00 Xuan-Son Nguyen clip : do not print ftype (#12832)
b32efad2bc42460637c3a364c9554ea8217b3d7f a19b5cef16d885c44c635da4a5c97113c1577de8 2025-04-08T16:01:58-04:00 Matt Clayton llava: improve clip_ctx destructor to not memleak load_image_size (#12834)
a19b5cef16d885c44c635da4a5c97113c1577de8 78a1ba0a4f2bfed5b8b8e312592143d22e531698 2025-04-08T19:54:51+03:00 Georgi Gerganov llama : fix FA when KV cache is not used (i.e. embeddings) (#12825)
2dabf759e7c8c827d38cdd18d0792070e6a4f4e1 1d343b4069c74b2c7b19ae84260cd98aa2320a9a 2025-04-08T21:49:13+08:00 dm4 llava: add more helper functions to check projector types in clip context (#12824)
0364178ca2452bd241a4cdd4350d0d7a6ff8c4b4 c6ff5d2a8da2587cc78c9ede9171dfc3f076c757 2025-04-05T17:17:40+02:00 Xuan-Son Nguyen clip : refactor clip_init, add tests (#12757)
f52d59d771dc231fc2ac39adacf157ddefc97730 52de2e594979be52f0da92601747aa44a13e50e4 2025-03-31T11:07:07+02:00 Sigbjørn Skjæret llava : fix clip loading GGUFs with missing description (#12660)
5dec47dcd411fdf815a3708fd6194e2b13d19006 f125b8dccff34439a26bf750c9edef358c48c1f8 2025-03-27T08:08:08-07:00 lhez opencl: add multi and vision rope, `gelu_quick` and `im2col` (#12600)
02082f1519565fc7b49de211b28bc5404a69209b df4d20cd53d5bb6fc21c1dc65f026d53b566d097 2025-03-26T22:06:04+08:00 Ivy233 clip: Fix llama-llava-clip-quantize-cli quantization error under CUDA backend (#12566)
2b65ae30299b9c67e25c51ee567e9a2ef22279ab 48d7021c61ceda6fcf1a7294d2115b8e1a53ae95 2025-03-24T09:20:47-07:00 lhez opencl: simplify kernel embedding logic in cmakefile (#12503)
0fd8487b142b2b92565bc95b39ddc440955a237c 108e53c2f1b57b79c8bcf9773fba5a82e2f1eeb5 2025-03-19T10:15:23Z Guus Waals Fix visionOS build and add CI (#12415)
108e53c2f1b57b79c8bcf9773fba5a82e2f1eeb5 a686171ea71ed8cb8a324850d146cb65a001e141 2025-03-19T09:08:49+01:00 Sigbjørn Skjæret llama : add support for GPT2, Bloom and CodeShell tied word embeddings (#12456)
99aa304fb900654ec338749f64e62895b9a88afd 8551c44d840a7db50adb958ccaf464dc3ded82e7 2025-03-18T17:24:33+01:00 Xuan-Son Nguyen llama : add support for EXAONE tied word embeddings (#12451)
7841fc723e059d1fd9640e5c0ef19050fcc7c698 bf69cfe62f9ccc01112c0232a55820b95a8c1fda 2025-03-12T09:30:24+01:00 Xuan-Son Nguyen llama : Add Gemma 3 support (+ experimental vision capability) (#12343)
96e1280839561aaabb73851f94972a2cd37b2d96 2c9f833d17bb5b8ea89dec663b072b5420fc5438 2025-03-11T09:20:16+01:00 Xuan-Son Nguyen clip : bring back GPU support (#12322)
8352cdc87b207a735d34c431a36c425728cb4586 1e2f78a00450593e2dfa458796fcdd9987300dfc 2025-03-10T16:33:24+08:00 tc-mb llava : fix bug in minicpm-v code (#11513)
5e2d57b2b2e43eadbe6d66ba3e873a824b95e725 f1648e91cf6c52e9593810aa70857e412d474c09 2025-03-07T15:35:57+08:00 BB-fat metal : simplify kernel arguments using a struct (#3229) (#12194)
d6c95b0740510231b3797b80d6d3440d8fe188b6 d76a86d967ef491d530400b08bc8ef8a14807936 2025-03-07T06:23:16+01:00 Daniel Bevenius metal : fix default.metallib build (#12224)
e9b2f84f145fbd458dcb98f227bd09370918be6e e721c05c9336a72fbb59d5c75967360bc67036c6 2025-03-06T16:33:21+08:00 Aaron Teo llava: add big-endian conversion for image encoder (#12218)
16e4b22c5e58ee200ede913fd7b7b8ba92132ce8 074c4fd39df3af974e10fbee6cc6db5d9304655b 2025-03-05T17:16:01+02:00 Plamen Minev ggml : fix GGMLMetalClass ODR (#12200)
a057897ad4e48e3df0354256e0cc80dadcb57595 5bbe6a9fe9a8796a9389c85accec89dbc4d91e39 2025-03-05T06:30:31+01:00 Daniel Bevenius llama : add xcframework build script (#11996)
84d5f4bc195b9540fcb902d869015fba7ef6baa4 438a83926afcff3643ffef5543db67545ceffe39 2025-02-28T04:31:47-07:00 Alex Brooks Update granite vision docs for 3.2 model (#12105)
4d1051a40ffc2fdff80bc532eea5b9568b85c156 3e9a2860e996657fc10db8393cf65adc40703082 2025-02-25T02:46:05-07:00 Alex Brooks Add Doc for Converting Granite Vision -> GGUF (#12006)
7a2c913e66353362d7f28d612fd3c9d51a831eda 08d5986290cc42d2c52739e046642b8252f97e4b 2025-02-24T09:09:51-07:00 Alex Brooks llava : Add Granite Vision Support (#11794)
36c258ee921dbb5c96bdc57c0872e4a9a129bef6 f3e64859edb0d55d4223ead78672597cd1a218df 2025-02-22T22:28:28+08:00 Ting Lou llava: build clip image from pixels (#11999)
ee02ad02c56ff36a5edd22d8617ab3f9546ce7fe c392e5094deaf2d1a7c18683214f007fad3fe42b 2025-02-20T23:11:03-07:00 Alex Brooks clip : fix visual encoders with no CLS (#11982)
bf42a23d0a515a508aecf10fde1d52c5ed5104c6 c2ea16f260445d1f2bd9fee78fb8acb2b3aaaad4 2025-02-16T01:52:23-06:00 Jeff Bolz vulkan: support multi/vision rope, and noncontiguous rope (#11902)
b7552cfcbc7defccd8bdefd0a7b9c47d145ed3d7 225bbbfa39930cda38a2e5d1f3e5b38226732009 2025-02-07T09:15:22+01:00 Daniel Bevenius common : add default embeddings presets (#11677)
902368a06b915b860236cfc97ff885b2aceae256 c3db0480bb820e120249014b380e1f4badf2a1c1 2025-02-05T19:52:31-06:00 Charles Duffy metal : avoid breaking build when metal API predates TARGET_OS_VISION (#11690)
1ec208083cb896dd8772a2f962151fa3d4a74e36 9f4cc8f8d310b13ab3fc93a9be81b1d1376a7fa6 2025-02-05T14:45:40+07:00 SAMI llava: add quantization for the visual projector LLAVA, Qwen2VL (#11644)
0cec062a638700495673f5494d200b74340538be 53debe6f3c9cca87e9520a83ee8c14d88977afa4 2025-02-02T15:48:46+08:00 piDack llama : add support for GLM-Edge and GLM-Edge-V series models (#10573)
b636228c0ad0db95bf73008094c6145a05615cf6 325afb370a1a7b32b5fe46a749bc840c66db9765 2025-01-29T09:38:54+01:00 Daniel Bevenius embedding : enable --no-warmup option (#11475)
f643120bad8ab3a753daa64aaac8288ee5800e06 6e84b0ab8e10b8f6f99a32855f976ebcd35b0353 2025-01-28T11:42:32+01:00 Nuno docker: add perplexity and bench commands to full image (#11438)
466ea66f338d63109540dae1df97ccfdbf4cd08f 5f0db9522f347b095f84c3033d6c1c1895402e25 2025-01-25T07:26:01+08:00 jiahao su CANN: Add Ascend CANN build ci (#10217)
3e3357fd77bcf5bd8cfcc53ca53d4a5532e67e1b 6171c9d25820ccf676b243c172868819d882848f 2025-01-22T15:35:48+08:00 tc-mb llava : support Minicpm-omni (#11289)
8f70fc3d1b1d3c17b61842330dd106d391cc1227 1244cdcf14900dd199907b13f25d9c91a507f578 2025-01-13T13:38:20+01:00 Daniel Bevenius llama : remove 'd' from bad special token log (#11212)
2739a71e4b88474833b64aa974ca4515574fd3c4 ba8a1f9c5b675459c55a83e3f97f10df3a66c788 2025-01-11T05:50:33+01:00 Daniel Bevenius convert : sort print supported models [no ci] (#11179)
ff3fcabc727b2dd0c477d23a258217b27cc639fb c3f9d25706ac84297067aeaa662c1f1af42ed443 2025-01-10T11:30:53+01:00 Daniel Bevenius convert : add --print-supported-models option (#11172)
5e3b08d606b5b0caaea16541b504c3bba8f3ec1d db68c93b57bfdf6da1fbdae81080382d6998cbc9 2025-01-04T10:53:54+02:00 Georgi Gerganov ggml : do not install metal source when embed library (ggml/1054)
9ba399dfa7f115effc63d48e6860a94c9faa31b2 2cd43f4900ba0e34124fdcbf02a7f9df25a10a3d 2024-12-24T21:33:04+01:00 Reza Kakhki server : add support for "encoding_format": "base64" to the */embeddings endpoints (#10967)
0ca416c91aea4549d9c77e3efeca403e15aa6c75 21ae3b9be83820565d1a720999b7f63ce95b4920 2024-12-20T14:12:06+01:00 Xuan Son Nguyen server : (UI) fix copy to clipboard function (#10916)
d408bb9268a988c5a60a5746d3a6430386e7604d 5cab3e4aaa892df4620b720f20a503a1bbbe7a52 2024-12-19T18:47:15+02:00 Georgi Gerganov clip : disable GPU support (#10896)
2fffc52b50992ac5bc64db19d33c39cbc06f52cf 7585edbdebd02861e0994dae67c9338731fb3fc5 2024-12-19T06:04:51-07:00 Sukriti Sharma llama : fix Roberta embeddings (#10856)
0bf2d10c5514ff61b99897a4a5054f846e384e1e 7bbb5acf125d1d2840cac7d31b9aaa72210dd5ec 2024-12-18T19:27:21+02:00 Georgi Gerganov tts : add OuteTTS support (#10784)
152610eda91217ac409342cd976d05f5114ad39f 0e70ba686e6c717a0aa41d88284e2a392c2bd0cd 2024-12-18T13:01:41+02:00 Georgi Gerganov server : output embeddings for all tokens when pooling = none (#10861)
46828872c31b25df16169cbbf5c2225fa9cb0675 6b064c92b4c0228e333193c167f2c98d2ec8d9bc 2024-12-18T09:55:09+01:00 Xuan Son Nguyen server : (embeddings) using same format for "input" and "content" (#10872)
8dd19a48129d578972ea3d98896edbbf492891a9 130d0c90bd26b25e3a713b17a61a5d4eb0a66405 2024-12-16T19:34:38+09:00 gn64 vulkan : fix soft_max.comp division by zero (whisper/2633)
05c3a444b8b017b01b366b725ba22c740aae6b38 382bc7f2e8ffd0b89f23e840d097e21f301197ba 2024-12-17T16:00:24Z krystiancha server : fill usage info in embeddings and rerank responses (#10852)
ba1cb19cdd0d92e012e0f6e009e0620f854b6afd 56eea0781cbd2608ed8ff524955495569b9264be 2024-12-14T20:43:46+08:00 HimariO llama : add Qwen2VL support + multimodal RoPE (#10361)
a76c56fa1a3d27467eb97468d8c3b2fe1243b61a c27ac678dd393af0da9b8acf10266e760c8a0912 2024-12-13T12:23:52-08:00 lhez Introducing experimental OpenCL backend with support for Qualcomm Adreno GPUs (#10693)
11e07fd63bac1cb642380a7a3eac03fd8703e948 4601a8bb6784d2ab8b4b605354b51979fbeea1d3 2024-12-13T18:23:50+01:00 Corentin REGAL fix: graceful shutdown for Docker images (#10815)
784a14aa496a66cc43e76014a1bf4333b4a2a55a c5ede3849fc021174862f9c0bf8273808d8f0d39 2024-12-07T00:02:14-07:00 Sukriti Sharma convert : add support for Roberta embeddings (#10695)
8d0cfd554a9ae545ff94d27e04458f537b4e8c0e 2759916d86b70e7aceaed4d0b4e7ed126f0f9e51 2024-12-04T17:42:50+08:00 JFLFY2255 llama: Support MiniCPM-1B (with & w/o longrope) (#10559)
01e6d9bb71eb71fe1f811f2fdef15753232cd0f2 cc98896db858df7aa40d0e16a505883ef196a482 2024-12-04T08:26:37+08:00 piDack clip : add sycl support (#10574)
7db3846a94ce7683b3e8120abe427457edf840c9 c6807b3f28cc3dbfda3ec390bcb87e69fb5634e2 2024-11-26T13:05:20+01:00 Diego Devesa ci : publish the docker images created during scheduled runs (#10515)
50d5cecbda3b0d03344eed326287adc1f6c7f3ef 9fd8c2687f5aa2f095ac6e12a376e1c0583888e8 2024-11-25T22:05:39+01:00 Diego Devesa ci : build docker images only once daily (#10503)
9336db462c0c34bbe2055413fe4e16442626c38b 96fa2c5e2d6cb5319f34c3a7fb0cec05694b22f1 2024-11-24T02:02:34-07:00 Gabe Goodhart convert : XLMRoberta Type Vocab Size (#10458)
57f8355b29a8c7dfcd1fb6094758ad85644f8535 9901068ac78838745e604fffb4601d315a610456 2024-11-15T12:10:45+01:00 Romain Biessy sycl: Update Intel docker images to use DPC++ 2025.0 (#10305)
5b359bb1e3585de45bec79fd6c18934897662cdf e89213492d3e01705739789733f0f2d250b4c449 2024-11-09T15:35:46+08:00 SXX ggml: fix zero division in dne calculation in CUDA COUNT_EQUAL operator when ne is small (#10213)
d05b3127bd30515955aa4ee2bacdb68ebafe88f4 76c6e7f10551960e4ec9e14e0535b72081f1c7ad 2024-11-08T17:34:06+08:00 Jhen-Jie Hong swift : exclude ggml-metal-embed.metal (#10211)
a71d81cf8c1afb26b166f897c94ee1581f9fac7d eec4d71737b32f312e0082b671629a0368e1a20d 2024-11-07T17:31:10-04:00 Xuan Son Nguyen server : revamp chat UI with vuejs and daisyui (#10175)
8f275a7c4593aa34147595a90282cf950a853690 8d8ff715367480b856ad86ac3888e9742b13a6fa 2024-10-29T17:52:56+09:00 Changyeon Kim ggml: Add POOL2D OP for GPU acceleration to the Vulkan backend in the MobileVLM model. (#9763)
674804a99617b4f90292b4080ecab450ea3d30ba e94a138d644a9b34da61805f7aeb8af595c61b53 2024-10-22T09:40:02+02:00 Daniel Bevenius arg : fix typo in embeddings argument help [no ci] (#9994)
cf8e0a3bb9c0e93e371773b282054cdbbb231038 c7499c557cc1efafaf0a6bc12963c39826299703 2024-10-11T02:10:37+08:00 R0CKSTAR musa: add docker image support (#9685)
1927378bcce20ba72b6c89d5977b854a4bcaeb5d 6f1d9d71f4c568778a7637ff6582e6f6ba5fb9d3 2024-10-01T02:31:36-04:00 compilade convert : refactor rope_freqs generation (#9396)
f4d2b8846a6b34419ff9e9491aee6cd95e444bfc 1b2f992cd2cff0b69e5abe78bb8888d51ed19d67 2024-09-28T17:42:03+03:00 Georgi Gerganov llama : add reranking support (#9510)
9a913110cf471a8287ac06c43cbe307d3cf6df99 43bcdd9703ec19af7d2a519640b5ed6f4aac3d53 2024-09-28T12:08:43Z nopperl llama : add support for Chameleon (#8543)
0b3bf966f47bf2ba88e5d4e3ed429602008c7e63 f0c7b5edf82aa200656fd88c11ae3a805d7130bf 2024-09-23T22:23:54+02:00 Xuan Son Nguyen server : add --no-context-shift option (#9607)
acb2c32c336ce60d765bb189563cc216e57e9fc2 a6a3a5c531c73aef85750a847d21e7d4671e723d 2024-09-16T13:07:13+02:00 Daniel Bevenius llama : rename n_embed to n_embd in rwkv6_time_mix (#9504)
95ca85168b5b089b80a811b59528ce0a2f1bd1dd 441b72b91f818fe69497e5816f87969e90c73c43 2024-09-16T14:45:20+08:00 CarryFun llama : support MiniCPM3 (#9322)
1b28061400eb9832603c9f1dfbec4d339a8490a2 8db003a19d7055b5bd248ce2afff9324e5b8da95 2024-09-11T17:52:13+02:00 slaren llama : skip token bounds check when evaluating embeddings (#9437)
0996c5597f680effacc046832bb807c14900e22d 5bb2c5dbd26b246d334f0087b3cbd800f2e65c54 2024-09-11T12:59:13+02:00 Xuan Son Nguyen llava : correct args for minicpmv-cli (#9429)
6c89eb0b4749184f4d19e96ada5dcb8847129b9c 9b2c24c0993487d3b34a873980e292da571481f3 2024-09-07T09:48:54+02:00 slaren ci : disable rocm image creation (#9340)
9bc6db28d011d47a5f318dc4aebbe7927fac4629 32b2ec88bc44b086f3807c739daf28a1613abde1 2024-09-05T21:48:47-04:00 compilade ggml-quants : ternary packing for TriLMs and BitNet b1.58 (#8151)
048de848ee4baad4531fcd6239438f5d55be365c f771d064a95d212ddadea452ad0cc1e42b2c3db3 2024-09-02T18:11:13+02:00 slaren docker : fix missing binaries in full-cuda image (#9278)
6e7d133a5f9409dd257fad90d7f320721b07a1b2 b60074f1c26d8354053a952844ef3f7ebefd8803 2024-09-02T17:11:51+02:00 Xuan Son Nguyen server : refactor multitask handling (#9274)
8f1d81a0b6f50b9bad72db0b6fcd299ad9ecd48c a47667cff41f5a198eb791974e0afcc1cddd3229 2024-09-01T22:38:17+08:00 Molly Sophia llama : support RWKV v6 models (#8980)
7ea8d80d53364f2cdcd7bbc0f031106f529b1fe3 42c76d1358021ccdbe8ba89109c143dd7ae166df 2024-08-30T13:21:57+08:00 tc-mb llava : the function "clip" should be int (#9237)
9fe94ccac92693d4ae1bc283ff0574e8b3f4e765 66b039a5011522b6a61495eea2a9862601e169f7 2024-08-28T17:28:00+02:00 slaren docker : build images only once (#9225)
66b039a5011522b6a61495eea2a9862601e169f7 20f1789dfb4e535d64ba2f523c64929e7891f428 2024-08-28T13:20:36+02:00 slaren docker : update CUDA images (#9213)
3246fe84d78c8ccccd4291132809236ef477e9ea 78eb487bb0038eae95506d3d832b94c979185b09 2024-08-27T20:33:08+08:00 Xie Yanbo Fix minicpm example directory (#9111)
ad76569f8e78ab6ca921bda25cef25a157361719 7d787ed96c32be18603c158ab0276992cf0dc346 2024-08-26T22:58:50-07:00 arch-btw common : Update stb_image.h to latest version (#9161)
a1631e53f6763e17da522ba219b030d8932900bd fc54ef0d1c138133a01933296d50a36a1ab64735 2024-08-21T17:58:11-04:00 compilade llama : simplify Mamba with advanced batch splits (#8526)
f63f603c879c2232eaeded8c0aeba4244471d720 8455340b874aa90d5f70104c99ed2778d9e31c36 2024-08-21T09:45:49+02:00 fairydreaming llava : zero-initialize clip_ctx structure fields with aggregate initialization 908)
2f3c1466ff46a2413b0e363a5005c46538186ee6 50addec9a532a6518146ab837a85504850627316 2024-08-21T04:00:00+09:00 Changyeon Kim llava: Add ACC OP for GPU acceleration to the Vulkan backend in the LLAVA CLIP model. (#8984)
d565bb2fd5a2a58b9924a7a34e77a87c78c52137 ee2984bdaf10c14d440ad873a049bcc09b786d9b 2024-08-16T21:34:41+08:00 tc-mb llava : support MiniCPM-V-2.6 (#8967)
7c3f55c10051c634546247387c5c359c9d499360 911b437f228e75aa3d235acec21bfddd23ecce2f 2024-08-10T11:43:26+02:00 fairydreaming Add support for encoder-only T5 models (#8900)
3071c0a5f218f107dabd13b73f6090af683ef5ec 4305b57c80eff4f0df5f6acb60b292f03b8f0dd0 2024-08-09T18:33:53+08:00 tc-mb llava : support MiniCPM-V-2.5 (#7599)
5b2c04f4925e152c362b824f4b41eb2a081fa623 6f6496bb0999d1bce5daff0cfc55ceb0dd13c888 2024-08-09T08:33:30+02:00 Daniel Bevenius embedding : add --pooling option to README.md [no ci] (#8934)
daef3ab233fc02e4c53afd9b07366379876f00d1 345a686d8271a24db20d31789c0d4b9ed51dcb0c 2024-08-09T08:32:02+02:00 Mathieu Geli server : add one level list nesting for embeddings (#8936)
15fa07a5c564d3ed7e7eb64b73272cedb27e73ec be55695eff44784a141a863f273661a6bce63dfc 2024-08-07T18:24:05+02:00 slaren make : use C compiler to build metal embed object (#8899)
cdd1889de62a7140c8c016405ec917464bde8bd3 c21a896405de4cdf4207eb8130555ceaac0ab110 2024-08-06T02:20:54-05:00 Douglas Hanley convert : add support for XLMRoberta embedding models (#8658)
a3738b2fa7c60ef2c4592435d1aa7fb8f1f69c3e 655858ace0cf2720e56eb01f84ad05e0c94ada3c 2024-08-04T17:28:08+02:00 0cc4m vulkan : implement Stable Diffusion operators (ggml/904)
afbbcf3c04e3c6420cad3d72571478cd62ac176c ed9d2854c9de4ae1f448334294e61167b04bec2a 2024-07-31T18:59:09-05:00 Igor Okulist server : update llama-server embedding flag documentation (#8779)
c887d8b01726b11ea03dbcaa9d44fa74422d0076 75af08c475e285888f66556d0f459c533b7deb95 2024-07-30T14:56:51+08:00 zhentaoyu [SYCL] Add `TIMESTEP_EMBEDDING` OP (#8707)
4c676c85e59ef8f771f3a129e6eb217552139231 e54c35e4fb5777c76316a50671640e6e144c9538 2024-07-28T00:42:05-04:00 compilade llama : refactor session file management (#8699)
c3ebcfa148e867a68e78fd5c4f0c23e8f84c788b 8a4441ea1a2564578134404f31158c318e9c0bf3 2024-07-12T03:14:12-05:00 Douglas Hanley server : ensure batches are either all embed or all completion (#8420)
d12f781074b92589a72a36ffabb583933f7b9dc0 bcefa03bc01a41aace2e200ee8e77827d6d39b4f 2024-07-05T02:05:56-05:00 Douglas Hanley llama : streamline embeddings from "non-embedding" models (#8087)
d7fd29fff16456ce9c3a23fd2d09a66256b05aff 6f63d646c1a06a6e09f721009a2676864ae04e31 2024-07-05T05:14:21+12:00 Icecream95 llama : add OpenELM support (#7359)
807b0c49ff7071094f97ebc3a0a8e2b9e274f503 f8c4c0738d72d2162736edd72dd5db8b269adca1 2024-07-04T15:46:11+02:00 fairydreaming Inference support for T5 and FLAN-T5 model families (#5763)
26a39bbd6b0bbd66118bb68569f0276d7fe7df6c 38373cfbab5397cc2ab5c3694a3dee12a9e58f45 2024-06-28T15:11:44+02:00 Xuan Son Nguyen Add MiniCPM, Deepseek V2 chat template + clean up `llama_chat_apply_template_internal` (#8172)
9b31a40c6ddabe552875b811d7127aa039ca9703 c70d117c37cc7876e775d1e2722208a50c52edb3 2024-06-27T01:50:09+02:00 Daniel Bevenius clip : suppress unused variable warnings (#8105)
ae5d0f4b899ff2842bfca561370c945ad8d4368b 31ec3993f6e050322a249c07af79dbde66ea6ddc 2024-06-26T21:59:28+02:00 slaren ci : publish new docker images only when the files change (#8142)
3791ad219323389106dc3fd80814eb5bbb7b80de f702a90e245499283d6de0b287701c723cda2a87 2024-06-25T16:57:35+05:30 HanishKVC SimpleChat v3.1: Boolean chat request options in Settings UI, cache_prompt (#7950)
8cb508d0d5c024e12692370d85237b45469a004b 646ef4a9cfb6f40236d3b9ef07ac03700b6efcc7 2024-06-24T07:36:11+02:00 slaren disable publishing the full-rocm docker image (#8083)
646ef4a9cfb6f40236d3b9ef07ac03700b6efcc7 de0d6a68ac99f307fe889c48e21124bc3b7ca29a 2024-06-24T13:30:24+08:00 Yann Follet embedding : more cli arguments (#7458)
11318d9aa1f668aa10407a5cb9614371af32f3ce b6b9a8e606da7764bd3649c2ea574979c85abd43 2024-06-23T15:39:45+02:00 Daniel Bevenius Fix typo in llama_set_embeddings comment (#8077)
80ea089d771f0c2d97afa8bead80ded412f600d7 0e64591e8290037db6412665a56354b789a0597e 2024-06-21T00:38:22-05:00 Douglas Hanley llama : allow pooled embeddings on any model (#7477)
0c7b3595b9e5ad2355818e259f06b0dc3f0065b3 7b2f4a7d193ef2475259bbe7656fcccfab4b1217 2024-06-15T18:53:40+02:00 Xuan Son Nguyen Add `cvector-generator` example (#7514)
c2ce6c47e4f2d891bf29d8810832a3b310a8f205 b61eb9644d64e90123ac805436d95b94b3b4cc3f 2024-06-11T07:59:20+02:00 slaren fix CUDA CI by using a windows-2019 image (#7861)
a5cabd76491f07494c5b8267f921c73f5e2bbfb4 d5c938cd7716b9a2ace49a43a469dfbffcff4d28 2024-06-07T15:09:45+08:00 woodx server : do not get prompt in infill mode (#7286)
2d08b7fbb483c14bd2b173d4cd51ea3a4f862e8f d67caea0d6e6c303d31b01d0a010973e6c908dff 2024-06-06T07:19:49+02:00 slaren docker : build only main and server in their images (#7782)
6f28a333c1e3fdfdc7b4f9d0367f2b41a9b7e9d4 549279d8049d78620a2b081e26edb654f83c3bbd 2024-06-03T15:49:30+08:00 zhangkaihuo llama : MiniCPM support tied embeddings (#7664)
74b239b3d5f067470d7ef5e26e2e059720572e32 852aafb163d32d5bad63c10bc323a02c28fec59d 2024-05-28T11:48:16+09:00 Ikko Eltociear Ashimine llava : update clip.h (#7580)
152da28ae54139e3754189b9e6e1c28e11277502 d48c88cbd563b6cf0ce972e2f56796896e240736 2024-05-23T17:40:43+10:00 Brian labeler.yml: add embedding label detector [no ci] (#7482)
65c58207ece92ad213f4bfd0f91dcb2dfb664f5b 1cc0155d04918cb3017afa472acea51b77483c4a 2024-05-20T15:19:21+08:00 junchao-loongson ggml : add loongarch lsx and lasx support (#6454)
e932094d58f513d5996c3efc9f6fed8238894c57 2789baf480ba7dc9281b65f601f0918e58920f54 2024-05-20T08:56:05+03:00 Georgi Gerganov server : return error on too large embedding input (#7389)
33c8d50accd6dca73c9c4af00a05e24209c160fe d359f30921a9f62a0fd299c412ff3f270286fea6 2024-05-19T19:18:39-07:00 Srihari-mcw Add provisions for windows support for BF16 code including CMake provision for enabling AVX512_BF16 (#7258)
f030ec1f7a72aa825b2104823946551b9ec5dfc1 e4e6f67be6a8a697f5f89a28c98934e53c99c359 2024-05-19T17:19:53+02:00 0cc4m Vulkan Embedding Fix (#7360)
ea3b0590ee33d3573eb8ef76f88cc60f36d2a38d 29499bb59383c2a8c5d557a90abb08b696cef7f6 2024-05-15T20:01:12+08:00 dm4 embedding : free the batch after execution (#7297)
27f65d6267cf22a44c5ccefa7765d53a05bd1259 ee52225067622babc277371511b8124884e1c797 2024-05-14T14:20:47+09:00 Ryuei docs: Fix typo and update description for --embeddings flag (#7026)
b83cc3f5b303ff30c52874b2d5864dc6385ebf9f 9cb317f77e53067f7a138cc89ef7657148eae8e6 2024-05-11T09:46:09+02:00 Joan Fontanals llama : add Jina Embeddings architecture (#6826)
f89fe2732c5709f6e86d5f4aee2e6d2a561f2eb2 d11afd665241c1b3910ab5f040d0216403019d87 2024-05-10T15:51:58+05:30 HanishKVC Main+: optionally allow special tokens from user in interactive mode (#7097)
d11afd665241c1b3910ab5f040d0216403019d87 8c570c9496212073079476651c7517c02581101f 2024-05-10T02:41:10-04:00 Andrei llava : fix moondream support (#7163)
47345248827f426038098d016ed11975021b4919 07cd41d0965829463eff73eda3348aedbfd3a444 2024-05-09T17:34:37+08:00 Albert Jin opencl : alignment size converted from bits to bytes (#7090)
9da243b36ac0b9d609adfaaa4c8f1cc8c592f737 bd1871fa2b1bf8a081b43ba9bc85f8ffd46fac46 2024-05-08T22:14:39+03:00 Georgi Gerganov Revert "llava : add support for moondream vision language model (#6899)"
ffe666572f98a686b17a2cd1dbf4c0a982e5ac0a 24affa7db3c9db148854b0ab4fd63de8bca7d898 2024-04-29T07:34:24-07:00 cpumaxx llava-cli : multiple images (#6969)
3055a4180557c6cbe29eacc8284c9e070ac10eab 577277ffd203b190c3dc2ab3e737946dc432132c 2024-04-29T09:34:41-04:00 Christian Zhou-Zheng convert : fix conversion of some BERT embedding models (#6937)
46e12c4692a37bdd31a0432fc5153d7d22bc7f72 dba497e0c1eff27cf0e85d1d73c86fa08e1b5557 2024-04-25T12:38:31-07:00 vik llava : add support for moondream vision language model (#6899)
4ab99d8d4762869506bb675b36501fd7c2af00b2 54770413c484660d021dd51b5dbacab7880b8827 2024-04-25T14:38:14+02:00 Daniel Bevenius clip : rename lerp function to avoid conflict (#6894)
8cc91dc63c0df397d644a581b2cbeea74eb51ae0 dbceec87c0221ec952e69448df6a71f1372a7487 2024-04-16T14:55:30-04:00 Justine Tunney ggml : add llamafile sgemm (#6414)
67fac4b95fcccfda8ab965e9ba4992a9ddf3a25f 29122d32ac8075ad27b7a8be05dcad2b7e7a5f9e 2024-04-10T08:58:48+02:00 Pierrick Hymbert docs : how to add a model (#6565)
1b67731e184e27a465b8c5476061294a4af668ea c4a3a4ff47d62d2503ddf9bd91b58c21f04fe3c3 2024-04-09T13:44:08-04:00 Jared Van Bortel BERT tokenizer fixes (#6498)
5dc9dd7152dedc6046b646855585bd070c91e8c8 e11a8999b5690f810c2c99c14347f0834e68c524 2024-04-09T09:16:13+01:00 Carolinabanana llama : add Command R Plus support (#6491)
e3c337d87ca650972105a51c6ce302dd236c07ad beea6e1b16e783a0886e78dec01002a8c00db24d 2024-04-08T06:02:30-07:00 Rick G llama : support negative ith in llama_get_ API (#6519)
22a462cc1f69873f7d4c6d0201bd93478afa2ecb f6a0f5c6422200764b7929064c39dcf4bb0e9cd6 2024-03-26T16:22:07Z Someone Serge nix: package: don't introduce the dependency on python
a016026a3ac16d8c9b993a3573f19b9556d67de4 53c7ec53d5eca26b2c0c648605543a5fa6c12817 2024-03-27T20:26:49+01:00 Pierrick Hymbert server: continuous performance monitoring and PR comment (#6283)
1e13987fba5a536965ef942f2c86549d62cef50b e82f9e2b833d88cd2b30123ef57346c2cb8abd99 2024-03-27T12:15:44+01:00 howlger embedding : show full embedding for single prompt (#6342)
557410b8f06380560155ac7fcb8316d71ddc9837 55c1b2a3bbd470e9e2a3a0618b92cf64a885f806 2024-03-26T10:46:41-04:00 compilade llama : greatly reduce output buffer memory usage (#6122)
deb7240100da99555b9ab9dc635021e591fceaf5 3d032ece8e6973441273601ca2981130608e287d 2024-03-26T18:11:46+09:00 Minsoo Cheong embedding : adjust `n_ubatch` value (#6296)
1d0331c12a2f2a6296b471232bd4e66fbf06e6a1 dba1af612926cbd4ebe2d876277af1e3305177e0 2024-03-22T19:47:14+01:00 Kawrakow quantize: options for output and token embedding tensors qtype (#6239)
272935b281fee5c683e3d6d1eb580b84553cf503 ccf58aa3ec4d20b10162ba40898dc038ad4c3fad 2024-03-20T23:02:32+08:00 Ziang Wu llava : add MobileVLM_V2 backup (#6175)
f8c4e745e1e728204ab26dbadf52853545e6789c 47cc7a7bf9793f81a6dfe7c2096c499403f64dd6 2024-03-20T19:20:37+08:00 Ziang Wu llava : add a MobileVLM_V2-1.7B backup (#6152)
104f5e0fc156d48476258295457cafeec2a2af10 5e1b7f94a03e0b3b8e4578625bbdadc7bbd2b93c 2024-03-18T16:40:22+01:00 Felix clip : fix memory leak (#6138)
877b4d0c628cc70dddb5df72ed8fc14d126ca7e8 12247f4c69a173b9482f68aaa174ec37fc909ccf 2024-03-15T13:43:02-07:00 Theia Vogel llama : add support for control vectors (#5970)
12247f4c69a173b9482f68aaa174ec37fc909ccf 4e9a7f7f7fb6acbddd1462909c8d696e38edbfcc 2024-03-15T16:41:22-04:00 Andrew Canis llama : add Command-R support (#6033)
044ec4b2a567f649459ccd20af2f387c784faa51 77178eedc83d49f31bf757d8e12315d76460be78 2024-03-14T15:14:14+02:00 Georgi Gerganov embedding : add EOS token if not present (#899)
68265ebfc6a1bed022973ea0c3145be1450b7e70 381da2d9f0940d7009e3e918bed36338c8ff2fbb 2024-03-14T12:37:20+02:00 Georgi Gerganov embedding : print all resulting embeddings (#899)
381da2d9f0940d7009e3e918bed36338c8ff2fbb 0fd6c1f015f6cccf3b527f7dbd8386a434728126 2024-03-14T11:55:23+02:00 Georgi Gerganov metal : build metallib + fix embed path (#6015)
0fd6c1f015f6cccf3b527f7dbd8386a434728126 19885d205e768579ab090d1e99281cae58c21b54 2024-03-14T10:12:29+02:00 Georgi Gerganov embedding : print cosine similarity (#899)
f30ea47a87ed4446ad55adb265755dc9102956a2 d8fd0ccf6ac8b07791ffd1575eed436930854ae3 2024-03-13T18:54:21+01:00 slaren llama : add pipeline parallelism support (#6017)
99b71c068f624521ad977e08e41589e2971fa1c7 306d34be7ad19e768975409fc80791a274ea0230 2024-03-13T11:39:11+01:00 Xuan Son Nguyen Server: Use multi-task for embeddings endpoint (#6001)
828defefb66fc8a25404f5de845897145bf34061 caa106d4e05a0ab94225c220b81f9e2cd522339b 2024-03-11T14:40:42+01:00 Jakub N Update server docker image URLs (#5997)
ecab1c75de68de7c41c254e2ae170d3b07bee6d4 ee35600b9061b1ea0c4ea87fce6844297632b2a8 2024-03-11T10:00:08+02:00 Gilad S cmake : fix subdir for `LLAMA_METAL_EMBED_LIBRARY` (#5985)
bcebd7dbf62fd7b293d5ed089023e4e733269c71 2960eae847f8dbde23be6d170a61bcf44ebf32de 2024-03-10T11:56:30-04:00 DAN™ llama : add support for GritLM (#5959)
fb215c3832236fec7380c4fb618bd7154cb196ef 2c4f566c88322ebf2f9bd11b01b5ebdaa0130b89 2024-03-09T21:27:58+09:00 SeungWon Jeong server : normalize embeddings (#5956)
950ba1ab84db199f0bbdecdb2bb911f35261b321 e1fa9569ba8ce276bc7801a3cebdcf8b1aa116ea 2024-03-09T11:27:53+01:00 Xuan Son Nguyen Server: reorganize some http logic (#5939)
c2101a2e909ac7c08976d414e64e96c90ee5fa9e 515f7d0d4fce41c752fc253acf30707c3be2531e 2024-03-08T17:31:00-05:00 compilade llama : support Mamba Selective State Space Models (#5328)
e457fb3540e0aaec47cfde0abf784c213f9216ee af37fd8b30e37ccbffdd82e6f48559e2fb7ce7dd 2024-03-08T02:41:50-08:00 Don Mahurin llama : assume tied weights if lm_head/output weights is missing (#5824)
6cdabe652695167263c8b447520987b11856f7ca 89fb735fcfd21781a8194b211cf32824beb3f71f 2024-03-07T16:32:38+02:00 Georgi Gerganov llama-bench : add embeddings option (#5924)
2002bc96bf2cbf5ab981a17d7e994d817c9801f5 ceca1aef0738b57951cd12c603c3477e75312dec 2024-03-07T11:41:53+02:00 Georgi Gerganov server : refactor (#5882)
21b08674331e1ea1b599f17c5ca91f0ed173be31 6a87ac3a52668e117d97bcea07b529c93188b303 2024-03-05T16:08:35+08:00 Neo Zhang Jianyu [SYCL] fix mul_mat fault in CI/unit-test (#5862)
29ae62d2ae163e2b68aa0ad3bf2ab4636de0c957 e0843afe1b37890b631bc7d3d2da2ed36c862b91 2024-03-04T22:31:20+02:00 Georgi Gerganov llama : fix embeddings (#5796)
7d43c585dc174bb586775c22c15e5db9242b5b4b 82f3e668adafba647de703f835991e91a96b5ac4 2024-03-03T20:23:52+08:00 leejet add some new ops, fix some operators and add batch operations to certain operators. (ggml/747)
475df1d6cf817060028d3ff763cb8097d4ec40d6 87c2e8b2797860a06af3d6c06b8488a8ff1a09ab 2024-03-03T04:40:27-06:00 Douglas Hanley llama : allow for user specified embedding pooling type (#5849)
c29af7e2252d288f2ea58a7d437c1cb7c0abf160 38d16b142624bdd7c41d9955752b7f7b59c5e048 2024-03-02T01:00:46+05:30 Sourab Mangrulkar llama : add StarCoder2 support (#5795)
9e359a4f47c1b2dceb99e29706c9f7403d32ab5e 4c4cb30736582cacb1a164a9d4bc8e17b1014be7 2024-02-24T19:16:04+01:00 Pierrick Hymbert server: continue to update other slots on embedding concurrent request (#5699)
525213d2f5da1eaf4b922b6b792cb52b2c613368 fd43d66f46ee3b5345fb8a74a252d86ccd34a409 2024-02-24T12:28:55+01:00 Pierrick Hymbert server: init functional tests (#5566)
201294ae177b308fb3a99dc504dd6d27e8afa907 5a9e2f60ba3d8362ba17c77ac3092906d49b813f 2024-02-22T19:44:10Z Someone nix: init singularity and docker images (#5056)
580111d42b3b6ad0a390bfb267d6e3077506eb31 88c46cbdac05cebd936511b1d3c74112e721615f 2024-02-21T05:08:22-08:00 postmasters llama : add `gemma` model (#5631)
6560bed3f066c876682464762cad90f1e28e3f1b 06bf2cf8c406e6b70dbf9b431a02fa0ad845b9df 2024-02-20T11:07:22-08:00 CJ Pais server : support llava 1.6 (#5553)
8dbbd75754d43ec7b4bbe42fb287cc2553fdf0e9 c0a8c6db371cb3e4379900867b948879f5842201 2024-02-19T22:58:36-11:00 Haoxiang Fei metal : add build system support for embedded metal library (#5604)
890559ab28e354052e16e770155ad007fd0856e8 d0e3ce51f45bd6a646da1952d7e5d143a087db3e 2024-02-11T16:41:41+02:00 Didzis Gosko metal : option to embed MSL source into compiled binary (whisper/1842)
60ed04cf82dc91ade725dd7ad53f0ee81f76eccf 594845aab1c6775877f6d9545a51dc0f8d0b3d77 2024-02-16T10:24:39+01:00 Daniel Bevenius llava : fix clip-model-is-vision flag in README.md (#5509)
4524290e87b8e107cc2b56e1251751546f4b9051 c06e45d72983d9ace7b1535f7e7ea258d212169e 2024-02-15T11:21:49-06:00 Douglas Hanley Use correct type of pooling for embedding models (#5500)
c06e45d72983d9ace7b1535f7e7ea258d212169e 9060a1e9dfca6038906e819be5fa42217f49028c 2024-02-15T18:49:08+02:00 Georgi Gerganov clip : fix wrong loop condition
0d4177126b0556e202efb85bf3f768be81076400 7930a8a6e89a04c77c51e3ae5dc1cd8e845b6b8f 2024-02-15T09:01:57+01:00 Elbios llava : fix memory management bug (#5491)
7930a8a6e89a04c77c51e3ae5dc1cd8e845b6b8f 704359e29985a06a389337a2617b7f3fa8eff908 2024-02-15T08:59:18+01:00 John llaba : hotfix for llava-1.6 image number (#5495)
aa2341298924ac89778252015efcb792f2df1e20 f5ca054855dea83f424003162f26de376e5643f6 2024-02-14T08:38:35+01:00 John llava : support v1.6 (#5267)
ea9c8e11436ad50719987fa23a289c74b7b40d40 c4e6dd59e45ef7b14f7763fb073b517395dc176c 2024-02-13T12:03:53-05:00 Jared Van Bortel llama : add support for Nomic Embed (#5468)
03bf161eb6dea6400ee49c6dc6b69bdcfa9fd3fc ad014bba97ef6ef6c3e2f78b2fc463e91ae94579 2024-02-13T06:06:58-06:00 Douglas Hanley llama : support batched embeddings (#5466)
4a46d2b7923be83d6019251671ee63aa1fa0d6bc 3b169441dfe8e420f88d1592708cc2a871daadb9 2024-02-12T09:38:44+01:00 Daniel Bevenius llava : remove prog parameter from ArgumentParser (#5457)
3b169441dfe8e420f88d1592708cc2a871daadb9 3bdc4cd0f595a6096cca4a64aa75ffa8a3503465 2024-02-12T09:16:06+02:00 Georgi Gerganov sync : ggml (#5452)
2891c8aa9af17f4ff636ff3868bc34ff72b56e25 97a336507ed9b971d72262bec7e2b8b7016a054a 2024-02-11T10:21:38-06:00 Douglas Hanley Add support for BERT embedding models (#5423)
ff4ff05c5ff4311c05a8ce1f984c7d8def4f07a5 b7b74cef36a93ae01e0b9af8986d131761742d0e 2024-02-08T15:20:03+01:00 Daniel Bevenius llava : add missing .py, and fix paths in README.md (#5414)
4aa43fab569215a13495a7f1a0f8afc541b16d03 a6e514a85f0fda38ff78ec91782877ea3d19ed98 2024-02-08T18:36:19+08:00 runfuture llama : fix MiniCPM (#5392)
a6e514a85f0fda38ff78ec91782877ea3d19ed98 26d4efd11e48908e14e2ee9471a7fc4c57079a1d 2024-02-08T09:58:19+01:00 Daniel Bevenius llava: fix typo/formatting in README.md (#5405)
316c7faf7740fa98ea68f1445f4505810f706b9e f3e2b4fa3f81a410ecb7dec929c259ef8d8dbb7d 2024-02-07T14:15:56+08:00 runfuture llama : add MiniCPM support (#5346)
6b91b1e0a92ac2e4e269eec6361ca53a61ced6c6 e805f0fa9951081ce0a86378a7aa52b6f636b82d 2024-02-02T08:56:31+01:00 Xuan Son Nguyen docker : add build for SYCL, Vulkan + update readme (#5228)
c82d18e863fcde91b4b1109b1d0c73ea4470c405 14fef85e2d5361e6b4dd7a9ecf22bb817362997d 2024-01-29T21:48:10+08:00 Wu Jian Ping server : embeddings compatibility for OpenAI (#5190)
39baaf55a160909bb9428bd981014218761a20cb 6db2b41a76ee78d5efdd5c3cddd5d7ad3f646855 2024-01-28T01:55:31-06:00 Kyle Mistele docker : add server-first container images (#5157)
6db2b41a76ee78d5efdd5c3cddd5d7ad3f646855 753eafed0ebd07af6903771327a1786a7c02cf98 2024-01-27T16:09:18+01:00 John llava : support for Yi-VL and fix for mobileVLM (#5093)
bf63d695b804b1c995c7ae4427a8a86936ea6d25 1387ea21178f9f154944013d4dd9764b54c69deb 2024-01-22T03:17:05-07:00 Michael Hueschen nix: add cc to devShell LD_LIBRARY_PATH
57e2a7a52a819883f40dada8a2edc24ecf48186b 9b6ea4263ab45e02ff905bf7a29dc143ca1facc3 2024-01-18T23:12:15+01:00 John llama : fix falcon arch for tied output embeddings (#4978)
ee8243adaa9a9f51ff449213383874e49efe368f 15ebe59210e7fd9817ff67f51fa1a5ee2d004294 2024-01-13T14:16:11Z makomk server : fix crash with multimodal models without BOS token (#4904)
d34633d8db6c2e400355de4862cd699154ecc73f 4f56458d34cb13dcbf69aca650e9bf77d5497e6f 2024-01-10T14:37:09+01:00 John clip : support more quantization types (#4846)
36e5a08b203542dca53cca4eaf172c5dc4bbc991 4dccb38d9abab7f9f2d1f9a6977df4185d490132 2024-01-09T09:59:14-08:00 Justine Tunney llava-cli : don't crash if --image flag is invalid (#4835)
3418c03ecc149fd657527ebb06776239b60a3f3b 63ee677efd92060b14894b984597c62e3742b8da 2024-01-07T08:46:55+01:00 Alex Azarov llama.swiftui : add visionOS target (#4805)
9fbda719de18a9400a064c28759c39d55d687d3e 39d8bc71edcb8b6f99d46fa4216af7a15232e218 2023-12-30T23:24:42+02:00 Georgi Gerganov clip : refactor + bug fixes (#4696)
0235b9b571f3cc7d2b8836409a5404b41ce1379c ce18d727a47f2473ca863a6f78bf3ad480008f72 2023-12-29T18:53:34+02:00 Georgi Gerganov clip : use ggml_backend_buffer_is_host (#4205)
ce18d727a47f2473ca863a6f78bf3ad480008f72 91bb39cec7e4dfb9e2293509ef60298a67f0b1b7 2023-12-29T11:52:15-05:00 Steward Garcia clip : enable gpu backend (#4205)
b93edd22f55d3e5268263c3edcdae1818505c078 82d6eab224862a7044069fb9211dc4b29124264b 2023-12-29T06:22:10-08:00 Karthik Sethuraman server : allow to generate multimodal embeddings (#4681)
925e5584a058afb612f9c20bc472c130f5d0f891 6123979952385847d8348e295d77d6e01da8aa84 2023-12-23T11:35:55+02:00 Samuel Maynard ci(docker): fix tags in "Build and push docker image (tagged)" (#4603)
f31b98489824a86c937fa62ccf5dfd4bb0327b86 2bb98279c5a087d62949972b35cf63ff974ffe6a 2023-12-21T23:56:34-07:00 rhuddleston ci : tag docker image with build number (#4584)
33c9892af58b7b161f2a532935dcccff8c8048c6 8efa0f6ebed53c9453e6721da86fb294e5015909 2023-11-30T23:11:14+01:00 John llava : ShareGPT4V compatibility (vision encoder only loading) (#4172)
bd90eca237b498dd106d315dcb9ad3e6fae3906f 3d68f364f15778dc326f5024f2e5af1ad6dfddef 2023-11-13T18:20:52+03:00 M. Yusuf Sarıgöz llava : fix regression for square images in #3613 (#4056)
381efbf480959bb6d1e247a8b0c2328f22e350f8 2833a6f63c1b87c7f4ac574bcf7a15a2f3bf3ede 2023-11-06T22:36:23+01:00 Damian Stewart llava : expose as a shared library for downstream projects (#3613)
ca190bca8e844d171020d6147687e71472d71734 71e3718abdb2771b50c9606d3a7569623a0b0afe 2023-11-01T09:28:28Z Adrian Hesketh server : re-enable completion and embedded at the same time (#3876)
34b2a5e1ee4fe6295fb4420eb91131d743694c65 6961c4bd0b5176e10ab03b35394f1e9eab761792 2023-10-26T22:53:37+03:00 Georgi Gerganov server : do not release slot on image input (#3798)
438c2ca83045a00ef244093d27e9ed41a8cb4ea9 9e70cc03229df19ca2d28ce23cc817198f897278 2023-10-22T22:53:08+03:00 Georgi Gerganov server : parallel decoding and multimodal (#3677)
f3b25e40438b3c8383caabf4e7b89863145a9f0e 60abea9798f47b918a9f38c66edfd88c526d20f6 2023-10-19T19:40:41+03:00 M. Yusuf Sarıgöz multimodal : add BakLLaVA conversion support (#3682)
cb33f43a2a9f5a5a5f8d290dd97c625d9ba97a2f e1675d133c31e1c8de2f06be7164e12c0ba6cf2c 2023-10-17T22:24:50+02:00 slaren fix embeddings when using CUDA (#3657)
940efa95fec0b8a98c226a889d2ad839dfeeae0d 11bff290458f12f020b588792707f76ec658a27a 2023-10-16T23:58:00+03:00 Georgi Gerganov llava : fix tokenization to not add bos between image embeddings and user prompt (#3645)
370359e5baf619f3a8d461023143d1494b1e8fde 9e24cc6e2e589d405bd1720c400f5b0b9d0ca3ee 2023-10-12T18:23:18+03:00 M. Yusuf Sarıgöz examples: support LLaVA v1.5 (multimodal model) (#3436)
f5f9121de140eff558f13b5c5e78a3a3b6b94377 11ea5c7d96f2c28e1c99659e08ec0a44574056e2 2023-10-10T09:50:23+02:00 Jan Ploski llm : add MPT support (#3417)
a8777ad84e00cda0399e827cdf971e2c3fab1da2 97af49fa395df77e4c18af0e1655b2fee67c9686 2023-10-06T14:16:38+01:00 pudepiedj parallel : add option to load external prompt file (#3416)
0e76a8992c8200237bbc6471a53fb8796b3872f7 2db94d98eda56982d80238840b0652b4137a2a84 2023-09-28T20:40:11+02:00 xaedes train : finetune LORA (#2632)
f56c418ab0a635c020bcb5bf44b8f00cb3c9e514 8185710a80531e9ee0c0cb99d3a9c9af1019ab67 2023-09-21T17:57:40+09:00 yuiseki embedding : update README.md (#3224)
4fe09dfe665c58a753dc9eb638dd4dca1cd35488 80291a1d02a07f7f66666fb576c5b1e75aa48b46 2023-09-16T03:02:13+08:00 Meng Zhang llama : add support for StarCoder model architectures (#3187)
980ab41afba96106cd29cdf3aa6f948c251cb71f e394084166baac09e8ee9a08a4686f907f7e5291 2023-09-14T09:47:00-07:00 dylan docker : add gpu image CI builds (#3103)
71d6975559acfd6c8407a4ef8275a9979c737765 b532a69b2fd08067f34f32f37a2fd9b37678a34a 2023-08-30T19:14:53+03:00 Henri Vasserman [Docker] fix tools.sh argument passing. (#2884)
44c117f41ee01c5ac8fb86bba041f08d8b87b46d 43033b7bb4858da4f591715b3babdf906c9b7cbc 2023-08-28T21:51:47+02:00 xaedes train : mem usage and other improvements (#2439)
c82742ac9cd96fd34aa961978805c1d8a361d589 28b2c996ca0ab90a5669946084f13443ec98e241 2023-08-25T11:18:48-04:00 Matt Pulver llama : add llama_beam_search() (#2267)
3f460a2b723c8b936ac29ecfd02f244b3adeba55 87e3733f24a85d894cc16e1cbdfa1ea1e81a76f3 2023-08-25T11:55:59+03:00 Georgi Gerganov cuda : add RoPE kernel for mode == 2 (NeoX) (#2760)
95385241a91a616788a3bb76d12c9b7b2379ca2d 335acd2ffd7b04501c6d8773ab9fcee6e7bf8639 2023-08-23T20:33:05+01:00 Olivier Chafik examples : restore the functionality to import llama2.c models (#2685)
bac66994cf356cf488078c056831396eb4ce31d5 519c981f8b65ee6c87c2965539685ced0a17223b 2023-08-22T19:14:09+03:00 Kawrakow Quantization imrovements for k_quants (#2707)
519c981f8b65ee6c87c2965539685ced0a17223b 1123f7fbdfb8012e46f05e903e6f675922916378 2023-08-22T16:03:12+02:00 slaren embedding : evaluate prompt in batches (#2713)
bbef28218fe827265716b66977719b9ee2b21165 5656d10599bd756dc0f17284e418e704200b43f3 2023-07-11T22:01:08+08:00 LostRuins Possible solution to allow K-quants on models with n_vocab!=32000 (#2148)
7f0e9a775ecc4c6ade271c217f63d6dc93e79eaa b472f3fca558b6335adbd87210ed58cfb5da37cb 2023-07-04T18:33:33-05:00 Nigel Bosch embd-input: Fix input embedding example unsigned int seed (#2105)
7ee76e45afae7f9a7a53e93393accfb5b36684e1 acc111caf93fc6681450924df9f99679c384c59e 2023-07-04T10:05:27-04:00 Tobias Lütke Simple webchat for server (#1998)
698efad5fbbf326f01288649b123eff5f79b417e 14a2cc71f62e45803ae70890ffbdeb0a172e6210 2023-07-04T01:50:12+02:00 Erik Scholz CI: make the brew update temporarily optional. (#2092)
cfa0750bc9dbc2d957a91b8ed09ab0035d8f3d4e 9d23589d638dc74577d5ff880e6d4248b795f12e 2023-06-28T23:53:37+08:00 ningshanwutuobang llama : support input embeddings directly (#1910)
20568fe60f00155fa25e92eb3a7f6b911d557967 18b35625c3c19c64b7818a12460ba5ddb006dfdc 2023-06-20T01:12:39+03:00 Henri Vasserman [Fix] Reenable server embedding endpoint (#1937)
ca7c3f4da5d144d4cd1dd44903552e6ba49b8ec8 b97ca431db35ec96a339a721acb1219c1dd78bed 2023-06-19T18:14:09+03:00 Kawrakow cuda : faster k-quants on older GPUs (#1930)
794db3e7b982fee37e3995db9c3a216a57ff65e3 5ddf7ea1fb42bac21026de2f77e0f9c069b92234 2023-06-17T07:53:04-04:00 Randall Fitzgerald Server Example Refactor and Improvements (#1570)
e32089b2c20b1b87b22912f4a8b93fe01647d5b9 2347e45e7bdb09c9a7d74b2c0bc86c2b65f0c343 2023-06-13T21:04:40+02:00 xaedes train : improved training-from-scratch example (#1652)
0e730dd23b0fb5f93dba574e0a48d9a69dc5dbae 3b126f654fceb4f5f195a1c2e825bb18e101188c 2023-05-29T06:45:50+02:00 Jiří Podivín Adding git in container package dependencies (#1621)
6456a4eb9f9c1f4de8f6908ef100daa78802ad00 cdd5350892b1d4e521e930c77341f858fcfcd433 2023-05-13T15:24:20+08:00 Rinne embedding : remove unused code (#1426)
b6e7f9b09e9c340ec97a2fae61c1eb8db861f2f9 50cb666b8a2e35a49b08c0f6bc81138c8f6f2ac1 2023-04-22T08:21:32+02:00 xaedes llama : add api for getting/setting the complete state: rng, logits, embedding and kv_cache (#1105)
a0c05164168297c04737936ad0cad849a512547a d8d4e865cd481b18f10508ffee35db903767ef5c 2023-04-02T15:13:03-07:00 bsilvereagle Remove torch GPU dependencies from the Docker.full image (#665)
e0670260fb50a882b37074112b1881fb0820cf77 28ba975aea1dcae2f31770516f5d542ff177771e 2023-03-28T18:34:35+03:00 Georgi Gerganov gitignore : add "embedding"
4b8efff0e3945090379aa2f897ff125c8f9cdbae 7e5395575a3360598f2565c73c8a2ec0c0abbdb8 2023-03-28T08:11:09+02:00 RJ Adriaansen Add embedding example to Makefile (#540)
03f7e335604b3d68f74995aa2ccb4955833ee423 55ad42af845127bd0eb0c1f36f327ecec83f4bca 2023-03-25T20:51:14+02:00 Georgi Gerganov Cleanup STL headers + fix embedding examples + minor stuff
a316a425d04027453dc0fd45f003b647c12f66f9 ecbe466a364876927994e2f1ec14f4d82301d201 2023-03-25T20:26:40+02:00 Georgi Gerganov Overhaul the examples structure
8d4a855c241ecb0f3ddc03447fe56002ebf27a37 b6b268d4415fd3b3e53f22b6619b724d4928f713 2023-03-24T08:05:13-07:00 Luciano Add embedding mode with arg flag. Currently working (#282)
16ffc013c62f22bdaa3cdc022d7a13fd952d73fc 486ae645fd3eda8b9d7413d5ff34fb65a3e337fb 2023-03-21T09:42:25-07:00 comex Importer for GPTQ quantized LLaMA models (#301)
0f1b21cb90ac6b84a9af70cafb8e13b5389e3b32 074bea2eb1f1349a0118239c4152914aecaa1be4 2023-03-20T18:05:20+01:00 Bernat Vadell Docker - Fix publish docker image in GitHub Registry (#235)
5cb63e2493c49bc2c3b9b355696e8dc26cdd0380 da5303c1ea68aa19db829c634f1e10d08d409680 2023-03-20T08:24:11Z Stephan Walter Add tqdm to Python requirements (#293)
2af23d30434a677c6416812eea52ccc0af65119c 904d2a8d6acd667c9633138d45a361d40fbf76d0 2023-03-17T10:47:06+01:00 Bernat Vadell 🚀 Dockerize llamacpp (#132)